View a markdown version of this page

SageMaker HyperPod 集群事件参考 - 亚马逊 SageMaker AI
Amazon Web Services 文档中描述的 Amazon Web Services 服务或功能可能因区域而异。要查看适用于中国区域的差异,请参阅 中国的 Amazon Web Services 服务入门 (PDF)

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

SageMaker HyperPod 集群事件参考

本页面提供了 Amazon SageMaker HyperPod 集群发出的所有结构化事件的完整参考。事件提供对集群、实例组和实例级操作的可见性,包括配置、扩展、修补和特定于 Orchestrator 的生命周期更改。

集群事件适用于设置为的 HyperPod NodeProvisioningMode集群Continuous。事件可通过ListClusterEventsDescribeClusterEvent API、 SageMaker AI 控制台的 “事件” 选项卡和 Amazon 进行访问 EventBridge。

集群事件记录

每个集群事件都以结构化记录表示,其中包含标识、时间、范围、严重性和特定于操作的元数据。以下示例显示了通过 DescribeClusterEvent API 和 Amazon 交付的完整事件记录 EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

事件记录字段

detail.EventDetails 对象包含以下字段:

字段 类型 必需 说明
EventId 字符串 (UUID) 事件的唯一标识符。
ClusterArn 字符串 集群的 ARN。 HyperPod
ClusterName 字符串 HyperPod 集群的名称。
EventTime Timestamp 事件发生的时间(纪元毫秒)。
ResourceType 字符串 事件范围:ClusterInstanceGroup、或Instance
EventLevel 字符串 严重性分类:InfoWarn、或Error
Description 字符串 Human-readable 活动摘要。
InstanceGroupName 字符串 实例组名称(当ResourceTypeInstanceGroup或时出现Instance)。
InstanceId 字符串 EC2 实例 ID(ResourceType存在时出现Instance)。
EventDetails 对象 特定于资源类型和操作的其他元数据。

事件等级

级别 含义
Info 操作成功完成或进展正常。
Warn 操作已完成,但出现非严重问题或可能需要 future 注意的情况。
Error 操作失败或需要立即关注。

资源类型

ResourceType Scope 示例事件
Cluster Whole-cluster 操作 集群 creation/update 已启动,集群操作失败
InstanceGroup 实例组操作 扩展 started/completed、计划修补、FSx 生命周期
Instance 单个实例操作 EC2 配置、生命周期脚本执行、ENI 管理、终止

EventDetails 元数据

集群事件包括EventDetails字段中的一个EventMetadata对象,该对象除了事件描述所传达的内容之外,还提供特定于操作的上下文。的内容因资源类型和事件类型EventMetadata而异。有关完整的架构和支持的字段,请参阅 Amazon AI AP SageMaker I 参考EventMetadata中的。

EventBridge 信封字段

通过 Amazon 交付时 EventBridge,活动记录将用标准 EventBridge 信封包裹:

字段 说明
version EventBridge 架构版本(总是"0")。
id 唯一 EventBridge 的事件 ID。
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account Amazon 拥有集群的账户 ID。
time 事件的 ISO 8601 时间戳。
region Amazon 集群所在的区域。
resources 包含集群 ARN 的数组。
detail 包含上述EventDetails对象。

常见事件(EKS 和 Slurm)

无论协调器如何,都会为所有 HyperPod 集群发出以下事件。描述列显示事件记录中字段的值,该Description字段在 API 响应和控制台的 “事件” 选项卡中显示该字段的值。

集群生命周期

事件 说明
集群操作已启动 集群<cluster-name><operation>已成功启动
集群操作启动失败 启动集群失败 <cluster-name><operation>
集群操作已完成 集群<cluster-name><operation>成功完成
集群操作失败 集群<cluster-name><operation>失败

实例组生命周期

事件 说明
实例组操作已启动 InstanceGroup <instance-group-name><operation>在集群中成功启动 <cluster-name>
实例组操作启动失败 无法在<instance-group-name><operation>集群 InstanceGroup 中启动 <cluster-name>
实例组操作已完成 <instance-group-name><operation>集群中的实例组<cluster-name>已成功完成
实例组操作失败 <instance-group-name><operation>集群中的实例组<cluster-name>失败

实例组网络配置

事件 说明
已找到网络配置 <subnet-id>在 AZ 中找到了子网<availability-zone>, SecurityGroupIds<security-group-ids><instance-group-name>集群中有 IG 的子网 <cluster-name>
网络配置失败 无法处理<instance-group-name>集群中 IG 的实例组网络配置详细信息 <cluster-name>
已找到自定义 AMI 替代 <ami-id><instance-group-name>在集群中找到了针对 IG 的自定义 AMI 替代 <cluster-name>
自定义 AMI 覆盖失败 无法处理集<instance-group-name>群中 IG 的自定义 AMI 覆盖详细信息 <cluster-name>
使用的平台网络配置 使用 HyperPod 平台为<instance-group-name>集群中的 IG 提供的网络配置 <cluster-name>
网络配置已确定 已成功确定集群<instance-group-name>中 IG 的实例组网络配置 <cluster-name>

创建实例

事件 说明
实例操作已启动 实例<operation>在集群<cluster-name>和 IG 中成功启动 <instance-group-name>
实例操作启动失败 无法<operation>在集群<cluster-name>和 IG 中启动实例 <instance-group-name>
已找到容量预留 已<reservation-id><cluster-name><instance-group-name>使用预留容量找到集群和 IG 的 CapacityReservation ID
未找到容量预留 未 CapacityReservation 找到<cluster-name><instance-group-name>使用按需池的集群和 IG
实例负载设置失败 无法处理群 CapacityReservationDetails 集<cluster-name>和 IG <instance-group-name>
客户 ENI 已创建 成功创建客户 ENI,例如在集群<cluster-name>和 IG 中 <instance-group-name>
客户 ENI 创建失败 无法在集群<cluster-name>和 IG 中创建客户 ENI <instance-group-name>
已预配置 EC2 实例 <instance-id><cluster-name>在集群和 IG 中成功配置 EC2 实例 <instance-group-name>
创建 EC2 实例失败 未能在集群和 <cluster-name>IG 中配置 EC2 实例 <instance-group-name>
生命周期脚本状态已更新 EC2 实例的实例生命周期脚本执行<instance-id>有 <status>
生命周期脚本状态更新失败 无法更新的实例生命周期脚本执行状态 EC2InstanceId <instance-id>
实例创建失败,出现生命周期日志 EC2 实例的实例生命周期脚本执行<instance-id>失败。要查看生命周期脚本日志,请访问日志组...
已成功清理未使用的 ENI 成功删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name>
未使用的 ENI 清理失败 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name>

删除实例

事件 说明
EC2 实例正在终止 <instance-id>集群和 <cluster-name>IG 中的 EC2 实例目前正在终止 <instance-group-name>
EC2 实例终止失败 无法终止<instance-id>集群<cluster-name>和 IG 中的 EC2 实例 <instance-group-name>
客户 ENI 已删除 成功删除<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的客户 ENI <instance-group-name>
删除客户 ENI 失败 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例的客户 ENI <instance-group-name>

实例重启

事件 说明
EC2 实例正在重启 <instance-id>目前正在集群和 <cluster-name>IG 上重启 EC2 实例 <instance-group-name>
EC2 实例重启请求失败 未能提交<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的重启请求 <instance-group-name>

实例操作(通用)

事件 说明
实例操作已完成 <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>已成功完成
实例操作失败 <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>出现故障

实例替换

事件 说明
实例替换已开始 <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分,实例正在启动 <instance-group-name>
实例替换启动失败 <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分,实例无法启动 <instance-group-name>
实例替换已完成 <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分,实例成功完成 <instance-group-name>
实例替换失败 <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分,实例失败 <instance-group-name>

FSx 文件系统生命周期

事件 说明
FSx 已开始创建 <instance-group-name>已开始在集群中为 IG 创建 FSx <cluster-name>
创建 FSx 失败 <instance-group-name>无法在集群中为 IG 创建 FSx <cluster-name>
FSx 创建已完成 <instance-group-name>已成功完成集群中 IG 的 FSx 创建 <cluster-name>
已开始删除 FSx <instance-group-name>已开始在集群中删除 IG 的 FSx <cluster-name>
删除 FSx 失败 <instance-group-name>无法在集群中删除 IG 的 FSx <cluster-name>
FSx 的删除已完成 <instance-group-name>已成功完成集群中 IG 的 FSx 删除操作 <cluster-name>
FSx 更新已开始 <instance-group-name>集群中 IG 的 FSx 更新已启动 <cluster-name>
FSx 更新失败 <instance-group-name>无法在集群中更新 IG 的 FSx <cluster-name>
FSx 更新已完成 <instance-group-name>已成功完成集群中 IG 的 FSx 更新 <cluster-name>

修补(常见步骤)

操作期间,EKS 和 Slurm 集群都会发出这些修补事件。UpdateClusterSoftware

事件 说明
已计划对实例组进行修补 InstanceGroup <instance-group-name>in Cluster <cluster-name>已计划 UpdateClusterSoftware 到最新。
实例组修补计划失败 未能<instance-group-name>在集群中 UpdateClusterSoftware 安排 IG <cluster-name>。
实例组补丁已启动 UpdateClusterSoftware <instance-group-name><cluster-name>使用<strategy>策略为集群中的 IG 启动。
启动实例组修补失败 无法<instance-group-name>在群集中启动 UpdateClusterSoftware IG <cluster-name>。
已选择下一个修补批次 为<instance-group-name>集群中的 IG 选择了下次更新批次<cluster-name>。
下次修补批次选择失败 未能在<instance-group-name>集群中为 IG 选择下一个更新批次<cluster-name>。
失败的实例排队等候替换 <instance-group-name>集群中 IG 中的失败实例<cluster-name>排队等候节点更换。
失败的实例替换队列失败 无法在<instance-group-name>集群的 IG 中对实例进行节点替换<cluster-name>。
实例组修补已完成 UpdateClusterSoftware 已成功完成<instance-group-name>集群中的 IG <cluster-name>。
完成实例组修补失败 无法<instance-group-name>在群集中完成 UpdateClusterSoftware IG <cluster-name>。
根卷更换已开始 <instance-id>IG 中已开始替换 Instance 的根卷<instance-group-name>。
根卷更换失败 无法<instance-id>在 IG 中启动实例的根卷更换<instance-group-name>。
实例修补成功 <instance-id>IG 中的实例<instance-group-name>已成功更新。

EKS-specific 事件

以下事件仅针对使用 Amazon EKS 编排的 HyperPod 集群发出。

访问入口管理

事件 说明
SLR 访问权限输入操作成功 <operation>成功进入集群的 SLR 访问权限 <cluster-name>
SLR 访问权限输入操作失败 群集的 SLR 访问入口<operation>失败 <cluster-name>
EKS 访问条目操作成功 <operation>成功进入集群的 EKS 访问入口 <cluster-name>
EKS 访问条目操作失败 <operation>集群的 EKS 访问条目失败 <cluster-name>

Kubernetes 配置更新

事件 说明
Kubernetes 配置更新成功 <cluster-name>成功更新了 Kubernetes 配置,例如<instance-id>在集群和 IG 中 <instance-group-name>
Kubernetes 配置更新失败 <cluster-name>无法更新 Kubernetes 配置,例如<instance-id>在集群和 IG 中 <instance-group-name>

Karpenter 自动缩放

事件 说明
自动缩放操作成功 AutoScaling <operation><status>成功进入集群 <cluster-name>
自动缩放操作失败 未能进入<operation> AutoScaling 集群 <cluster-name>
Karpenter CRD 安装成功 CustomResourceDefinition 在 EKS 集群中成功完成安装 <cluster-name>
Karpenter CRD 安装失败 CustomResourceDefinition EKS 集群安装失败 <cluster-name>
Karpenter SLR 访问策略更新成功 在 <operation>EKS 集群中<cluster-name>成功 AmazonSageMakerHyperPodServiceRole 使用访问条目的访问策略
Karpenter SLR 访问策略更新失败 无法在 E <operation>KS 集群中使用 AmazonSageMakerHyperPodServiceRole 访问条目访问策略 <cluster-name>

修补 — EKS 实例级别

事件 说明
实例修补准备成功 <instance-id>IG 中的实例已被<instance-group-name>封锁,吊舱已被驱逐。
已跳过实例修补(违规 PDB) UpdateClusterSoftware 例如,<instance-id>在 IG 中,<instance-group-name>由于 PodDisruptionBudget 限制而跳过。
实例修补准备失败 未能<instance-id>在 IG 中<instance-group-name>为其准备实例 UpdateClusterSoftware。
实例已恢复到可调度状态 <instance-id>IG 中的实例<instance-group-name>已恢复到可调度状态。
实例恢复到可调度任务失败 无法将 <instance-id>IG 中的实例恢复<instance-group-name>到可调度状态。

修补 — EKS 回滚

事件 说明
烘焙时间开始了 <instance-group-name>集群中 IG 的烘焙期已开始<cluster-name>。监视警报 [<alarm-names>] <duration>几秒钟。
烘焙时间已完成 <instance-group-name>集群中 IG 的烘焙周期已完成<cluster-name>。在 <duration>-second 烘焙期间未触发任何警报。
烘焙时间警报已触发 <instance-group-name>集群中 IG 的烘焙周期失败<cluster-name>。警报 [<alarm-names>] 已进入警报状态。正在启动自动回滚。
烘焙时间评估失败 无法评估集<instance-group-name>群中 IG 在烘焙期间的警报<cluster-name>。
实例组修补回滚已启动 UpdateClusterSoftware <instance-group-name>群集中的 IG 失败<cluster-name>。正在启动回滚。
实例组修补回滚失败 <instance-group-name><cluster-name>集群中的 IG 回滚失败。某些实例可能处于 FailedMaintenance 状态。
实例修补回滚已启动 <instance-id>IG 中的实例<instance-group-name>更新失败。已启动回滚。
实例修补回滚成功 <instance-id>IG 中的实例<instance-group-name>成功回滚到之前的 AMI。
实例修补回滚失败 UpdateClusterSoftware <instance-group-name>例如,<instance-id>在 IG 中回滚失败。

Slurm-specific 事件

以下事件仅针对使用 Slurm 编排的 HyperPod 集群发出。

事件 说明
已找到置备参数 在控制器组的 S3 路径中找到了配置_parameters.json LifeCycleScript <instance-group-name>
未找到配置参数 在 S3 路径中找不到控制器组的 provisioning_parameters.json LifeCycleScript <instance-group-name>
Slurm munge 密钥已创建 成功创建并存储 munge 密钥
Slurm 漂移验证通过 Slurm 配置偏差验证已通过
检测到泥浆漂移 检测到 Slurm 配置偏差:<drift-details>
Slurm 集群回滚已完成 集群创建失败:控制器和登录节点未在预期的时间内准备就绪
Slurm 重新配置成功 Slurm 已成功重新配置。Slurm 配置已更新以匹配所需状态

EventBridge 整合

HyperPod EventBridge 使用三种详细信息类型向 Amazon 发送集群事件:

细节类型 说明
SageMaker HyperPod Cluster Event 用于配置、扩展、修补和协调器特定操作的操作事件。包括EventLevel用于严重性筛选。
SageMaker HyperPod Cluster State Change Cluster-level 状态转换(例如,正在创建到 InService)。包括完整的集群配置。
SageMaker HyperPod Cluster Node Health Event 来自健康监控代理 (HMA) 的 HyperPod 健康监控事件。包括健康状态、原因、修复措施和建议。

事件模式示例

所有 HyperPod 集群事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

仅限错误事件(用于警报):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

特定集群的事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

节点运行状况事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

API 参考

另请参阅