本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
SageMaker HyperPod 集群事件参考
本页面提供了 Amazon SageMaker HyperPod 集群发出的所有结构化事件的完整参考。事件提供对集群、实例组和实例级操作的可见性,包括配置、扩展、修补和特定于 Orchestrator 的生命周期更改。
集群事件适用于设置为的 HyperPod NodeProvisioningMode集群Continuous。事件可通过ListClusterEvents和 DescribeClusterEvent API、 SageMaker AI 控制台的 “事件” 选项卡和 Amazon 进行访问 EventBridge。
集群事件记录
每个集群事件都以结构化记录表示,其中包含标识、时间、范围、严重性和特定于操作的元数据。以下示例显示了通过 DescribeClusterEvent API 和 Amazon 交付的完整事件记录 EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
事件记录字段
detail.EventDetails 对象包含以下字段:
| 字段 | 类型 | 必需 | 说明 |
|---|---|---|---|
EventId |
字符串 (UUID) | 是 | 事件的唯一标识符。 |
ClusterArn |
字符串 | 是 | 集群的 ARN。 HyperPod |
ClusterName |
字符串 | 是 | HyperPod 集群的名称。 |
EventTime |
Timestamp | 是 | 事件发生的时间(纪元毫秒)。 |
ResourceType |
字符串 | 是 | 事件范围:ClusterInstanceGroup、或Instance。 |
EventLevel |
字符串 | 是 | 严重性分类:InfoWarn、或Error。 |
Description |
字符串 | 否 | Human-readable 活动摘要。 |
InstanceGroupName |
字符串 | 否 | 实例组名称(当ResourceType为InstanceGroup或时出现Instance)。 |
InstanceId |
字符串 | 否 | EC2 实例 ID(ResourceType存在时出现Instance)。 |
EventDetails |
对象 | 否 | 特定于资源类型和操作的其他元数据。 |
事件等级
| 级别 | 含义 |
|---|---|
Info |
操作成功完成或进展正常。 |
Warn |
操作已完成,但出现非严重问题或可能需要 future 注意的情况。 |
Error |
操作失败或需要立即关注。 |
资源类型
| ResourceType | Scope | 示例事件 |
|---|---|---|
Cluster |
Whole-cluster 操作 | 集群 creation/update 已启动,集群操作失败 |
InstanceGroup |
实例组操作 | 扩展 started/completed、计划修补、FSx 生命周期 |
Instance |
单个实例操作 | EC2 配置、生命周期脚本执行、ENI 管理、终止 |
EventDetails 元数据
集群事件包括EventDetails字段中的一个EventMetadata对象,该对象除了事件描述所传达的内容之外,还提供特定于操作的上下文。的内容因资源类型和事件类型EventMetadata而异。有关完整的架构和支持的字段,请参阅 Amazon AI AP SageMaker I 参考EventMetadata中的。
EventBridge 信封字段
通过 Amazon 交付时 EventBridge,活动记录将用标准 EventBridge 信封包裹:
| 字段 | 说明 |
|---|---|
version |
EventBridge 架构版本(总是"0")。 |
id |
唯一 EventBridge 的事件 ID。 |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
Amazon 拥有集群的账户 ID。 |
time |
事件的 ISO 8601 时间戳。 |
region |
Amazon 集群所在的区域。 |
resources |
包含集群 ARN 的数组。 |
detail |
包含上述EventDetails对象。 |
常见事件(EKS 和 Slurm)
无论协调器如何,都会为所有 HyperPod 集群发出以下事件。描述列显示事件记录中字段的值,该Description字段在 API 响应和控制台的 “事件” 选项卡中显示该字段的值。
集群生命周期
| 事件 | 说明 |
|---|---|
| 集群操作已启动 | 集群<cluster-name><operation>已成功启动 |
| 集群操作启动失败 | 启动集群失败 <cluster-name><operation> |
| 集群操作已完成 | 集群<cluster-name><operation>成功完成 |
| 集群操作失败 | 集群<cluster-name><operation>失败 |
实例组生命周期
| 事件 | 说明 |
|---|---|
| 实例组操作已启动 | InstanceGroup <instance-group-name><operation>在集群中成功启动 <cluster-name> |
| 实例组操作启动失败 | 无法在<instance-group-name><operation>集群 InstanceGroup 中启动 <cluster-name> |
| 实例组操作已完成 | <instance-group-name><operation>集群中的实例组<cluster-name>已成功完成 |
| 实例组操作失败 | <instance-group-name><operation>集群中的实例组<cluster-name>失败 |
实例组网络配置
| 事件 | 说明 |
|---|---|
| 已找到网络配置 | <subnet-id>在 AZ 中找到了子网<availability-zone>, SecurityGroupIds<security-group-ids><instance-group-name>集群中有 IG 的子网 <cluster-name> |
| 网络配置失败 | 无法处理<instance-group-name>集群中 IG 的实例组网络配置详细信息 <cluster-name> |
| 已找到自定义 AMI 替代 | <ami-id><instance-group-name>在集群中找到了针对 IG 的自定义 AMI 替代 <cluster-name> |
| 自定义 AMI 覆盖失败 | 无法处理集<instance-group-name>群中 IG 的自定义 AMI 覆盖详细信息 <cluster-name> |
| 使用的平台网络配置 | 使用 HyperPod 平台为<instance-group-name>集群中的 IG 提供的网络配置 <cluster-name> |
| 网络配置已确定 | 已成功确定集群<instance-group-name>中 IG 的实例组网络配置 <cluster-name> |
创建实例
| 事件 | 说明 |
|---|---|
| 实例操作已启动 | 实例<operation>在集群<cluster-name>和 IG 中成功启动 <instance-group-name> |
| 实例操作启动失败 | 无法<operation>在集群<cluster-name>和 IG 中启动实例 <instance-group-name> |
| 已找到容量预留 | 已<reservation-id><cluster-name><instance-group-name>使用预留容量找到集群和 IG 的 CapacityReservation ID |
| 未找到容量预留 | 未 CapacityReservation 找到<cluster-name><instance-group-name>使用按需池的集群和 IG |
| 实例负载设置失败 | 无法处理群 CapacityReservationDetails 集<cluster-name>和 IG <instance-group-name> |
| 客户 ENI 已创建 | 成功创建客户 ENI,例如在集群<cluster-name>和 IG 中 <instance-group-name> |
| 客户 ENI 创建失败 | 无法在集群<cluster-name>和 IG 中创建客户 ENI <instance-group-name> |
| 已预配置 EC2 实例 | <instance-id><cluster-name>在集群和 IG 中成功配置 EC2 实例 <instance-group-name> |
| 创建 EC2 实例失败 | 未能在集群和 <cluster-name>IG 中配置 EC2 实例 <instance-group-name> |
| 生命周期脚本状态已更新 | EC2 实例的实例生命周期脚本执行<instance-id>有 <status> |
| 生命周期脚本状态更新失败 | 无法更新的实例生命周期脚本执行状态 EC2InstanceId <instance-id> |
| 实例创建失败,出现生命周期日志 | EC2 实例的实例生命周期脚本执行<instance-id>失败。要查看生命周期脚本日志,请访问日志组... |
| 已成功清理未使用的 ENI | 成功删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name> |
| 未使用的 ENI 清理失败 | 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name> |
删除实例
| 事件 | 说明 |
|---|---|
| EC2 实例正在终止 | <instance-id>集群和 <cluster-name>IG 中的 EC2 实例目前正在终止 <instance-group-name> |
| EC2 实例终止失败 | 无法终止<instance-id>集群<cluster-name>和 IG 中的 EC2 实例 <instance-group-name> |
| 客户 ENI 已删除 | 成功删除<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的客户 ENI <instance-group-name> |
| 删除客户 ENI 失败 | 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例的客户 ENI <instance-group-name> |
实例重启
| 事件 | 说明 |
|---|---|
| EC2 实例正在重启 | <instance-id>目前正在集群和 <cluster-name>IG 上重启 EC2 实例 <instance-group-name> |
| EC2 实例重启请求失败 | 未能提交<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的重启请求 <instance-group-name> |
实例操作(通用)
| 事件 | 说明 |
|---|---|
| 实例操作已完成 | <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>已成功完成 |
| 实例操作失败 | <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>出现故障 |
实例替换
| 事件 | 说明 |
|---|---|
| 实例替换已开始 | <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分,实例正在启动 <instance-group-name> |
| 实例替换启动失败 | <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分,实例无法启动 <instance-group-name> |
| 实例替换已完成 | <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分,实例成功完成 <instance-group-name> |
| 实例替换失败 | <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分,实例失败 <instance-group-name> |
FSx 文件系统生命周期
| 事件 | 说明 |
|---|---|
| FSx 已开始创建 | <instance-group-name>已开始在集群中为 IG 创建 FSx <cluster-name> |
| 创建 FSx 失败 | <instance-group-name>无法在集群中为 IG 创建 FSx <cluster-name> |
| FSx 创建已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 创建 <cluster-name> |
| 已开始删除 FSx | <instance-group-name>已开始在集群中删除 IG 的 FSx <cluster-name> |
| 删除 FSx 失败 | <instance-group-name>无法在集群中删除 IG 的 FSx <cluster-name> |
| FSx 的删除已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 删除操作 <cluster-name> |
| FSx 更新已开始 | <instance-group-name>集群中 IG 的 FSx 更新已启动 <cluster-name> |
| FSx 更新失败 | <instance-group-name>无法在集群中更新 IG 的 FSx <cluster-name> |
| FSx 更新已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 更新 <cluster-name> |
修补(常见步骤)
操作期间,EKS 和 Slurm 集群都会发出这些修补事件。UpdateClusterSoftware
| 事件 | 说明 |
|---|---|
| 已计划对实例组进行修补 | InstanceGroup <instance-group-name>in Cluster <cluster-name>已计划 UpdateClusterSoftware 到最新。 |
| 实例组修补计划失败 | 未能<instance-group-name>在集群中 UpdateClusterSoftware 安排 IG <cluster-name>。 |
| 实例组补丁已启动 | UpdateClusterSoftware <instance-group-name><cluster-name>使用<strategy>策略为集群中的 IG 启动。 |
| 启动实例组修补失败 | 无法<instance-group-name>在群集中启动 UpdateClusterSoftware IG <cluster-name>。 |
| 已选择下一个修补批次 | 为<instance-group-name>集群中的 IG 选择了下次更新批次<cluster-name>。 |
| 下次修补批次选择失败 | 未能在<instance-group-name>集群中为 IG 选择下一个更新批次<cluster-name>。 |
| 失败的实例排队等候替换 | <instance-group-name>集群中 IG 中的失败实例<cluster-name>排队等候节点更换。 |
| 失败的实例替换队列失败 | 无法在<instance-group-name>集群的 IG 中对实例进行节点替换<cluster-name>。 |
| 实例组修补已完成 | UpdateClusterSoftware 已成功完成<instance-group-name>集群中的 IG <cluster-name>。 |
| 完成实例组修补失败 | 无法<instance-group-name>在群集中完成 UpdateClusterSoftware IG <cluster-name>。 |
| 根卷更换已开始 | <instance-id>IG 中已开始替换 Instance 的根卷<instance-group-name>。 |
| 根卷更换失败 | 无法<instance-id>在 IG 中启动实例的根卷更换<instance-group-name>。 |
| 实例修补成功 | <instance-id>IG 中的实例<instance-group-name>已成功更新。 |
EKS-specific 事件
以下事件仅针对使用 Amazon EKS 编排的 HyperPod 集群发出。
访问入口管理
| 事件 | 说明 |
|---|---|
| SLR 访问权限输入操作成功 | <operation>成功进入集群的 SLR 访问权限 <cluster-name> |
| SLR 访问权限输入操作失败 | 群集的 SLR 访问入口<operation>失败 <cluster-name> |
| EKS 访问条目操作成功 | <operation>成功进入集群的 EKS 访问入口 <cluster-name> |
| EKS 访问条目操作失败 | <operation>集群的 EKS 访问条目失败 <cluster-name> |
Kubernetes 配置更新
| 事件 | 说明 |
|---|---|
| Kubernetes 配置更新成功 | <cluster-name>成功更新了 Kubernetes 配置,例如<instance-id>在集群和 IG 中 <instance-group-name> |
| Kubernetes 配置更新失败 | <cluster-name>无法更新 Kubernetes 配置,例如<instance-id>在集群和 IG 中 <instance-group-name> |
Karpenter 自动缩放
| 事件 | 说明 |
|---|---|
| 自动缩放操作成功 | AutoScaling <operation><status>成功进入集群 <cluster-name> |
| 自动缩放操作失败 | 未能进入<operation> AutoScaling 集群 <cluster-name> |
| Karpenter CRD 安装成功 | CustomResourceDefinition 在 EKS 集群中成功完成安装 <cluster-name> |
| Karpenter CRD 安装失败 | CustomResourceDefinition EKS 集群安装失败 <cluster-name> |
| Karpenter SLR 访问策略更新成功 | 在 <operation>EKS 集群中<cluster-name>成功 AmazonSageMakerHyperPodServiceRole 使用访问条目的访问策略 |
| Karpenter SLR 访问策略更新失败 | 无法在 E <operation>KS 集群中使用 AmazonSageMakerHyperPodServiceRole 访问条目访问策略 <cluster-name> |
修补 — EKS 实例级别
| 事件 | 说明 |
|---|---|
| 实例修补准备成功 | <instance-id>IG 中的实例已被<instance-group-name>封锁,吊舱已被驱逐。 |
| 已跳过实例修补(违规 PDB) | UpdateClusterSoftware 例如,<instance-id>在 IG 中,<instance-group-name>由于 PodDisruptionBudget 限制而跳过。 |
| 实例修补准备失败 | 未能<instance-id>在 IG 中<instance-group-name>为其准备实例 UpdateClusterSoftware。 |
| 实例已恢复到可调度状态 | <instance-id>IG 中的实例<instance-group-name>已恢复到可调度状态。 |
| 实例恢复到可调度任务失败 | 无法将 <instance-id>IG 中的实例恢复<instance-group-name>到可调度状态。 |
修补 — EKS 回滚
| 事件 | 说明 |
|---|---|
| 烘焙时间开始了 | <instance-group-name>集群中 IG 的烘焙期已开始<cluster-name>。监视警报 [<alarm-names>] <duration>几秒钟。 |
| 烘焙时间已完成 | <instance-group-name>集群中 IG 的烘焙周期已完成<cluster-name>。在 <duration>-second 烘焙期间未触发任何警报。 |
| 烘焙时间警报已触发 | <instance-group-name>集群中 IG 的烘焙周期失败<cluster-name>。警报 [<alarm-names>] 已进入警报状态。正在启动自动回滚。 |
| 烘焙时间评估失败 | 无法评估集<instance-group-name>群中 IG 在烘焙期间的警报<cluster-name>。 |
| 实例组修补回滚已启动 | UpdateClusterSoftware <instance-group-name>群集中的 IG 失败<cluster-name>。正在启动回滚。 |
| 实例组修补回滚失败 | <instance-group-name><cluster-name>集群中的 IG 回滚失败。某些实例可能处于 FailedMaintenance 状态。 |
| 实例修补回滚已启动 | <instance-id>IG 中的实例<instance-group-name>更新失败。已启动回滚。 |
| 实例修补回滚成功 | <instance-id>IG 中的实例<instance-group-name>成功回滚到之前的 AMI。 |
| 实例修补回滚失败 | UpdateClusterSoftware <instance-group-name>例如,<instance-id>在 IG 中回滚失败。 |
Slurm-specific 事件
以下事件仅针对使用 Slurm 编排的 HyperPod 集群发出。
| 事件 | 说明 |
|---|---|
| 已找到置备参数 | 在控制器组的 S3 路径中找到了配置_parameters.json LifeCycleScript <instance-group-name> |
| 未找到配置参数 | 在 S3 路径中找不到控制器组的 provisioning_parameters.json LifeCycleScript <instance-group-name> |
| Slurm munge 密钥已创建 | 成功创建并存储 munge 密钥 |
| Slurm 漂移验证通过 | Slurm 配置偏差验证已通过 |
| 检测到泥浆漂移 | 检测到 Slurm 配置偏差:<drift-details> |
| Slurm 集群回滚已完成 | 集群创建失败:控制器和登录节点未在预期的时间内准备就绪 |
| Slurm 重新配置成功 | Slurm 已成功重新配置。Slurm 配置已更新以匹配所需状态 |
EventBridge 整合
HyperPod EventBridge 使用三种详细信息类型向 Amazon 发送集群事件:
| 细节类型 | 说明 |
|---|---|
SageMaker HyperPod Cluster Event |
用于配置、扩展、修补和协调器特定操作的操作事件。包括EventLevel用于严重性筛选。 |
SageMaker HyperPod Cluster State Change |
Cluster-level 状态转换(例如,正在创建到 InService)。包括完整的集群配置。 |
SageMaker HyperPod Cluster Node Health
Event |
来自健康监控代理 (HMA) 的 HyperPod 健康监控事件。包括健康状态、原因、修复措施和建议。 |
事件模式示例
所有 HyperPod 集群事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
仅限错误事件(用于警报):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
特定集群的事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
节点运行状况事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API 参考
-
ListClusterEvents— 通过筛选、排序和分页列出事件
-
DescribeClusterEvent— 获取特定活动的完整详情
-
ClusterEventSummary— 事件摘要数据类型
-
ClusterEventDetail— 事件详细信息数据类型
另请参阅
-
SageMaker HyperPod Slurm 集群事件— 包含 CLI 用法和常见场景的 Slurm 集群事件
-
SageMaker HyperPod EKS 集群事件— 包含 CLI 使用情况和常见场景的 EKS 集群事件