

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# SageMaker HyperPod 集群事件参考
<a name="sagemaker-hyperpod-cluster-events-reference"></a>

本页面提供了 Amazon SageMaker HyperPod 集群发出的所有结构化事件的完整参考。事件提供对集群、实例组和实例级操作的可见性，包括配置、扩展、修补和特定于 Orchestrator 的生命周期更改。

集群事件适用于设置为的 HyperPod `NodeProvisioningMode`集群`Continuous`。事件可通过`ListClusterEvents`和 `DescribeClusterEvent` API、 SageMaker AI 控制台的 “**事件**” 选项卡和 Amazon 进行访问 EventBridge。

## 集群事件记录
<a name="sagemaker-hyperpod-cluster-events-record"></a>

每个集群事件都以结构化记录表示，其中包含标识、时间、范围、严重性和特定于操作的元数据。以下示例显示了通过 `DescribeClusterEvent` API 和 Amazon 交付的完整事件记录 EventBridge：

```
{
  "version": "0",
  "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c",
  "detail-type": "SageMaker HyperPod Cluster Event",
  "source": "aws.sagemaker",
  "account": "111122223333",
  "time": "2026-06-01T17:20:25Z",
  "region": "us-west-2",
  "resources": [
    "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster"
  ],
  "detail": {
    "EventDetails": {
      "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205",
      "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster",
      "ClusterName": "sample-cluster",
      "InstanceGroupName": "p5Inst",
      "InstanceId": "i-0391f86fa0fe0d465",
      "ResourceType": "Instance",
      "EventTime": 1748794825350,
      "EventLevel": "Error",
      "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed",
      "EventDetails": {
        "EventMetadata": {
          "Instance": {
            "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.",
            "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e"
          }
        }
      }
    }
  }
}
```

### 事件记录字段
<a name="sagemaker-hyperpod-cluster-events-record-fields"></a>

`detail.EventDetails` 对象包含以下字段：


| 字段 | 类型 | 必需 | 说明 | 
| --- | --- | --- | --- | 
| EventId | 字符串 (UUID) | 是 | 事件的唯一标识符。 | 
| ClusterArn | 字符串 | 是 | 集群的 ARN。 HyperPod  | 
| ClusterName | 字符串 | 是 |  HyperPod 集群的名称。 | 
| EventTime | Timestamp | 是 | 事件发生的时间（纪元毫秒）。 | 
| ResourceType | 字符串 | 是 | 事件范围：ClusterInstanceGroup、或Instance。 | 
| EventLevel | 字符串 | 是 | 严重性分类：InfoWarn、或Error。 | 
| Description | 字符串 | 否 | Human-readable 活动摘要。 | 
| InstanceGroupName | 字符串 | 否 | 实例组名称（当ResourceType为InstanceGroup或时出现Instance）。 | 
| InstanceId | 字符串 | 否 | EC2 实例 ID（ResourceType存在时出现Instance）。 | 
| EventDetails | 对象 | 否 | 特定于资源类型和操作的其他元数据。 | 

### 事件等级
<a name="sagemaker-hyperpod-cluster-events-levels"></a>


| 级别 | 含义 | 
| --- | --- | 
| Info | 操作成功完成或进展正常。 | 
| Warn | 操作已完成，但出现非严重问题或可能需要 future 注意的情况。 | 
| Error | 操作失败或需要立即关注。 | 

### 资源类型
<a name="sagemaker-hyperpod-cluster-events-resource-types"></a>


| ResourceType | Scope | 示例事件 | 
| --- | --- | --- | 
| Cluster | Whole-cluster 操作 | 集群 creation/update 已启动，集群操作失败 | 
| InstanceGroup | 实例组操作 | 扩展 started/completed、计划修补、FSx 生命周期 | 
| Instance | 单个实例操作 | EC2 配置、生命周期脚本执行、ENI 管理、终止 | 

### EventDetails 元数据
<a name="sagemaker-hyperpod-cluster-events-metadata"></a>

集群事件包括`EventDetails`字段中的一个`EventMetadata`对象，该对象除了事件描述所传达的内容之外，还提供特定于操作的上下文。的内容因资源类型和事件类型`EventMetadata`而异。有关完整的架构和支持的字段，请参阅 Amazon AI AP SageMaker I 参考[EventMetadata](https://docs.amazonaws.cn/sagemaker/latest/APIReference/API_EventMetadata.html)中的。

### EventBridge 信封字段
<a name="sagemaker-hyperpod-cluster-events-eventbridge-envelope"></a>

通过 Amazon 交付时 EventBridge，活动记录将用标准 EventBridge 信封包裹：


| 字段 | 说明 | 
| --- | --- | 
| version | EventBridge 架构版本（总是"0"）。 | 
| id | 唯一 EventBridge 的事件 ID。 | 
| detail-type | SageMaker HyperPod Cluster Event | 
| source | aws.sagemaker | 
| account | Amazon 拥有集群的账户 ID。 | 
| time | 事件的 ISO 8601 时间戳。 | 
| region | Amazon 集群所在的区域。 | 
| resources | 包含集群 ARN 的数组。 | 
| detail | 包含上述EventDetails对象。 | 

## 常见事件（EKS 和 Slurm）
<a name="sagemaker-hyperpod-cluster-events-common"></a>

无论协调器如何，都会为所有 HyperPod 集群发出以下事件。**描述**列显示事件记录中字段的值，该`Description`字段在 API 响应和控制台的 “**事件**” 选项卡中显示该字段的值。

### 集群生命周期
<a name="sagemaker-hyperpod-cluster-events-common-cluster"></a>


| 事件 | 说明 | 
| --- | --- | 
| 集群操作已启动 | 集群<cluster-name><operation>已成功启动 | 
| 集群操作启动失败 | 启动集群失败 <cluster-name><operation> | 
| 集群操作已完成 | 集群<cluster-name><operation>成功完成 | 
| 集群操作失败 | 集群<cluster-name><operation>失败 | 

### 实例组生命周期
<a name="sagemaker-hyperpod-cluster-events-common-ig"></a>


| 事件 | 说明 | 
| --- | --- | 
| 实例组操作已启动 | InstanceGroup <instance-group-name><operation>在集群中成功启动 <cluster-name> | 
| 实例组操作启动失败 | 无法在<instance-group-name><operation>集群 InstanceGroup 中启动 <cluster-name> | 
| 实例组操作已完成 | <instance-group-name><operation>集群中的实例组<cluster-name>已成功完成 | 
| 实例组操作失败 | <instance-group-name><operation>集群中的实例组<cluster-name>失败 | 

### 实例组网络配置
<a name="sagemaker-hyperpod-cluster-events-common-network"></a>


| 事件 | 说明 | 
| --- | --- | 
| 已找到网络配置 | <subnet-id>在 AZ 中找到了子网<availability-zone>， SecurityGroupIds<security-group-ids><instance-group-name>集群中有 IG 的子网 <cluster-name> | 
| 网络配置失败 | 无法处理<instance-group-name>集群中 IG 的实例组网络配置详细信息 <cluster-name> | 
| 已找到自定义 AMI 替代 | <ami-id><instance-group-name>在集群中找到了针对 IG 的自定义 AMI 替代 <cluster-name> | 
| 自定义 AMI 覆盖失败 | 无法处理集<instance-group-name>群中 IG 的自定义 AMI 覆盖详细信息 <cluster-name> | 
| 使用的平台网络配置 | 使用 HyperPod 平台为<instance-group-name>集群中的 IG 提供的网络配置 <cluster-name> | 
| 网络配置已确定 | 已成功确定集群<instance-group-name>中 IG 的实例组网络配置 <cluster-name> | 

### 创建实例
<a name="sagemaker-hyperpod-cluster-events-common-instance-creation"></a>


| 事件 | 说明 | 
| --- | --- | 
| 实例操作已启动 | 实例<operation>在集群<cluster-name>和 IG 中成功启动 <instance-group-name> | 
| 实例操作启动失败 | 无法<operation>在集群<cluster-name>和 IG 中启动实例 <instance-group-name> | 
| 已找到容量预留 | 已<reservation-id><cluster-name><instance-group-name>使用预留容量找到集群和 IG 的 CapacityReservation ID | 
| 未找到容量预留 | 未 CapacityReservation 找到<cluster-name><instance-group-name>使用按需池的集群和 IG | 
| 实例负载设置失败 | 无法处理群 CapacityReservationDetails 集<cluster-name>和 IG <instance-group-name> | 
| 客户 ENI 已创建 | 成功创建客户 ENI，例如在集群<cluster-name>和 IG 中 <instance-group-name> | 
| 客户 ENI 创建失败 | 无法在集群<cluster-name>和 IG 中创建客户 ENI <instance-group-name> | 
| 已预配置 EC2 实例 | <instance-id><cluster-name>在集群和 IG 中成功配置 EC2 实例 <instance-group-name> | 
| 创建 EC2 实例失败 | 未能在集群和 <cluster-name>IG 中配置 EC2 实例 <instance-group-name> | 
| 生命周期脚本状态已更新 | EC2 实例的实例生命周期脚本执行<instance-id>有 <status> | 
| 生命周期脚本状态更新失败 | 无法更新的实例生命周期脚本执行状态 EC2InstanceId <instance-id> | 
| 实例创建失败，出现生命周期日志 | EC2 实例的实例生命周期脚本执行<instance-id>失败。要查看生命周期脚本日志，请访问日志组... | 
| 已成功清理未使用的 ENI | 成功删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name> | 
| 未使用的 ENI 清理失败 | 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例未使用的客户 ENI <instance-group-name> | 

### 删除实例
<a name="sagemaker-hyperpod-cluster-events-common-instance-deletion"></a>


| 事件 | 说明 | 
| --- | --- | 
| EC2 实例正在终止 | <instance-id>集群和 <cluster-name>IG 中的 EC2 实例目前正在终止 <instance-group-name> | 
| EC2 实例终止失败 | 无法终止<instance-id>集群<cluster-name>和 IG 中的 EC2 实例 <instance-group-name> | 
| 客户 ENI 已删除 | 成功删除<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的客户 ENI <instance-group-name> | 
| 删除客户 ENI 失败 | 未能删除<instance-id>集群<cluster-name>和 IG 中 EC2 实例的客户 ENI <instance-group-name> | 

### 实例重启
<a name="sagemaker-hyperpod-cluster-events-common-instance-reboot"></a>


| 事件 | 说明 | 
| --- | --- | 
| EC2 实例正在重启 | <instance-id>目前正在集群和 <cluster-name>IG 上重启 EC2 实例 <instance-group-name> | 
| EC2 实例重启请求失败 | 未能提交<instance-id>集群<cluster-name>和 IG 中的 EC2 实例的重启请求 <instance-group-name> | 

### 实例操作（通用）
<a name="sagemaker-hyperpod-cluster-events-common-instance-operation"></a>


| 事件 | 说明 | 
| --- | --- | 
| 实例操作已完成 | <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>已成功完成 | 
| 实例操作失败 | <operation><instance-id>集群<cluster-name>和 IG 中的实例<instance-group-name>出现故障 | 

### 实例替换
<a name="sagemaker-hyperpod-cluster-events-common-instance-replacement"></a>


| 事件 | 说明 | 
| --- | --- | 
| 实例替换已开始 | <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分，实例正在启动 <instance-group-name> | 
| 实例替换启动失败 | <instance-id>作为集群<cluster-name>和 IG 中实例替换的一部分，实例无法启动 <instance-group-name> | 
| 实例替换已完成 | <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分，实例成功完成 <instance-group-name> | 
| 实例替换失败 | <instance-id><operation>作为集群<cluster-name>和 IG 中实例替换的一部分，实例失败 <instance-group-name> | 

### FSx 文件系统生命周期
<a name="sagemaker-hyperpod-cluster-events-common-fsx"></a>


| 事件 | 说明 | 
| --- | --- | 
| FSx 已开始创建 | <instance-group-name>已开始在集群中为 IG 创建 FSx <cluster-name> | 
| 创建 FSx 失败 | <instance-group-name>无法在集群中为 IG 创建 FSx <cluster-name> | 
| FSx 创建已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 创建 <cluster-name> | 
| 已开始删除 FSx | <instance-group-name>已开始在集群中删除 IG 的 FSx <cluster-name> | 
| 删除 FSx 失败 | <instance-group-name>无法在集群中删除 IG 的 FSx <cluster-name> | 
| FSx 的删除已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 删除操作 <cluster-name> | 
| FSx 更新已开始 | <instance-group-name>集群中 IG 的 FSx 更新已启动 <cluster-name> | 
| FSx 更新失败 | <instance-group-name>无法在集群中更新 IG 的 FSx <cluster-name> | 
| FSx 更新已完成 | <instance-group-name>已成功完成集群中 IG 的 FSx 更新 <cluster-name> | 

### 修补（常见步骤）
<a name="sagemaker-hyperpod-cluster-events-common-patching"></a>

操作期间，EKS 和 Slurm 集群都会发出这些修补事件。`UpdateClusterSoftware`


| 事件 | 说明 | 
| --- | --- | 
| 已计划对实例组进行修补 | InstanceGroup <instance-group-name>in Cluster <cluster-name>已计划 UpdateClusterSoftware 到最新。 | 
| 实例组修补计划失败 | 未能<instance-group-name>在集群中 UpdateClusterSoftware 安排 IG <cluster-name>。 | 
| 实例组补丁已启动 | UpdateClusterSoftware <instance-group-name><cluster-name>使用<strategy>策略为集群中的 IG 启动。 | 
| 启动实例组修补失败 | 无法<instance-group-name>在群集中启动 UpdateClusterSoftware IG <cluster-name>。 | 
| 已选择下一个修补批次 | 为<instance-group-name>集群中的 IG 选择了下次更新批次<cluster-name>。 | 
| 下次修补批次选择失败 | 未能在<instance-group-name>集群中为 IG 选择下一个更新批次<cluster-name>。 | 
| 失败的实例排队等候替换 | <instance-group-name>集群中 IG 中的失败实例<cluster-name>排队等候节点更换。 | 
| 失败的实例替换队列失败 | 无法在<instance-group-name>集群的 IG 中对实例进行节点替换<cluster-name>。 | 
| 实例组修补已完成 | UpdateClusterSoftware 已成功完成<instance-group-name>集群中的 IG <cluster-name>。 | 
| 完成实例组修补失败 | 无法<instance-group-name>在群集中完成 UpdateClusterSoftware IG <cluster-name>。 | 
| 根卷更换已开始 | <instance-id>IG 中已开始替换 Instance 的根卷<instance-group-name>。 | 
| 根卷更换失败 | 无法<instance-id>在 IG 中启动实例的根卷更换<instance-group-name>。 | 
| 实例修补成功 | <instance-id>IG 中的实例<instance-group-name>已成功更新。 | 

## EKS-specific 事件
<a name="sagemaker-hyperpod-cluster-events-eks"></a>

以下事件仅针对使用 Amazon EKS 编排的 HyperPod 集群发出。

### 访问入口管理
<a name="sagemaker-hyperpod-cluster-events-eks-access"></a>


| 事件 | 说明 | 
| --- | --- | 
| SLR 访问权限输入操作成功 | <operation>成功进入集群的 SLR 访问权限 <cluster-name> | 
| SLR 访问权限输入操作失败 | 群集的 SLR 访问入口<operation>失败 <cluster-name> | 
| EKS 访问条目操作成功 | <operation>成功进入集群的 EKS 访问入口 <cluster-name> | 
| EKS 访问条目操作失败 | <operation>集群的 EKS 访问条目失败 <cluster-name> | 

### Kubernetes 配置更新
<a name="sagemaker-hyperpod-cluster-events-eks-k8s"></a>


| 事件 | 说明 | 
| --- | --- | 
| Kubernetes 配置更新成功 | <cluster-name>成功更新了 Kubernetes 配置，例如<instance-id>在集群和 IG 中 <instance-group-name> | 
| Kubernetes 配置更新失败 | <cluster-name>无法更新 Kubernetes 配置，例如<instance-id>在集群和 IG 中 <instance-group-name> | 

### Karpenter 自动缩放
<a name="sagemaker-hyperpod-cluster-events-eks-karpenter"></a>


| 事件 | 说明 | 
| --- | --- | 
| 自动缩放操作成功 | AutoScaling <operation><status>成功进入集群 <cluster-name> | 
| 自动缩放操作失败 | 未能进入<operation> AutoScaling 集群 <cluster-name> | 
| Karpenter CRD 安装成功 | CustomResourceDefinition 在 EKS 集群中成功完成安装 <cluster-name> | 
| Karpenter CRD 安装失败 | CustomResourceDefinition EKS 集群安装失败 <cluster-name> | 
| Karpenter SLR 访问策略更新成功 | 在 <operation>EKS 集群中<cluster-name>成功 AmazonSageMakerHyperPodServiceRole 使用访问条目的访问策略 | 
| Karpenter SLR 访问策略更新失败 | 无法在 E <operation>KS 集群中使用 AmazonSageMakerHyperPodServiceRole 访问条目访问策略 <cluster-name> | 

### 修补 — EKS 实例级别
<a name="sagemaker-hyperpod-cluster-events-eks-patching-instance"></a>


| 事件 | 说明 | 
| --- | --- | 
| 实例修补准备成功 | <instance-id>IG 中的实例已被<instance-group-name>封锁，吊舱已被驱逐。 | 
| 已跳过实例修补（违规 PDB） | UpdateClusterSoftware 例如，<instance-id>在 IG 中，<instance-group-name>由于 PodDisruptionBudget 限制而跳过。 | 
| 实例修补准备失败 | 未能<instance-id>在 IG 中<instance-group-name>为其准备实例 UpdateClusterSoftware。 | 
| 实例已恢复到可调度状态 | <instance-id>IG 中的实例<instance-group-name>已恢复到可调度状态。 | 
| 实例恢复到可调度任务失败 | 无法将 <instance-id>IG 中的实例恢复<instance-group-name>到可调度状态。 | 

### 修补 — EKS 回滚
<a name="sagemaker-hyperpod-cluster-events-eks-patching-rollback"></a>


| 事件 | 说明 | 
| --- | --- | 
| 烘焙时间开始了 | <instance-group-name>集群中 IG 的烘焙期已开始<cluster-name>。监视警报 [<alarm-names>] <duration>几秒钟。 | 
| 烘焙时间已完成 | <instance-group-name>集群中 IG 的烘焙周期已完成<cluster-name>。在 <duration>-second 烘焙期间未触发任何警报。 | 
| 烘焙时间警报已触发 | <instance-group-name>集群中 IG 的烘焙周期失败<cluster-name>。警报 [<alarm-names>] 已进入警报状态。正在启动自动回滚。 | 
| 烘焙时间评估失败 | 无法评估集<instance-group-name>群中 IG 在烘焙期间的警报<cluster-name>。 | 
| 实例组修补回滚已启动 | UpdateClusterSoftware <instance-group-name>群集中的 IG 失败<cluster-name>。正在启动回滚。 | 
| 实例组修补回滚失败 | <instance-group-name><cluster-name>集群中的 IG 回滚失败。某些实例可能处于 FailedMaintenance 状态。 | 
| 实例修补回滚已启动 | <instance-id>IG 中的实例<instance-group-name>更新失败。已启动回滚。 | 
| 实例修补回滚成功 | <instance-id>IG 中的实例<instance-group-name>成功回滚到之前的 AMI。 | 
| 实例修补回滚失败 | UpdateClusterSoftware <instance-group-name>例如，<instance-id>在 IG 中回滚失败。 | 

## Slurm-specific 事件
<a name="sagemaker-hyperpod-cluster-events-slurm"></a>

以下事件仅针对使用 Slurm 编排的 HyperPod 集群发出。


| 事件 | 说明 | 
| --- | --- | 
| 已找到置备参数 | 在控制器组的 S3 路径中找到了配置\_parameters.json LifeCycleScript <instance-group-name> | 
| 未找到配置参数 | 在 S3 路径中找不到控制器组的 provisioning\_parameters.json LifeCycleScript <instance-group-name> | 
| Slurm munge 密钥已创建 | 成功创建并存储 munge 密钥 | 
| Slurm 漂移验证通过 | Slurm 配置偏差验证已通过 | 
| 检测到泥浆漂移 | 检测到 Slurm 配置偏差：<drift-details> | 
| Slurm 集群回滚已完成 | 集群创建失败：控制器和登录节点未在预期的时间内准备就绪 | 
| Slurm 重新配置成功 | Slurm 已成功重新配置。Slurm 配置已更新以匹配所需状态 | 

## EventBridge 整合
<a name="sagemaker-hyperpod-cluster-events-eventbridge"></a>

HyperPod EventBridge 使用三种详细信息类型向 Amazon 发送集群事件：


| 细节类型 | 说明 | 
| --- | --- | 
| SageMaker HyperPod Cluster Event | 用于配置、扩展、修补和协调器特定操作的操作事件。包括EventLevel用于严重性筛选。 | 
| SageMaker HyperPod Cluster State Change | Cluster-level 状态转换（例如，正在创建到 InService）。包括完整的集群配置。 | 
| SageMaker HyperPod Cluster Node Health Event | 来自健康监控代理 (HMA) 的 HyperPod 健康监控事件。包括健康状态、原因、修复措施和建议。 | 

### 事件模式示例
<a name="sagemaker-hyperpod-cluster-events-eventbridge-patterns"></a>

**所有 HyperPod 集群事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"]
}
```

**仅限错误事件（用于警报）：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"],
  "detail": {
    "EventDetails": {
      "EventLevel": ["Error"]
    }
  }
}
```

**特定集群的事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"],
  "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"]
}
```

**节点运行状况事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Node Health Event"]
}
```

## API 参考
<a name="sagemaker-hyperpod-cluster-events-api-reference"></a>
+ [ListClusterEvents](https://docs.amazonaws.cn/sagemaker/latest/APIReference/API_ListClusterEvents.html)— 通过筛选、排序和分页列出事件
+ [DescribeClusterEvent](https://docs.amazonaws.cn/sagemaker/latest/APIReference/API_DescribeClusterEvent.html)— 获取特定活动的完整详情
+ [ClusterEventSummary](https://docs.amazonaws.cn/sagemaker/latest/APIReference/API_ClusterEventSummary.html)— 事件摘要数据类型
+ [ClusterEventDetail](https://docs.amazonaws.cn/sagemaker/latest/APIReference/API_ClusterEventDetail.html)— 事件详细信息数据类型

## 另请参阅
<a name="sagemaker-hyperpod-cluster-events-see-also"></a>
+ [SageMaker HyperPod Slurm 集群事件](sagemaker-hyperpod-cluster-events-slurm-page.md)— 包含 CLI 用法和常见场景的 Slurm 集群事件
+ [SageMaker HyperPod EKS 集群事件](sagemaker-hyperpod-cluster-events-eks-page.md)— 包含 CLI 使用情况和常见场景的 EKS 集群事件