View a markdown version of this page

Enhanced Container Insights(Classic)指标参考 - Amazon CloudWatch
Amazon Web Services 文档中描述的 Amazon Web Services 服务或功能可能因区域而异。要查看适用于中国区域的差异,请参阅 中国的 Amazon Web Services 服务入门 (PDF)

Enhanced Container Insights(Classic)指标参考

Enhanced Container Insights(Classic)将指标发布到 CloudWatch 中的 ContainerInsights 命名空间。下表按类别列出了所有指标及其维度与描述。

注意

有关 OTel Container Insights 指标,请参阅Enhanced Container Insights(建议),其中列出了开源指标名称。

集群指标

以下指标衡量 Amazon EKS 集群的整体运行状况和容量。

指标名称 Dimensions 说明
cluster_failed_node_count ClusterName 集群中失败的工作线程节点的数目。
cluster_node_count ClusterName 集群中工作线程节点的总数。

节点指标

以下指标衡量节点级别的资源使用情况和容量。

指标名称 Dimensions 说明
node_cpu_limit ClusterName, InstanceId, NodeName 可以分配给节点的 CPU 单元的最大数量。
node_cpu_reserved_capacity ClusterName, InstanceId, NodeName 节点上预留的 CPU 单元的百分比。
node_cpu_usage_total ClusterName, InstanceId, NodeName 节点所使用的 CPU 单元的数量。
node_cpu_utilization ClusterName, InstanceId, NodeName 节点所使用的 CPU 单元的百分比。
node_filesystem_utilization ClusterName, InstanceId, NodeName 节点上所使用的文件系统容量的百分比。
node_memory_limit ClusterName, InstanceId, NodeName 可以分配给节点的最大内存量(以字节为单位)。
node_memory_reserved_capacity ClusterName, InstanceId, NodeName 节点上预留的内存百分比。
node_memory_utilization ClusterName, InstanceId, NodeName 节点所使用的内存百分比。
node_memory_working_set ClusterName, InstanceId, NodeName 节点的工作集中的内存量(以字节为单位)。
node_network_total_bytes ClusterName, InstanceId, NodeName 节点上通过网络传输和接收的每秒总字节数。
node_number_of_running_containers ClusterName, InstanceId, NodeName 节点上正在运行的容器的数量。
node_number_of_running_pods ClusterName, InstanceId, NodeName 节点上正在运行的容器组(pod)的数量。

容器组(pod)指标

以下指标衡量容器组(pod)级别的资源使用情况。

指标名称 Dimensions 说明
pod_cpu_utilization ClusterName, Namespace, PodName 容器组(pod)使用的 CPU 单元的百分比。
pod_cpu_utilization_over_pod_limit ClusterName, Namespace, PodName 相对于容器组(pod)限制所使用的 CPU 单元的百分比。
pod_cpu_usage_total ClusterName, Namespace, PodName 容器组(pod)使用的 CPU 单元的数量。
pod_memory_utilization ClusterName, Namespace, PodName 容器组(pod)使用的内存百分比。
pod_memory_utilization_over_pod_limit ClusterName, Namespace, PodName 相对于容器组(pod)限制的内存百分比。
pod_memory_working_set ClusterName, Namespace, PodName 容器组(pod)的工作集的内存量(以字节为单位)。
pod_network_rx_bytes ClusterName, Namespace, PodName 容器组(pod)通过网络每秒接收的字节数。
pod_network_tx_bytes ClusterName, Namespace, PodName 容器组(pod)通过网络每秒传输的字节数。
pod_number_of_container_restarts ClusterName, Namespace, PodName 容器组(pod)中容器重新启动的总次数。

容器指标

以下指标衡量容器级别的资源使用情况。

指标名称 Dimensions 说明
container_cpu_utilization ClusterName, Namespace, PodName, ContainerName 容器使用的 CPU 单元的百分比。
container_memory_utilization ClusterName, Namespace, PodName, ContainerName 容器使用的内存的百分比。

服务和命名空间指标

以下指标衡量服务和命名空间级别的容器组(pod)数量。

指标名称 Dimensions 说明
service_number_of_running_pods ClusterName, Namespace, Service 服务中正在运行的容器组(pod)的数量。
namespace_number_of_running_pods ClusterName, Namespace 命名空间中正在运行的容器组(pod)的数量。

NVIDIA GPU 指标

如果您的集群具有配备 NVIDIA GPU 的节点,将收集以下指标。这些指标可帮助您监控节点、容器组(pod)和容器之间的 GPU 计算和内存利用率。

指标名称 Dimensions 说明
node_gpu_utilization ClusterName, InstanceId, NodeName 节点上所使用的 GPU 计算容量的百分比。
node_gpu_memory_utilization ClusterName, InstanceId, NodeName 节点上所使用的 GPU 内存百分比。
node_gpu_temperature ClusterName, InstanceId, NodeName 节点上的 GPU 温度(以摄氏度为单位)。
pod_gpu_utilization ClusterName, Namespace, PodName 容器组(pod)使用的 GPU 计算容量的百分比。
container_gpu_utilization ClusterName, Namespace, PodName, ContainerName 容器使用的 GPU 计算容量的百分比。

Amazon Neuron 指标

如果您的集群具有配备 Amazon Neuron 的实例(例如 Inf1 或 Inf2),将收集以下指标。这些指标有助于您监控节点和容器组(pod)级别的 NeuronCore 利用率。

指标名称 Dimensions 说明
node_neuroncore_utilization ClusterName, InstanceId, NodeName 节点上所使用的 NeuronCore 计算容量的百分比。
pod_neuroncore_utilization ClusterName, Namespace, PodName 容器组(pod)使用的 NeuronCore 计算容量的百分比。

Kubernetes API 服务器指标

以下指标是从 Kubernetes API 服务器收集。这些指标有助于您监控控制面板的运行状况和性能。

指标名称 Dimensions 说明
apiserver_storage_objects ClusterName API 服务器在 etcd 中存储的对象数量。
apiserver_request_total ClusterName API 服务器收到的请求总数。
apiserver_request_duration_seconds ClusterName API 服务器请求的延迟(以秒为单位)。