

# 推荐的 PromQL 警报
<a name="Recommended_PromQL_Alarms"></a>

将这些 PromQL 警报用作经典推荐警报的等效警报。它们使用 PromQL 即时查询来监控相同指标，这些查询会根据通过 CloudWatch OTLP 端点摄取的指标进行评估。

PromQL 警报使用 `EvaluationCriteria` 和 `PromQLCriteria`。与经典指标警报不同，阈值直接嵌入到 PromQL 查询表达式中。
+ **待处理周期**：警报转换为 ALARM 状态之前时间序列必须持续违规的持续时间（以秒为单位）。
+ **恢复周期**：警报恢复到 OK 状态之前所有时间序列必须停止违规的持续时间（以秒为单位）。
+ **评估间隔**：CloudWatch 运行 PromQL 查询的频率（以秒为单位）。

**注意**  
这些警报需要通过 CloudWatch OTLP 端点发布的指标。有关更多信息，请参阅 [PromQL 警报](alarm-promql.md)。

您可以使用 Amazon CloudFormation 部署这些警报。请对 `AWS::CloudWatch::Alarm` 资源使用 `EvaluationCriteria` 和 `PromQLCriteria` 属性。

**Topics**
+ [API Gateway](#Recommended_PromQL_ApiGateway)
+ [Auto Scaling](#Recommended_PromQL_AutoScaling)
+ [Certificate Manager](#Recommended_PromQL_CertificateManager)
+ [CloudFront](#Recommended_PromQL_CloudFront)
+ [Cognito](#Recommended_PromQL_Cognito)
+ [DynamoDB](#Recommended_PromQL_DynamoDB)
+ [EBS](#Recommended_PromQL_EBS)
+ [Amazon Elastic Compute Cloud](#Recommended_PromQL_EC2)
+ [Amazon ECS](#Recommended_PromQL_ECS)
+ [Amazon ECS Container Insights](#Recommended_PromQL_ECS_ContainerInsights)
+ [Amazon ECS Container Insights 增强型可观测性](#Recommended_PromQL_ECS_ContainerInsights_Enhanced)
+ [Amazon EFS](#Recommended_PromQL_EFS)
+ [Amazon EKS Container Insights](#Recommended_PromQL_EKS)
+ [Amazon ElastiCache](#Recommended_PromQL_ElastiCache)
+ [Elastic GPUs](#Recommended_PromQL_ElasticGPUs)
+ [Amazon EventBridge 调度器](#Recommended_PromQL_Scheduler)
+ [Amazon Kinesis Data Streams](#Recommended_PromQL_Kinesis)
+ [Amazon Lambda](#Recommended_PromQL_Lambda)
+ [Amazon Lambda Insights](#Recommended_PromQL_LambdaInsights)
+ [NAT 网关](#Recommended_PromQL_NATGateway)
+ [Amazon PrivateLink 端点](#Recommended_PromQL_PrivateLinkEndpoints)
+ [Amazon PrivateLink 服务](#Recommended_PromQL_PrivateLinkServices)
+ [RDS](#Recommended_PromQL_RDS)
+ [Route 53](#Recommended_PromQL_Route53)
+ [S3](#Recommended_PromQL_S3)
+ [S3 对象 Lambda](#Recommended_PromQL_S3ObjectLambda)
+ [SNS](#Recommended_PromQL_SNS)
+ [SQS](#Recommended_PromQL_SQS)
+ [VPN](#Recommended_PromQL_VPN)

## API Gateway
<a name="Recommended_PromQL_ApiGateway"></a>

**REST API**

**4XXError**  
**标签：**ApiName、Stage  
**警报描述：**当 REST API 阶段的平均 4XX 错误率超过 5% 时发出警报。  
**意图：**检测高客户端错误率，表明存在请求问题。  
**PromQL 标准：**`avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测超过 5% 的客户端错误率，这表示严重的请求失败。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**5XXError**  
**标签：**ApiName、Stage  
**警报描述：**当 REST API 阶段的平均 5XX 错误率超过 5% 时发出警报。  
**意图：**检测高服务器错误率，表明存在后端故障。  
**PromQL 标准：**`avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测超过 5% 的服务器错误率，需要立即进行调查。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**300

**延迟**  
**标签：**ApiName、Stage  
**警报描述：**当 REST API 阶段的 p90 延迟超过 2500 毫秒时发出警报。  
**意图：**检测影响用户体验的高 p90 延迟。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 2500`  
**推荐阈值：**2500（嵌入在查询中）  
**阈值理由：**p90 延迟超过 2500 毫秒表示大多数请求的响应时间下降。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**：计数**。  
**标签：**ApiName、Stage  
**警报描述：**当 REST API 阶段的总请求数低于预期基准时发出警报。  
**意图：**检测低流量，可能表示存在路由或可用性问题。  
**PromQL 标准：**`sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期流量基准进行设置，以检测意外下降。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**300

**HTTP API**

**4xx**  
**标签：**ApiId、Stage  
**警报描述：**当 HTTP API 阶段的平均 4xx 错误率超过 5% 时发出警报。  
**意图：**检测 HTTP API 端点的高客户端错误率。  
**PromQL 标准：**`avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测超过 5% 的客户端错误率。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**5xx**  
**标签：**ApiId、Stage  
**警报描述：**当 HTTP API 阶段的平均 5xx 错误率超过 5% 时发出警报。  
**意图：**检测 HTTP API 端点的高服务器错误率。  
**PromQL 标准：**`avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测超过 5% 的服务器错误率，需要进行调查。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**300

**延迟**  
**标签：**ApiId、Stage  
**警报描述：**当 HTTP API 阶段的 p90 延迟超过 2500 毫秒时发出警报。  
**意图：**检测 HTTP API 端点的高 p90 延迟。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2500`  
**推荐阈值：**2500（嵌入在查询中）  
**阈值理由：**p90 延迟超过 2500 毫秒表示响应时间下降。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**IntegrationLatency**  
**标签：**ApiId、Stage  
**警报描述：**当 HTTP API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。  
**意图：**检测高后端集成延迟，影响响应时间。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**推荐阈值：**2000（嵌入在查询中）  
**阈值理由：**p90 集成延迟超过 2000 毫秒表示后端缓慢。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**：计数**。  
**标签：**ApiId、Stage  
**警报描述：**当 HTTP API 阶段的总请求数低于预期基准时发出警报。  
**意图：**检测低流量，可能表示存在路由或可用性问题。  
**PromQL 标准：**`sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期流量基准进行设置，以检测意外下降。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**300

**WebSocket API**

**ClientError**  
**标签：**ApiId、Stage  
**警报描述：**当 WebSocket API 阶段的平均客户端错误率超过 5% 时发出警报。  
**意图：**检测 WebSocket API 连接的高客户端错误率。  
**PromQL 标准：**`avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测 WebSocket 连接超过 5% 的客户端错误率。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ExecutionError**  
**标签：**ApiId、Stage  
**警报描述：**当 WebSocket API 阶段的平均执行错误率超过 5% 时发出警报。  
**意图：**检测 WebSocket API 的高服务器端执行错误率。  
**PromQL 标准：**`avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**检测超过 5% 的执行错误率，需要进行调查。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**300

**IntegrationLatency**  
**标签：**ApiId、Stage  
**警报描述：**当 WebSocket API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。  
**意图：**检测 WebSocket API 路由的高后端集成延迟。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**推荐阈值：**2000（嵌入在查询中）  
**阈值理由：**p90 集成延迟超过 2000 毫秒表示后端缓慢。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**MessageCount**  
**标签：**ApiId、Stage  
**警报描述：**当 WebSocket API 阶段的总消息数低于预期基准时发出警报。  
**意图：**检测低消息量，可能表示存在连接或路由问题。  
**PromQL 标准：**`sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期消息量进行设置，以检测意外下降。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**300

## Auto Scaling
<a name="Recommended_PromQL_AutoScaling"></a>

**GroupInServiceCapacity**  
**标签：**AutoScalingGroupName  
**警报描述：**当自动扩缩组的平均服务中容量低于预期最低值时发出警报。  
**意图：**检测由于启动失败或实例终止而导致的低可用性。  
**PromQL 标准：**`avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="{{your-auto-scaling-group-name}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据所需的最低容量进行设置，以检测启动失败或实例不足情形。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

## Certificate Manager
<a name="Recommended_PromQL_CertificateManager"></a>

**DaysToExpiry**  
**标签：**CertificateArn  
**警报描述：**当证书到期的最短天数降至 44 天或更短时发出警报。  
**意图：**主动发出证书到期警报，以便有时间进行续订。  
**PromQL 标准：**`min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="{{your-certificate-arn}}"}) <= 44`  
**推荐阈值：**44（嵌入在查询中）  
**阈值理由：**在证书过期之前提供足够的准备时间来完成续订过程。  
**评估间隔：**86400  
**待处理周期：**86400  
**恢复周期：**86400

## CloudFront
<a name="Recommended_PromQL_CloudFront"></a>

**5xxErrorRate**  
**标签：**DistributionId  
**警报描述：**当平均 5xx 错误率超过 CloudFront 分配的阈值时发出警报。  
**意图：**检测影响内容交付的高源或 CloudFront 错误率。  
**PromQL 标准：**`avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的内容分发错误率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**OriginLatency**  
**标签：**DistributionId  
**警报描述：**当 p90 源延迟超过 CloudFront 分配的阈值时发出警报。  
**意图：**检测影响内容交付性能的高源响应延迟。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期源响应时间和缓存策略进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**FunctionValidationErrors**  
**标签：**DistributionId、FunctionName  
**警报描述：**当发生任何 CloudFront 函数验证错误时发出警报。  
**意图：**检测阻止函数执行的 CloudFront 函数验证失败。  
**PromQL 标准：**`sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何验证错误都表明存在需要注意的函数配置问题。  
**评估间隔：**60  
**待处理周期：**120  
**恢复周期：**120

**FunctionExecutionErrors**  
**标签：**DistributionId、FunctionName  
**警报描述：**当发生任何 CloudFront 函数执行错误时发出警报。  
**意图：**检测 CloudFront 函数中影响请求处理的运行时故障。  
**PromQL 标准：**`sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何执行错误都表明函数代码存在运行时问题。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**FunctionThrottles**  
**标签：**DistributionId、FunctionName  
**警报描述：**当发生任何 CloudFront 函数节流时发出警报。  
**意图：**检测可能会降低请求处理的 CloudFront 函数节流。  
**PromQL 标准：**`sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何节流都表明函数达到了计算限制。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Cognito
<a name="Recommended_PromQL_Cognito"></a>

**SignUpThrottles**  
**标签：**UserPool、UserPoolClient  
**警报描述：**当注册节流事件超过用户池的阈值时发出警报。  
**意图：**检测阻止新用户注册的注册节流。  
**PromQL 标准：**`sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据注册操作可接受的节流率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**SignInThrottles**  
**标签：**UserPool、UserPoolClient  
**警报描述：**当登录节流事件超过用户池的阈值时发出警报。  
**意图：**检测阻止用户身份验证的登录节流。  
**PromQL 标准：**`sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据登录操作可接受的节流率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TokenRefreshTrott**  
**标签：**UserPool、UserPoolClient  
**警报描述：**当令牌刷新节流事件超过用户池的阈值时发出警报。  
**意图：**检测可能会导致会话中断的令牌刷新节流。  
**PromQL 标准：**`sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据令牌刷新操作可接受的节流率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**FederationThrottles**  
**标签：**UserPool、UserPoolClient、IdentityProvider  
**警报描述：**当联合身份验证节流事件超过用户池身份提供者的阈值时发出警报。  
**意图：**检测可能会阻止联合登录的联合节流。  
**PromQL 标准：**`sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}",IdentityProvider="{{your-identity-provider}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据联合身份验证操作可接受的节流率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## DynamoDB
<a name="Recommended_PromQL_DynamoDB"></a>

**AccountProvisionedReadCapacityUtilization**  
**标签：**无  
**警报描述：**当账户级别的预置读取容量利用率超过 80% 时发出警报。  
**意图：**检测预置的读取容量何时接近账户限制。  
**PromQL 标准：**`max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**利用率为 80% 时，在达到账户限制之前，您的余量有限。  
**评估间隔：**300  
**待处理周期：**600  
**恢复周期：**600

**AccountProvisionedWriteCapacityUtilization**  
**标签：**无  
**警报描述：**当账户级别的预置写入容量利用率超过 80% 时发出警报。  
**意图：**检测预置的写入容量何时接近账户限制。  
**PromQL 标准：**`max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**利用率为 80% 时，在达到账户限制之前，您的余量有限。  
**评估间隔：**300  
**待处理周期：**600  
**恢复周期：**600

**AgeOfOldestUnreplicatedRecord**  
**标签：**TableName、DelegatedOperation  
**警报描述：**当最早的未复制记录的期限超过阈值时发出警报。  
**意图：**检测可能导致全局表中的数据过时的复制延迟。  
**PromQL 标准：**`max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据复制新鲜度要求进行设置。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900

**FailedToReplicateRecordCount**  
**标签：**TableName、DelegatedOperation  
**警报描述：**当全局表中任何记录复制失败时发出警报。  
**意图：**检测导致跨区域数据不一致的复制失败。  
**PromQL 标准：**`sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何失败的复制都表明存在数据一致性问题，需要立即关注。  
**评估间隔：**60  
**待处理周期：**60  
**恢复周期：**60

**ReadThrottleEvents**  
**标签：**TableName  
**警报描述：**当读取节流事件超过表的阈值时发出警报。  
**意图：**检测表示预置容量不足的读取节流。  
**PromQL 标准：**`sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据读取操作可接受的节流计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ReadThrottleEvents (GSI)**  
**标签：**TableName、GlobalSecondaryIndexName  
**警报描述：**当读取节流事件超过全局二级索引的阈值时发出警报。  
**意图：**检测 GSI 上表示索引容量不足的读取节流。  
**PromQL 标准：**`sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据 GSI 读取操作可接受的节流计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ReplicationLatency**  
**标签：**TableName、ReceivingRegion  
**警报描述：**当平均复制延迟超过全局表的阈值时发出警报。  
**意图：**检测可能导致副本区域读取过时的高复制延迟。  
**PromQL 标准：**`avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",ReceivingRegion="{{your-receiving-region}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据副本区域的数据新鲜度要求进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**SuccessfulRequestLatency**  
**标签：**TableName、Operation  
**警报描述：**当平均成功请求延迟超过表操作的阈值时发出警报。  
**意图：**检测影响应用程序性能的 DynamoDB 操作高延迟。  
**PromQL 标准：**`avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",Operation="{{your-operation}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据特定 DynamoDB 操作的延迟 SLA 进行设置。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**SystemErrors**  
**标签：**TableName  
**警报描述：**当系统错误超过表的阈值时发出警报。  
**意图：**检测影响表可用性的 DynamoDB 服务端错误。  
**PromQL 标准：**`sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据表可接受的系统错误计数进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**ThrottledPutRecordCount**  
**标签：**TableName、DelegatedOperation  
**警报描述：**当受限的放置记录计数超过表的阈值时发出警报。  
**意图：**检测可能导致流式操作数据丢失的受限 put。  
**PromQL 标准：**`max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据流式放置操作可接受的节流计数进行设置。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**UserErrors**  
**标签：**无  
**警报描述：**当用户错误超过整个账户的阈值时发出警报。  
**意图：**检测高客户端错误率，例如验证或条件检查失败。  
**PromQL 标准：**`sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据客户端请求失败可接受的错误率进行设置。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**WriteThrottleEvents**  
**标签：**TableName  
**警报描述：**当写入节流事件超过表的阈值时发出警报。  
**意图：**检测表示预置容量不足的写入节流。  
**PromQL 标准：**`sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据写入操作可接受的节流计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**WriteThrottleEvents (GSI)**  
**标签：**TableName、GlobalSecondaryIndexName  
**警报描述：**当写入节流事件超过全局二级索引的阈值时发出警报。  
**意图：**检测 GSI 上表示索引容量不足的写入节流。  
**PromQL 标准：**`sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据 GSI 写入操作可接受的节流计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## EBS
<a name="Recommended_PromQL_EBS"></a>

**VolumeStalledIOCheck**  
**标签：**VolumeId、InstanceId  
**警报描述：**当 EBS 卷报告停滞的 I/O 检查失败时发出警报。  
**意图：**检测 EBS 卷上停滞的 I/O，表示卷受损。  
**PromQL 标准：**`max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="{{your-volume-id}}",InstanceId="{{your-instance-id}}"}) >= 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**1 或更大值表示卷已停滞 I/O，需要立即进行调查。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

## Amazon Elastic Compute Cloud
<a name="Recommended_PromQL_EC2"></a>

**CPUUtilization**  
**标签：**InstanceId  
**警报描述：**当 EC2 实例的平均 CPU 利用率超过 80% 时发出警报。  
**意图：**检测高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 阈值在饱和之前留出余量。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900

**StatusCheckFailed**  
**标签：**InstanceId  
**警报描述：**当 EC2 实例的实例或系统运行状况检查失败时发出警报。  
**意图：**检测实例或系统运行状况问题。  
**PromQL 标准：**`max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**任何状态检查失败都需要调查。  
**评估间隔：**300  
**待处理周期：**600  
**恢复周期：**600

**StatusCheckFailed\_AttachedEBS**  
**标签：**InstanceId  
**警报描述：**当附加的 EBS 卷对 EC2 实例无法访问时发出警报。  
**意图：**检测无法访问的 EBS 卷。  
**PromQL 标准：**`max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**无法访问的卷导致 I/O 故障。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

## Amazon ECS
<a name="Recommended_PromQL_ECS"></a>

**CPUReservation**  
**标签：**ClusterName  
**警报描述：**当 ECS 集群的平均 CPU 预留率超过 80% 时发出警报。  
**意图：**检测接近 CPU 容量的集群。  
**PromQL 标准：**`avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 预留表示新任务的余量有限。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**CPUUtilization**  
**标签：**ClusterName、ServiceName  
**警报描述：**当 ECS 服务的平均 CPU 利用率超过 80% 时发出警报。  
**意图：**检测 ECS 服务的高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**EBSFilesystemUtilization**  
**标签：**ClusterName、ServiceName  
**警报描述：**当 ECS 服务的平均 EBS 文件系统利用率超过 80% 时发出警报。  
**意图：**检测高 EBS 存储利用率。  
**PromQL 标准：**`avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**MemoryReservation**  
**标签：**ClusterName  
**警报描述：**当 ECS 集群的平均内存预留率超过 80% 时发出警报。  
**意图：**检测接近内存容量的集群。  
**PromQL 标准：**`avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 预留表示新任务的余量有限。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**MemoryUtilization**  
**标签：**ClusterName、ServiceName  
**警报描述：**当 ECS 服务的平均内存利用率超过 80% 时发出警报。  
**意图：**检测高内存利用率。  
**PromQL 标准：**`avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**HTTPCode\_Target\_5XX\_Count**  
**标签：**ClusterName、ServiceName  
**警报描述：**当 HTTP 5XX 错误计数超过 ECS 服务的阈值时发出警报。  
**意图：**检测高服务器端错误计数。  
**PromQL 标准：**`sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据应用程序的正常错误率基准进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TargetResponseTime**  
**标签：**ClusterName、ServiceName  
**警报描述：**当平均目标响应时间超过 ECS 服务的阈值时发出警报。  
**意图：**检测高目标响应时间。  
**PromQL 标准：**`avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**基于应用程序可接受的延迟要求进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon ECS Container Insights
<a name="Recommended_PromQL_ECS_ContainerInsights"></a>

**EphemeralStorageUtilized**  
**标签：**ClusterName、ServiceName  
**警报描述：**当平均临时存储用量超过 Fargate 任务的阈值时发出警报。  
**意图：**检测 Fargate 任务的高临时存储用量。  
**PromQL 标准：**`avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据任务的临时存储分配进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**RunningTaskCount**  
**标签：**ClusterName、ServiceName  
**警报描述：**当 ECS 服务的运行任务计数降至零时发出警报。  
**意图：**检测何时没有任务正在运行。  
**PromQL 标准：**`avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) <= 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**零个运行任务表示服务中断。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**instance\_filesystem\_utilization**  
**标签：**InstanceId、ContainerInstanceId、ClusterName  
**警报描述：**当容器实例的平均文件系统利用率超过 90% 时发出警报。  
**意图：**检测高文件系统利用率。  
**PromQL 标准：**`avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="{{your-instance-id}}",ContainerInstanceId="{{your-container-instance-id}}",ClusterName="{{your-cluster-name}}"}) > 90`  
**推荐阈值：**90（嵌入在查询中）  
**阈值理由：**90% 文件系统利用率为操作空间留下最少空间。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon ECS Container Insights 增强型可观测性
<a name="Recommended_PromQL_ECS_ContainerInsights_Enhanced"></a>

**TaskCpuUtilization（集群级别）**  
**标签：**ClusterName  
**警报描述：**当集群级别的平均任务 CPU 利用率超过 80% 时发出警报。  
**意图：**检测高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskCpuUtilization（服务级别）**  
**标签：**ClusterName、ServiceName  
**警报描述：**当服务级别的平均任务 CPU 利用率超过 80% 时发出警报。  
**意图：**检测高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskMemoryUtilization（集群级别）**  
**标签：**ClusterName  
**警报描述：**当集群级别的平均任务内存利用率超过 80% 时发出警报。  
**意图：**检测高内存利用率。  
**PromQL 标准：**`avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskMemoryUtilization（服务级别）**  
**标签：**ClusterName、ServiceName  
**警报描述：**当服务级别的平均任务内存利用率超过 80% 时发出警报。  
**意图：**检测高内存利用率。  
**PromQL 标准：**`avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ContainerCpuUtilization（集群级别）**  
**标签：**ClusterName  
**警报描述：**当集群级别的平均容器 CPU 利用率超过 80% 时发出警报。  
**意图：**检测高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ContainerCpuUtilization（容器级别）**  
**标签：**ContainerName、ClusterName、ServiceName  
**警报描述：**当容器级别的平均容器 CPU 利用率超过 80% 时发出警报。  
**意图：**检测高 CPU 利用率。  
**PromQL 标准：**`avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ContainerMemoryUtilization（集群级别）**  
**标签：**ClusterName  
**警报描述：**当集群级别的平均容器内存利用率超过 80% 时发出警报。  
**意图：**检测高内存利用率。  
**PromQL 标准：**`avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ContainerMemoryUtilization（容器级别）**  
**标签：**ContainerName、ClusterName、ServiceName  
**警报描述：**当容器级别的平均容器内存利用率超过 80% 时发出警报。  
**意图：**检测高内存利用率。  
**PromQL 标准：**`avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskEBSfilesystemUtilization**  
**标签：**ClusterName、ServiceName  
**警报描述：**当任务的平均 EBS 文件系统利用率超过 80% 时发出警报。  
**意图：**检测高 EBS 文件系统利用率。  
**PromQL 标准：**`avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskEphemeralStorageUtilization（集群级别）**  
**标签：**ClusterName  
**警报描述：**当集群级别的平均临时存储利用率超过 80% 时发出警报。  
**意图：**检测高临时存储利用率。  
**PromQL 标准：**`avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**TaskEphemeralStorageUtilization（服务级别）**  
**标签：**ClusterName、ServiceName  
**警报描述：**当服务级别的平均临时存储利用率超过 80% 时发出警报。  
**意图：**检测高临时存储利用率。  
**PromQL 标准：**`avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon EFS
<a name="Recommended_PromQL_EFS"></a>

**PercentIOLimit**  
**标签：**FileSystemId  
**警报描述：**当 EFS 文件系统达到其 I/O 限制的 100% 时发出警报。  
**意图：**检测文件系统何时达到 I/O 限制。  
**PromQL 标准：**`avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) >= 100`  
**推荐阈值：**100（嵌入在查询中）  
**阈值理由：**100% 时，文件系统成为瓶颈。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**BurstCreditBalance**  
**标签：**FileSystemId  
**警报描述：**当 EFS 文件系统的突增积分余额降至零时发出警报。  
**意图：**检测导致吞吐量减慢的耗尽的突增积分。  
**PromQL 标准：**`avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) <= 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**零积分导致吞吐量降低。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

## Amazon EKS Container Insights
<a name="Recommended_PromQL_EKS"></a>

**node\_cpu\_utilization**  
**标签：**ClusterName  
**警报描述：**当 EKS Worker 节点上的最大 CPU 利用率超过 80% 时发出警报。  
**意图：**检测 Worker 节点上的高 CPU。  
**PromQL 标准：**`max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**node\_filesystem\_utilization**  
**标签：**ClusterName  
**警报描述：**当最大文件系统利用率超过 EKS Worker 节点的阈值时发出警报。  
**意图：**检测 Worker 节点上的高文件系统使用率。  
**PromQL 标准：**`max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值说明：**根据节点的存储容量和使用模式进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**node\_memory\_utilization**  
**标签：**ClusterName  
**警报描述：**当 EKS Worker 节点上的最大内存利用率超过 80% 时发出警报。  
**意图：**检测 Worker 节点上的高内存。  
**PromQL 标准：**`max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在饱和之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**pod\_cpu\_utilization\_over\_pod\_limit**  
**标签：**ClusterName、Namespace、Service  
**警报描述：**当容器组（pod）CPU 利用率超过其限制的 80% 时发出警报。  
**意图：**检测接近 CPU 限制的容器组（pod）。  
**PromQL 标准：**`max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在节流发生之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**pod\_memory\_utilization\_over\_pod\_limit**  
**标签：**ClusterName、Namespace、Service  
**警报描述：**当容器组（pod）内存利用率超过其限制的 80% 时发出警报。  
**意图：**检测接近内存限制的容器组（pod）。  
**PromQL 标准：**`max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**80% 在 OOMKill 发生之前留出余量。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon ElastiCache
<a name="Recommended_PromQL_ElastiCache"></a>

**CPUUtilization**  
**标签：**CacheClusterId、CacheNodeId  
**警报描述：**当平均 CPU 利用率超过 ElastiCache 节点的阈值时发出警报。  
**意图：**检测实例的高 CPU。  
**PromQL 标准：**`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据节点类型和工作负载特征进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**CurrConnections**  
**标签：**CacheClusterId、CacheNodeId  
**警报描述：**当连接计数超过 ElastiCache 节点的阈值时发出警报。  
**意图：**检测高连接计数。  
**PromQL 标准：**`avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期连接池大小和应用程序需求进行设置。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**DatabaseMemoryUsagePercentage**  
**标签：**CacheClusterId  
**警报描述：**当数据库内存使用量超过 ElastiCache 集群的阈值时发出警报。  
**意图：**检测高内存使用率以防止写入失败。  
**PromQL 标准：**`avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据驱逐策略和数据重要性进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**EngineCPUUtilization**  
**标签：**CacheClusterId  
**警报描述：**当 ElastiCache 集群的 Redis 引擎 CPU 利用率超过 90% 时发出警报。  
**意图：**检测高 Redis 引擎 CPU 利用率。  
**PromQL 标准：**`avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > 90`  
**推荐阈值：**90（嵌入在查询中）  
**阈值理由：**Redis 是单线程的；超过 90% 表示已饱和。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ReplicationLag**  
**标签：**CacheClusterId  
**警报描述：**当复制延迟超过 ElastiCache 集群的阈值时发出警报。  
**意图：**检测影响数据一致性的复制延迟。  
**PromQL 标准：**`avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据应用程序对过时读取的容忍度进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

## Elastic GPUs
<a name="Recommended_PromQL_ElasticGPUs"></a>

**GPUConnectivityCheckFailed**  
**标签：**InstanceId、EGPUId  
**警报描述：**当 Elastic Graphics 加速器与实例失去连接时发出警报。  
**意图：**检测与 Elastic Graphics 加速器的连接问题。  
**PromQL 标准：**`max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何连接失败都需要调查。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900

**GPUHealthCheckFailed**  
**标签：**InstanceId、EGPUId  
**警报描述：**当 Elastic Graphics 加速器运行状况检查失败时发出警报。  
**意图：**检测运行状况不佳的 Elastic Graphics 加速器。  
**PromQL 标准：**`max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**运行状况检查失败表示存在加速器问题。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900

## Amazon EventBridge 调度器
<a name="Recommended_PromQL_Scheduler"></a>

**TargetErrorThrottledCount**  
**警报描述：**当计划目标调用受到限制时发出警报。  
**意图：**检测导致计划延迟的目标节流。  
**PromQL 标准：**`sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何节流都表明存在目标容量问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**InvocationThrottleCount**  
**警报描述：**当调度器调用受到限制时发出警报。  
**意图：**检测调度器调用节流。  
**PromQL 标准：**`sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**节流延迟计划的执行。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**InvocationDroppedCount**  
**警报描述：**当计划的调用被丢弃时发出警报。  
**意图：**检测丢弃的调用。  
**PromQL 标准：**`sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**丢弃的调用表示计划的事件丢失。  
**评估间隔：**60  
**待处理周期：**60  
**恢复周期：**60

**InvocationsFailedToBeSentToDeadLetterCount**  
**警报描述：**当失败的调用无法发送到死信队列时发出警报。  
**意图：**检测 DLQ 交付失败。  
**PromQL 标准：**`sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**失败的 DLQ 交付意味着缺失错误信息。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

## Amazon Kinesis Data Streams
<a name="Recommended_PromQL_Kinesis"></a>

**GetRecords.IteratorAgeMilliseconds**  
**标签：**StreamName  
**警报描述：**当使用器迭代器期限超过 Kinesis 流的阈值时发出警报。  
**意图：**检测落后于保留期的数据，可能导致数据丢失。  
**PromQL 标准：**`max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据流保留期百分比进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**GetRecords.Success**  
**标签：**StreamName  
**警报描述：**当 GetRecords 成功率低于 Kinesis 流的阈值时发出警报。  
**意图：**检测使用器检索失败。  
**PromQL 标准：**`avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期成功率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**PutRecord.Success**  
**标签：**StreamName  
**警报描述：**当 PutRecord 成功率低于 Kinesis 流的阈值时发出警报。  
**意图：**检测产生器摄取失败。  
**PromQL 标准：**`avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期成功率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**PutRecords.FailedRecords**  
**标签：**StreamName  
**警报描述：**当批量放置操作为 Kinesis 流产生失败记录时发出警报。  
**意图：**检测批量放置失败。  
**PromQL 标准：**`sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的失败计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ReadProvisionedThroughputExceeded**  
**标签：**StreamName  
**警报描述：**当使用器读取超过 Kinesis 流的预置吞吐量时发出警报。  
**意图：**检测使用器读取节流。  
**PromQL 标准：**`avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**任何持续节流都表明容量需求。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**SubscribeToShardEvent.MillisBehindLatest**  
**标签：**StreamName、ConsumerName  
**警报描述：**当增强型扇出使用器落后于最新记录时发出警报。  
**意图：**检测增强型扇出使用器处理延迟。  
**PromQL 标准：**`avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}",ConsumerName="{{your-consumer-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的处理延迟进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**WriteProvisionedThroughputExceeded**  
**标签：**StreamName  
**警报描述：**当产生器写入超过 Kinesis 流的预置吞吐量时发出警报。  
**意图：**检测产生器写入节流。  
**PromQL 标准：**`avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**持续节流表明容量需求。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon Lambda
<a name="Recommended_PromQL_Lambda"></a>

**ClaimedAccountConcurrency**  
**警报描述：**当申领的账户并发数超过阈值时发出警报。  
**意图：**检测接近并发配额的账户。  
**PromQL 标准：**`max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**设置为区域并发限制百分比。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**错误**  
**标签：**FunctionName  
**警报描述：**当函数错误计数超过 Lambda 函数的阈值时发出警报。  
**意图：**检测高函数错误计数。  
**PromQL 标准：**`sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的错误量进行设置。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**300

**节流**  
**标签：**FunctionName  
**警报描述：**当 Lambda 函数的函数调用受到限制时发出警报。  
**意图：**检测函数调用节流。  
**PromQL 标准：**`sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**节流表明已达到并发限制。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**Duration**  
**标签：**FunctionName  
**警报描述：**当 p90 函数持续时间超过 Lambda 函数的阈值时发出警报。  
**意图：**检测长时间运行的函数调用。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**相对于函数超时进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**ConcurrentExecutions**  
**标签：**FunctionName  
**警报描述：**当并发执行超过 Lambda 函数的阈值时发出警报。  
**意图：**检测接近并发限制的函数。  
**PromQL 标准：**`max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**设置为预留并发百分比。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

## Amazon Lambda Insights
<a name="Recommended_PromQL_LambdaInsights"></a>

**memory\_utilization**  
**标签：**function\_name  
**警报描述：**当 Lambda 函数的平均内存利用率超过 90% 时发出警报。  
**意图：**检测接近配置的内存限制的函数。  
**PromQL 标准：**`avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="{{your-function-name}}"}) > 90`  
**推荐阈值：**90（嵌入在查询中）  
**阈值理由：**超过 90% 可能会导致内存不足故障。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

## NAT 网关
<a name="Recommended_PromQL_NATGateway"></a>

**ErrorPortAllocation**  
**标签：**NatGatewayId  
**警报描述：**当 NAT 网关无法为新连接分配端口时发出警报。  
**意图：**检测阻止新连接的端口分配失败。  
**PromQL 标准：**`sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何分配失败都会影响连接。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**PacketsDropCount**  
**标签：**NatGatewayId  
**警报描述：**当 NAT 网关丢弃的数据包超过阈值时发出警报。  
**意图：**检测表明容量或连接问题的数据包丢弃。  
**PromQL 标准：**`sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的下降率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon PrivateLink 端点
<a name="Recommended_PromQL_PrivateLinkEndpoints"></a>

**PacketsDropped**  
**标签：**VpcId、VpcEndpointId、EndpointType、SubnetId、ServiceName  
**警报描述：**当 VPC 端点丢弃的数据包超过阈值时发出警报。  
**意图：**检测运行状况不佳的端点或端点服务。  
**PromQL 标准：**`sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="{{your-vpc-id}}",VpcEndpointId="{{your-vpc-endpoint-id}}",EndpointType="{{your-endpoint-type}}",SubnetId="{{your-subnet-id}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的下降率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Amazon PrivateLink 服务
<a name="Recommended_PromQL_PrivateLinkServices"></a>

**RstPacketsSent**  
**标签：**ServiceId、LoadBalancerArn、Az  
**警报描述：**当 RST 数据包速率超过端点服务的阈值时发出警报。  
**意图：**检测端点服务运行状况不佳的目标。  
**PromQL 标准：**`sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的 RST 数据包速率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## RDS
<a name="Recommended_PromQL_RDS"></a>

**CPUUtilization**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的平均 CPU 利用率超过 90% 时发出警报。  
**意图：**检测防止性能下降的高 CPU。  
**PromQL 标准：**`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90`  
**推荐阈值：**90（嵌入在查询中）  
**阈值说明：**90% 表示接近饱和。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**DatabaseConnections**  
**标签：**DBInstanceIdentifier  
**警报描述：**当数据库连接超过 RDS 实例的阈值时发出警报。  
**意图：**防止在最大限制下连接被拒绝。  
**PromQL 标准：**`avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**设置为 max\_connections 参数百分比。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**EBSByteBalance%**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的 EBS 字节余额低于 10% 时发出警报。  
**意图：**检测导致瓶颈的低吞吐量积分。  
**PromQL 标准：**`avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**推荐阈值：**10（嵌入在查询中）  
**阈值理由：**低于 10% 可能会导致吞吐量下降。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**180

**EBSIOBalance%**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的 EBS IO 余额低于 10% 时发出警报。  
**意图：**检测导致瓶颈的低 IOPS 积分。  
**PromQL 标准：**`avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**推荐阈值：**10（嵌入在查询中）  
**阈值理由：**低于 10% 可能会导致 IOPS 下降。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**180

**FreeableMemory**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的可用内存低于阈值时发出警报。  
**意图：**防止导致连接被拒绝的内存不足情形。  
**PromQL 标准：**`avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值说明：**根据实例类内存进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**FreeLocalStorage**  
**标签：**DBInstanceIdentifier  
**警报描述：**当可用本地存储空间低于 Aurora 实例的阈值时发出警报。  
**意图：**防止 Aurora 本地存储耗尽。  
**PromQL 标准：**`avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据操作所需的最低值进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**FreeStorageSpace**  
**标签：**DBInstanceIdentifier  
**警报描述：**当可用存储空间低于 RDS 实例的阈值时发出警报。  
**意图：**防止存储空间已满导致的停机。  
**PromQL 标准：**`min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据存储增长率和预置大小进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**MaximumUsedTransactionIDs**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的最大已用事务 ID 超过 10 亿时发出警报。  
**意图：**防止 PostgreSQL 事务 ID 重叠。  
**PromQL 标准：**`avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000`  
**推荐阈值：**1000000000（嵌入查询中）  
**阈值理由：**10 亿表示接近重叠危险。  
**评估间隔：**60  
**待处理周期：**60  
**恢复周期：**60

**ReadLatency**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 p90 读取延迟超过 RDS 实例的阈值时发出警报。  
**意图：**检测高读取延迟，表明存在磁盘问题。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的应用程序延迟进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**ReplicaLag**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 只读副本的复制延迟超过 60 秒时发出警报。  
**意图：**检测可能会导致数据丢失的复制延迟。  
**PromQL 标准：**`max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60`  
**推荐阈值：**60（嵌入在查询中）  
**阈值理由：**对于大多数工作负载，60 秒都表示显著延迟。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**WriteLatency**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 p90 写入延迟超过 RDS 实例的阈值时发出警报。  
**意图：**检测高写入延迟，表明存在磁盘问题。  
**PromQL 标准：**`histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的应用程序延迟进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**DBLoad**  
**标签：**DBInstanceIdentifier  
**警报描述：**当平均数据库负载超过 RDS 实例的阈值时发出警报。  
**意图：**检测高数据库负载下降性能。  
**PromQL 标准：**`avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**设置为 vCPU 计数的倍数。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**AuroraVolumeBytesLeftTotal**  
**标签：**DBClusterIdentifier  
**警报描述：**当 Aurora 集群剩余存储字节数低于阈值时发出警报。  
**意图：**防止 Aurora 集群存储耗尽。  
**PromQL 标准：**`avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据增长率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**AuroraBinlogReplicaLag**  
**标签：**DBClusterIdentifier  
**警报描述：**当 Aurora 二进制日志副本延迟指示错误状态时发出警报。  
**意图：**检测写入器实例复制错误。  
**PromQL 标准：**`avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1`  
**推荐阈值：**-1（嵌入在查询中）  
**阈值理由：**-1 表示错误状态。  
**评估间隔：**60  
**待处理周期：**120  
**恢复周期：**120

**BlockedTransactions**  
**标签：**DBInstanceIdentifier  
**警报描述：**当被阻止事务计数超过 RDS 实例的阈值时发出警报。  
**意图：**检测导致性能下降的事务阻止。  
**PromQL 标准：**`avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的被阻止事务计数进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**BufferCacheHitRatio**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 RDS 实例的缓冲区缓存命中率低于 80% 时发出警报。  
**意图：**检测导致性能下降的缓存效率低下。  
**PromQL 标准：**`avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80`  
**推荐阈值：**80（嵌入在查询中）  
**阈值理由：**低于 80% 表示磁盘 I/O 过多。  
**评估间隔：**60  
**待处理周期：**600  
**恢复周期：**600

**EngineUptime**  
**标签：**DBClusterIdentifier  
**警报描述：**当引擎正常运行时间降至零时发出警报，其表示 Aurora 写入器重启。  
**意图：**检测 Aurora 写入器实例停机或崩溃。  
**PromQL 标准：**`avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**零正常运行时间表示实例重启。  
**评估间隔：**60  
**待处理周期：**120  
**恢复周期：**120

**RollbackSegmentHistoryListLength**  
**标签：**DBInstanceIdentifier  
**警报描述：**当 Aurora 实例的回滚分段历史记录列表长度超过 100 万时发出警报。  
**意图：**检测导致 CPU 降级的高回滚历史记录。  
**PromQL 标准：**`avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000`  
**推荐阈值：**1000000（嵌入在查询中）  
**阈值理由：**高于 1M 导致性能问题。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**StorageNetworkThroughput**  
**标签：**DBClusterIdentifier  
**警报描述：**当存储网络吞吐量超过 Aurora 集群的阈值时发出警报。  
**意图：**检测可能导致网络数据包丢弃的高吞吐量。  
**PromQL 标准：**`avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据实例网络容量进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## Route 53
<a name="Recommended_PromQL_Route53"></a>

**HealthCheckStatus**  
**标签：**HealthCheckId  
**警报描述：**当 Route 53 运行状况检查报告端点运行状况不佳时发出警报。  
**意图：**通过 Route 53 运行状况检查程序检测运行状况不佳的端点。  
**PromQL 标准：**`avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**低于 1 表示端点未通过运行状况检查。  
**评估间隔：**60  
**待处理周期：**180  
**恢复周期：**180

## S3
<a name="Recommended_PromQL_S3"></a>

**4xxErrors**  
**标签：**BucketName、FilterId  
**警报描述：**当 S3 存储桶的 4xx 错误率超过 5% 时发出警报。  
**意图：**检测异常的客户端错误率。  
**PromQL 标准：**`avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**超过 5% 表示存在设置或访问问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**5xxErrors**  
**标签：**BucketName、FilterId  
**警报描述：**当 S3 存储桶的 5xx 错误率超过 5% 时发出警报。  
**意图：**检测影响应用程序的服务器端错误。  
**PromQL 标准：**`avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**超过 5% 表示存在 S3 服务问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**OperationsFailedReplication**  
**标签：**SourceBucket、DestinationBucket、RuleId  
**警报描述：**当存储桶的 S3 复制操作失败时发出警报。  
**意图：**检测可能导致数据不一致的复制失败。  
**PromQL 标准：**`max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何失败的复制都需要进行调查。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## S3 对象 Lambda
<a name="Recommended_PromQL_S3ObjectLambda"></a>

**4xxErrors**  
**标签：**AccessPointName、DataSourceARN  
**警报描述：**当 S3 对象 Lambda 接入点的 4xx 错误率超过 5% 时发出警报。  
**意图：**检测对象 Lambda 的异常客户端错误率。  
**PromQL 标准：**`avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**超过 5% 表示存在设置问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**5xxErrors**  
**标签：**AccessPointName、DataSourceARN  
**警报描述：**当 S3 对象 Lambda 接入点的 5xx 错误率超过 5% 时发出警报。  
**意图：**检测对象 Lambda 中的服务器端错误。  
**PromQL 标准：**`avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**超过 5% 表示存在 Lambda 或 S3 问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**LambdaResponse4xx**  
**标签：**AccessPointName、DataSourceARN  
**警报描述：**当 S3 对象 Lambda 接入点的 Lambda 函数 4xx 响应率超过 5% 时发出警报。  
**意图：**检测 Lambda 函数客户端错误。  
**PromQL 标准：**`avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**推荐阈值：**0.05（嵌入在查询中）  
**阈值理由：**超过 5% 表示存在 Lambda 函数问题。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

## SNS
<a name="Recommended_PromQL_SNS"></a>

**NumberOfMessagesPublished**  
**标签：**TopicName  
**警报描述：**当 SNS 主题的已发布消息数量低于阈值时发出警报。  
**意图：**检测发布量显著下降。  
**PromQL 标准：**`sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据最低预期流量进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsDelivered**  
**标签：**TopicName  
**警报描述：**当 SNS 主题的已传递通知数量低于阈值时发出警报。  
**意图：**检测通知传送量下降。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据最低预期交付进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsFailed**  
**标签：**TopicName  
**警报描述：**当失败的通知传送计数超过 SNS 主题的阈值时发出警报。  
**意图：**检测传送失败。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的失败率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsFilteredOut-InvalidAttributes**  
**标签：**TopicName  
**警报描述：**当通知因消息属性无效而被筛选掉时发出警报。  
**意图：**检测无效的消息属性。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何无效的筛选条件都表示配置错误。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsFilteredOut-InvalidMessageBody**  
**标签：**TopicName  
**警报描述：**当通知因消息正文无效而被筛选掉时发出警报。  
**意图：**检测无效的消息正文。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何无效的筛选条件都表示配置错误。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsRedrivenToDlq**  
**标签：**TopicName  
**警报描述：**当 SNS 主题的通知被发送到死信队列时发出警报。  
**意图：**检测发送到死信队列的消息。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**任何 DLQ 消息都表示存在交付问题。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**NumberOfNotificationsFailedToRedriveToDlq**  
**标签：**TopicName  
**警报描述：**当 SNS 主题的通知未能发送到死信队列时发出警报。  
**意图：**检测 DLQ 交付失败。  
**PromQL 标准：**`sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**失败的 DLQ 意味着缺失错误跟踪。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**SMSMonthToDateSpentUSD**  
**标签：**TopicName  
**警报描述：**当短信支出接近 SNS 主题的账户配额时发出警报。  
**意图：**检测接近配额的短信支出。  
**PromQL 标准：**`max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据账户短信配额进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

**SMSSuccessRate**  
**标签：**TopicName  
**警报描述：**当 SNS 主题的短信传输成功率低于阈值时发出警报。  
**意图：**检测失败的短信传输。  
**PromQL 标准：**`avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的传输速率进行设置。  
**评估间隔：**60  
**待处理周期：**300  
**恢复周期：**300

## SQS
<a name="Recommended_PromQL_SQS"></a>

**ApproximateAgeOfOldestMessage**  
**标签：**QueueName  
**警报描述：**当最早消息期限超过 SQS 队列的阈值时发出警报。  
**意图：**检测处理速度不够快的消息。  
**PromQL 标准：**`max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据可接受的消息处理时间进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**ApproximateNumberOfMessagesNotVisible**  
**标签：**QueueName  
**警报描述：**当动态消息数量超过 SQS 队列的阈值时发出警报。  
**意图：**检测表明使用器问题的高动态消息。  
**PromQL 标准：**`avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期的处理量进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**ApproximateNumberOfMessagesVisible**  
**标签：**QueueName  
**警报描述：**当可见消息数量超过 SQS 队列的阈值时发出警报。  
**意图：**检测表明使用器速度慢的消息积压。  
**PromQL 标准：**`avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**推荐阈值：**{{THRESHOLD}}（嵌入在查询中）  
**阈值理由：**根据预期的队列深度进行设置。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

**NumberOfMessagesSent**  
**标签：**QueueName  
**警报描述：**当没有消息发送到 SQS 队列时发出警报。  
**意图：**检测停止发送消息的产生器。  
**PromQL 标准：**`sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0`  
**推荐阈值：**0（嵌入在查询中）  
**阈值理由：**零条消息表示产生器失败。  
**评估间隔：**60  
**待处理周期：**900  
**恢复周期：**900

## VPN
<a name="Recommended_PromQL_VPN"></a>

**TunnelState（VPN 级别）**  
**标签：**VpnId  
**警报描述：**当至少一个 VPN 隧道处于 DOWN 状态时发出警报。  
**意图：**检测处于 DOWN 状态的至少一条隧道。  
**PromQL 标准：**`min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**低于 1 意味着隧道关闭。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900

**TunnelState（隧道级别）**  
**标签：**TunnelIpAddress  
**警报描述：**当特定 VPN 隧道处于 DOWN 状态时发出警报。  
**意图：**检测处于 DOWN 状态的特定隧道。  
**PromQL 标准：**`min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1`  
**推荐阈值：**1（嵌入在查询中）  
**阈值理由：**低于 1 意味着隧道关闭。  
**评估间隔：**300  
**待处理周期：**900  
**恢复周期：**900