View a markdown version of this page

推荐的 PromQL 警报 - Amazon CloudWatch
Amazon Web Services 文档中描述的 Amazon Web Services 服务或功能可能因区域而异。要查看适用于中国区域的差异,请参阅 中国的 Amazon Web Services 服务入门 (PDF)

推荐的 PromQL 警报

将这些 PromQL 警报用作经典推荐警报的等效警报。它们使用 PromQL 即时查询来监控相同指标,这些查询会根据通过 CloudWatch OTLP 端点摄取的指标进行评估。

PromQL 警报使用 EvaluationCriteriaPromQLCriteria。与经典指标警报不同,阈值直接嵌入到 PromQL 查询表达式中。

  • 待处理周期:警报转换为 ALARM 状态之前时间序列必须持续违规的持续时间(以秒为单位)。

  • 恢复周期:警报恢复到 OK 状态之前所有时间序列必须停止违规的持续时间(以秒为单位)。

  • 评估间隔:CloudWatch 运行 PromQL 查询的频率(以秒为单位)。

注意

这些警报需要通过 CloudWatch OTLP 端点发布的指标。有关更多信息,请参阅 PromQL 警报

您可以使用 Amazon CloudFormation 部署这些警报。请对 AWS::CloudWatch::Alarm 资源使用 EvaluationCriteriaPromQLCriteria 属性。

REST API

4XXError

标签:ApiName、Stage

警报描述:当 REST API 阶段的平均 4XX 错误率超过 5% 时发出警报。

意图:检测高客户端错误率,表明存在请求问题。

PromQL 标准:avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的客户端错误率,这表示严重的请求失败。

评估间隔:60

待处理周期:300

恢复周期:300

5XXError

标签:ApiName、Stage

警报描述:当 REST API 阶段的平均 5XX 错误率超过 5% 时发出警报。

意图:检测高服务器错误率,表明存在后端故障。

PromQL 标准:avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的服务器错误率,需要立即进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

延迟

标签:ApiName、Stage

警报描述:当 REST API 阶段的 p90 延迟超过 2500 毫秒时发出警报。

意图:检测影响用户体验的高 p90 延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

推荐阈值:2500(嵌入在查询中)

阈值理由:p90 延迟超过 2500 毫秒表示大多数请求的响应时间下降。

评估间隔:60

待处理周期:300

恢复周期:300

:计数

标签:ApiName、Stage

警报描述:当 REST API 阶段的总请求数低于预期基准时发出警报。

意图:检测低流量,可能表示存在路由或可用性问题。

PromQL 标准:sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期流量基准进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

HTTP API

4xx

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的平均 4xx 错误率超过 5% 时发出警报。

意图:检测 HTTP API 端点的高客户端错误率。

PromQL 标准:avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的客户端错误率。

评估间隔:60

待处理周期:300

恢复周期:300

5xx

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的平均 5xx 错误率超过 5% 时发出警报。

意图:检测 HTTP API 端点的高服务器错误率。

PromQL 标准:avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的服务器错误率,需要进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

延迟

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的 p90 延迟超过 2500 毫秒时发出警报。

意图:检测 HTTP API 端点的高 p90 延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

推荐阈值:2500(嵌入在查询中)

阈值理由:p90 延迟超过 2500 毫秒表示响应时间下降。

评估间隔:60

待处理周期:300

恢复周期:300

IntegrationLatency

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。

意图:检测高后端集成延迟,影响响应时间。

PromQL 标准:histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

推荐阈值:2000(嵌入在查询中)

阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。

评估间隔:60

待处理周期:300

恢复周期:300

:计数

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的总请求数低于预期基准时发出警报。

意图:检测低流量,可能表示存在路由或可用性问题。

PromQL 标准:sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期流量基准进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

WebSocket API

ClientError

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的平均客户端错误率超过 5% 时发出警报。

意图:检测 WebSocket API 连接的高客户端错误率。

PromQL 标准:avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测 WebSocket 连接超过 5% 的客户端错误率。

评估间隔:60

待处理周期:300

恢复周期:300

ExecutionError

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的平均执行错误率超过 5% 时发出警报。

意图:检测 WebSocket API 的高服务器端执行错误率。

PromQL 标准:avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的执行错误率,需要进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

IntegrationLatency

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。

意图:检测 WebSocket API 路由的高后端集成延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

推荐阈值:2000(嵌入在查询中)

阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。

评估间隔:60

待处理周期:300

恢复周期:300

MessageCount

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的总消息数低于预期基准时发出警报。

意图:检测低消息量,可能表示存在连接或路由问题。

PromQL 标准:sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期消息量进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

GroupInServiceCapacity

标签:AutoScalingGroupName

警报描述:当自动扩缩组的平均服务中容量低于预期最低值时发出警报。

意图:检测由于启动失败或实例终止而导致的低可用性。

PromQL 标准:avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据所需的最低容量进行设置,以检测启动失败或实例不足情形。

评估间隔:60

待处理周期:600

恢复周期:600

DaysToExpiry

标签:CertificateArn

警报描述:当证书到期的最短天数降至 44 天或更短时发出警报。

意图:主动发出证书到期警报,以便有时间进行续订。

PromQL 标准:min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

推荐阈值:44(嵌入在查询中)

阈值理由:在证书过期之前提供足够的准备时间来完成续订过程。

评估间隔:86400

待处理周期:86400

恢复周期:86400

5xxErrorRate

标签:DistributionId

警报描述:当平均 5xx 错误率超过 CloudFront 分配的阈值时发出警报。

意图:检测影响内容交付的高源或 CloudFront 错误率。

PromQL 标准:avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的内容分发错误率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

OriginLatency

标签:DistributionId

警报描述:当 p90 源延迟超过 CloudFront 分配的阈值时发出警报。

意图:检测影响内容交付性能的高源响应延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期源响应时间和缓存策略进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FunctionValidationErrors

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数验证错误时发出警报。

意图:检测阻止函数执行的 CloudFront 函数验证失败。

PromQL 标准:sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何验证错误都表明存在需要注意的函数配置问题。

评估间隔:60

待处理周期:120

恢复周期:120

FunctionExecutionErrors

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数执行错误时发出警报。

意图:检测 CloudFront 函数中影响请求处理的运行时故障。

PromQL 标准:sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何执行错误都表明函数代码存在运行时问题。

评估间隔:60

待处理周期:300

恢复周期:300

FunctionThrottles

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数节流时发出警报。

意图:检测可能会降低请求处理的 CloudFront 函数节流。

PromQL 标准:sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何节流都表明函数达到了计算限制。

评估间隔:60

待处理周期:300

恢复周期:300

SignUpThrottles

标签:UserPool、UserPoolClient

警报描述:当注册节流事件超过用户池的阈值时发出警报。

意图:检测阻止新用户注册的注册节流。

PromQL 标准:sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据注册操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

SignInThrottles

标签:UserPool、UserPoolClient

警报描述:当登录节流事件超过用户池的阈值时发出警报。

意图:检测阻止用户身份验证的登录节流。

PromQL 标准:sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据登录操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

TokenRefreshTrott

标签:UserPool、UserPoolClient

警报描述:当令牌刷新节流事件超过用户池的阈值时发出警报。

意图:检测可能会导致会话中断的令牌刷新节流。

PromQL 标准:sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据令牌刷新操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FederationThrottles

标签:UserPool、UserPoolClient、IdentityProvider

警报描述:当联合身份验证节流事件超过用户池身份提供者的阈值时发出警报。

意图:检测可能会阻止联合登录的联合节流。

PromQL 标准:sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据联合身份验证操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

AccountProvisionedReadCapacityUtilization

标签:

警报描述:当账户级别的预置读取容量利用率超过 80% 时发出警报。

意图:检测预置的读取容量何时接近账户限制。

PromQL 标准:max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。

评估间隔:300

待处理周期:600

恢复周期:600

AccountProvisionedWriteCapacityUtilization

标签:

警报描述:当账户级别的预置写入容量利用率超过 80% 时发出警报。

意图:检测预置的写入容量何时接近账户限制。

PromQL 标准:max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。

评估间隔:300

待处理周期:600

恢复周期:600

AgeOfOldestUnreplicatedRecord

标签:TableName、DelegatedOperation

警报描述:当最早的未复制记录的期限超过阈值时发出警报。

意图:检测可能导致全局表中的数据过时的复制延迟。

PromQL 标准:max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据复制新鲜度要求进行设置。

评估间隔:300

待处理周期:900

恢复周期:900

FailedToReplicateRecordCount

标签:TableName、DelegatedOperation

警报描述:当全局表中任何记录复制失败时发出警报。

意图:检测导致跨区域数据不一致的复制失败。

PromQL 标准:sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何失败的复制都表明存在数据一致性问题,需要立即关注。

评估间隔:60

待处理周期:60

恢复周期:60

ReadThrottleEvents

标签:TableName

警报描述:当读取节流事件超过表的阈值时发出警报。

意图:检测表示预置容量不足的读取节流。

PromQL 标准:sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据读取操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReadThrottleEvents (GSI)

标签:TableName、GlobalSecondaryIndexName

警报描述:当读取节流事件超过全局二级索引的阈值时发出警报。

意图:检测 GSI 上表示索引容量不足的读取节流。

PromQL 标准:sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据 GSI 读取操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicationLatency

标签:TableName、ReceivingRegion

警报描述:当平均复制延迟超过全局表的阈值时发出警报。

意图:检测可能导致副本区域读取过时的高复制延迟。

PromQL 标准:avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据副本区域的数据新鲜度要求进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

SuccessfulRequestLatency

标签:TableName、Operation

警报描述:当平均成功请求延迟超过表操作的阈值时发出警报。

意图:检测影响应用程序性能的 DynamoDB 操作高延迟。

PromQL 标准:avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据特定 DynamoDB 操作的延迟 SLA 进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

SystemErrors

标签:TableName

警报描述:当系统错误超过表的阈值时发出警报。

意图:检测影响表可用性的 DynamoDB 服务端错误。

PromQL 标准:sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据表可接受的系统错误计数进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ThrottledPutRecordCount

标签:TableName、DelegatedOperation

警报描述:当受限的放置记录计数超过表的阈值时发出警报。

意图:检测可能导致流式操作数据丢失的受限 put。

PromQL 标准:max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据流式放置操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

UserErrors

标签:

警报描述:当用户错误超过整个账户的阈值时发出警报。

意图:检测高客户端错误率,例如验证或条件检查失败。

PromQL 标准:sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据客户端请求失败可接受的错误率进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

WriteThrottleEvents

标签:TableName

警报描述:当写入节流事件超过表的阈值时发出警报。

意图:检测表示预置容量不足的写入节流。

PromQL 标准:sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据写入操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

WriteThrottleEvents (GSI)

标签:TableName、GlobalSecondaryIndexName

警报描述:当写入节流事件超过全局二级索引的阈值时发出警报。

意图:检测 GSI 上表示索引容量不足的写入节流。

PromQL 标准:sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据 GSI 写入操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

VolumeStalledIOCheck

标签:VolumeId、InstanceId

警报描述:当 EBS 卷报告停滞的 I/O 检查失败时发出警报。

意图:检测 EBS 卷上停滞的 I/O,表示卷受损。

PromQL 标准:max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:1 或更大值表示卷已停滞 I/O,需要立即进行调查。

评估间隔:60

待处理周期:600

恢复周期:600

CPUUtilization

标签:InstanceId

警报描述:当 EC2 实例的平均 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 阈值在饱和之前留出余量。

评估间隔:300

待处理周期:900

恢复周期:900

StatusCheckFailed

标签:InstanceId

警报描述:当 EC2 实例的实例或系统运行状况检查失败时发出警报。

意图:检测实例或系统运行状况问题。

PromQL 标准:max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:任何状态检查失败都需要调查。

评估间隔:300

待处理周期:600

恢复周期:600

StatusCheckFailed_AttachedEBS

标签:InstanceId

警报描述:当附加的 EBS 卷对 EC2 实例无法访问时发出警报。

意图:检测无法访问的 EBS 卷。

PromQL 标准:max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:无法访问的卷导致 I/O 故障。

评估间隔:60

待处理周期:600

恢复周期:600

CPUReservation

标签:ClusterName

警报描述:当 ECS 集群的平均 CPU 预留率超过 80% 时发出警报。

意图:检测接近 CPU 容量的集群。

PromQL 标准:avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 预留表示新任务的余量有限。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均 CPU 利用率超过 80% 时发出警报。

意图:检测 ECS 服务的高 CPU 利用率。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

EBSFilesystemUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均 EBS 文件系统利用率超过 80% 时发出警报。

意图:检测高 EBS 存储利用率。

PromQL 标准:avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

MemoryReservation

标签:ClusterName

警报描述:当 ECS 集群的平均内存预留率超过 80% 时发出警报。

意图:检测接近内存容量的集群。

PromQL 标准:avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 预留表示新任务的余量有限。

评估间隔:60

待处理周期:300

恢复周期:300

MemoryUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

HTTPCode_Target_5XX_Count

标签:ClusterName、ServiceName

警报描述:当 HTTP 5XX 错误计数超过 ECS 服务的阈值时发出警报。

意图:检测高服务器端错误计数。

PromQL 标准:sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据应用程序的正常错误率基准进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

TargetResponseTime

标签:ClusterName、ServiceName

警报描述:当平均目标响应时间超过 ECS 服务的阈值时发出警报。

意图:检测高目标响应时间。

PromQL 标准:avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:基于应用程序可接受的延迟要求进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

EphemeralStorageUtilized

标签:ClusterName、ServiceName

警报描述:当平均临时存储用量超过 Fargate 任务的阈值时发出警报。

意图:检测 Fargate 任务的高临时存储用量。

PromQL 标准:avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据任务的临时存储分配进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

RunningTaskCount

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的运行任务计数降至零时发出警报。

意图:检测何时没有任务正在运行。

PromQL 标准:avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零个运行任务表示服务中断。

评估间隔:60

待处理周期:300

恢复周期:300

instance_filesystem_utilization

标签:InstanceId、ContainerInstanceId、ClusterName

警报描述:当容器实例的平均文件系统利用率超过 90% 时发出警报。

意图:检测高文件系统利用率。

PromQL 标准:avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:90% 文件系统利用率为操作空间留下最少空间。

评估间隔:60

待处理周期:300

恢复周期:300

TaskCpuUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均任务 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskCpuUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均任务 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskMemoryUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均任务内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskMemoryUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均任务内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerCpuUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均容器 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerCpuUtilization(容器级别)

标签:ContainerName、ClusterName、ServiceName

警报描述:当容器级别的平均容器 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerMemoryUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均容器内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerMemoryUtilization(容器级别)

标签:ContainerName、ClusterName、ServiceName

警报描述:当容器级别的平均容器内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEBSfilesystemUtilization

标签:ClusterName、ServiceName

警报描述:当任务的平均 EBS 文件系统利用率超过 80% 时发出警报。

意图:检测高 EBS 文件系统利用率。

PromQL 标准:avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEphemeralStorageUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均临时存储利用率超过 80% 时发出警报。

意图:检测高临时存储利用率。

PromQL 标准:avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEphemeralStorageUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均临时存储利用率超过 80% 时发出警报。

意图:检测高临时存储利用率。

PromQL 标准:avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

PercentIOLimit

标签:FileSystemId

警报描述:当 EFS 文件系统达到其 I/O 限制的 100% 时发出警报。

意图:检测文件系统何时达到 I/O 限制。

PromQL 标准:avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

推荐阈值:100(嵌入在查询中)

阈值理由:100% 时,文件系统成为瓶颈。

评估间隔:60

待处理周期:900

恢复周期:900

BurstCreditBalance

标签:FileSystemId

警报描述:当 EFS 文件系统的突增积分余额降至零时发出警报。

意图:检测导致吞吐量减慢的耗尽的突增积分。

PromQL 标准:avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零积分导致吞吐量降低。

评估间隔:60

待处理周期:900

恢复周期:900

node_cpu_utilization

标签:ClusterName

警报描述:当 EKS Worker 节点上的最大 CPU 利用率超过 80% 时发出警报。

意图:检测 Worker 节点上的高 CPU。

PromQL 标准:max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

node_filesystem_utilization

标签:ClusterName

警报描述:当最大文件系统利用率超过 EKS Worker 节点的阈值时发出警报。

意图:检测 Worker 节点上的高文件系统使用率。

PromQL 标准:max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值说明:根据节点的存储容量和使用模式进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

node_memory_utilization

标签:ClusterName

警报描述:当 EKS Worker 节点上的最大内存利用率超过 80% 时发出警报。

意图:检测 Worker 节点上的高内存。

PromQL 标准:max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

pod_cpu_utilization_over_pod_limit

标签:ClusterName、Namespace、Service

警报描述:当容器组(pod)CPU 利用率超过其限制的 80% 时发出警报。

意图:检测接近 CPU 限制的容器组(pod)。

PromQL 标准:max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在节流发生之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

pod_memory_utilization_over_pod_limit

标签:ClusterName、Namespace、Service

警报描述:当容器组(pod)内存利用率超过其限制的 80% 时发出警报。

意图:检测接近内存限制的容器组(pod)。

PromQL 标准:max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在 OOMKill 发生之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:CacheClusterId、CacheNodeId

警报描述:当平均 CPU 利用率超过 ElastiCache 节点的阈值时发出警报。

意图:检测实例的高 CPU。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据节点类型和工作负载特征进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

CurrConnections

标签:CacheClusterId、CacheNodeId

警报描述:当连接计数超过 ElastiCache 节点的阈值时发出警报。

意图:检测高连接计数。

PromQL 标准:avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期连接池大小和应用程序需求进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

DatabaseMemoryUsagePercentage

标签:CacheClusterId

警报描述:当数据库内存使用量超过 ElastiCache 集群的阈值时发出警报。

意图:检测高内存使用率以防止写入失败。

PromQL 标准:avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据驱逐策略和数据重要性进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

EngineCPUUtilization

标签:CacheClusterId

警报描述:当 ElastiCache 集群的 Redis 引擎 CPU 利用率超过 90% 时发出警报。

意图:检测高 Redis 引擎 CPU 利用率。

PromQL 标准:avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:Redis 是单线程的;超过 90% 表示已饱和。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicationLag

标签:CacheClusterId

警报描述:当复制延迟超过 ElastiCache 集群的阈值时发出警报。

意图:检测影响数据一致性的复制延迟。

PromQL 标准:avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据应用程序对过时读取的容忍度进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

GPUConnectivityCheckFailed

标签:InstanceId、EGPUId

警报描述:当 Elastic Graphics 加速器与实例失去连接时发出警报。

意图:检测与 Elastic Graphics 加速器的连接问题。

PromQL 标准:max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何连接失败都需要调查。

评估间隔:300

待处理周期:900

恢复周期:900

GPUHealthCheckFailed

标签:InstanceId、EGPUId

警报描述:当 Elastic Graphics 加速器运行状况检查失败时发出警报。

意图:检测运行状况不佳的 Elastic Graphics 加速器。

PromQL 标准:max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:运行状况检查失败表示存在加速器问题。

评估间隔:300

待处理周期:900

恢复周期:900

TargetErrorThrottledCount

警报描述:当计划目标调用受到限制时发出警报。

意图:检测导致计划延迟的目标节流。

PromQL 标准:sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何节流都表明存在目标容量问题。

评估间隔:60

待处理周期:900

恢复周期:900

InvocationThrottleCount

警报描述:当调度器调用受到限制时发出警报。

意图:检测调度器调用节流。

PromQL 标准:sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:节流延迟计划的执行。

评估间隔:60

待处理周期:900

恢复周期:900

InvocationDroppedCount

警报描述:当计划的调用被丢弃时发出警报。

意图:检测丢弃的调用。

PromQL 标准:sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:丢弃的调用表示计划的事件丢失。

评估间隔:60

待处理周期:60

恢复周期:60

InvocationsFailedToBeSentToDeadLetterCount

警报描述:当失败的调用无法发送到死信队列时发出警报。

意图:检测 DLQ 交付失败。

PromQL 标准:sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:失败的 DLQ 交付意味着缺失错误信息。

评估间隔:60

待处理周期:900

恢复周期:900

GetRecords.IteratorAgeMilliseconds

标签:StreamName

警报描述:当使用器迭代器期限超过 Kinesis 流的阈值时发出警报。

意图:检测落后于保留期的数据,可能导致数据丢失。

PromQL 标准:max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据流保留期百分比进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

GetRecords.Success

标签:StreamName

警报描述:当 GetRecords 成功率低于 Kinesis 流的阈值时发出警报。

意图:检测使用器检索失败。

PromQL 标准:avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期成功率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PutRecord.Success

标签:StreamName

警报描述:当 PutRecord 成功率低于 Kinesis 流的阈值时发出警报。

意图:检测产生器摄取失败。

PromQL 标准:avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期成功率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PutRecords.FailedRecords

标签:StreamName

警报描述:当批量放置操作为 Kinesis 流产生失败记录时发出警报。

意图:检测批量放置失败。

PromQL 标准:sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的失败计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReadProvisionedThroughputExceeded

标签:StreamName

警报描述:当使用器读取超过 Kinesis 流的预置吞吐量时发出警报。

意图:检测使用器读取节流。

PromQL 标准:avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:任何持续节流都表明容量需求。

评估间隔:60

待处理周期:300

恢复周期:300

SubscribeToShardEvent.MillisBehindLatest

标签:StreamName、ConsumerName

警报描述:当增强型扇出使用器落后于最新记录时发出警报。

意图:检测增强型扇出使用器处理延迟。

PromQL 标准:avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的处理延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

WriteProvisionedThroughputExceeded

标签:StreamName

警报描述:当产生器写入超过 Kinesis 流的预置吞吐量时发出警报。

意图:检测产生器写入节流。

PromQL 标准:avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:持续节流表明容量需求。

评估间隔:60

待处理周期:300

恢复周期:300

ClaimedAccountConcurrency

警报描述:当申领的账户并发数超过阈值时发出警报。

意图:检测接近并发配额的账户。

PromQL 标准:max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为区域并发限制百分比。

评估间隔:60

待处理周期:600

恢复周期:600

错误

标签:FunctionName

警报描述:当函数错误计数超过 Lambda 函数的阈值时发出警报。

意图:检测高函数错误计数。

PromQL 标准:sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的错误量进行设置。

评估间隔:60

待处理周期:180

恢复周期:300

节流

标签:FunctionName

警报描述:当 Lambda 函数的函数调用受到限制时发出警报。

意图:检测函数调用节流。

PromQL 标准:sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:节流表明已达到并发限制。

评估间隔:60

待处理周期:300

恢复周期:300

Duration

标签:FunctionName

警报描述:当 p90 函数持续时间超过 Lambda 函数的阈值时发出警报。

意图:检测长时间运行的函数调用。

PromQL 标准:histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:相对于函数超时进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ConcurrentExecutions

标签:FunctionName

警报描述:当并发执行超过 Lambda 函数的阈值时发出警报。

意图:检测接近并发限制的函数。

PromQL 标准:max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为预留并发百分比。

评估间隔:60

待处理周期:600

恢复周期:600

memory_utilization

标签:function_name

警报描述:当 Lambda 函数的平均内存利用率超过 90% 时发出警报。

意图:检测接近配置的内存限制的函数。

PromQL 标准:avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:超过 90% 可能会导致内存不足故障。

评估间隔:60

待处理周期:600

恢复周期:600

ErrorPortAllocation

标签:NatGatewayId

警报描述:当 NAT 网关无法为新连接分配端口时发出警报。

意图:检测阻止新连接的端口分配失败。

PromQL 标准:sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何分配失败都会影响连接。

评估间隔:60

待处理周期:900

恢复周期:900

PacketsDropCount

标签:NatGatewayId

警报描述:当 NAT 网关丢弃的数据包超过阈值时发出警报。

意图:检测表明容量或连接问题的数据包丢弃。

PromQL 标准:sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的下降率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PacketsDropped

标签:VpcId、VpcEndpointId、EndpointType、SubnetId、ServiceName

警报描述:当 VPC 端点丢弃的数据包超过阈值时发出警报。

意图:检测运行状况不佳的端点或端点服务。

PromQL 标准:sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的下降率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

RstPacketsSent

标签:ServiceId、LoadBalancerArn、Az

警报描述:当 RST 数据包速率超过端点服务的阈值时发出警报。

意图:检测端点服务运行状况不佳的目标。

PromQL 标准:sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的 RST 数据包速率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的平均 CPU 利用率超过 90% 时发出警报。

意图:检测防止性能下降的高 CPU。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

推荐阈值:90(嵌入在查询中)

阈值说明:90% 表示接近饱和。

评估间隔:60

待处理周期:300

恢复周期:300

DatabaseConnections

标签:DBInstanceIdentifier

警报描述:当数据库连接超过 RDS 实例的阈值时发出警报。

意图:防止在最大限制下连接被拒绝。

PromQL 标准:avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为 max_connections 参数百分比。

评估间隔:60

待处理周期:300

恢复周期:300

EBSByteBalance%

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的 EBS 字节余额低于 10% 时发出警报。

意图:检测导致瓶颈的低吞吐量积分。

PromQL 标准:avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

推荐阈值:10(嵌入在查询中)

阈值理由:低于 10% 可能会导致吞吐量下降。

评估间隔:60

待处理周期:180

恢复周期:180

EBSIOBalance%

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的 EBS IO 余额低于 10% 时发出警报。

意图:检测导致瓶颈的低 IOPS 积分。

PromQL 标准:avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

推荐阈值:10(嵌入在查询中)

阈值理由:低于 10% 可能会导致 IOPS 下降。

评估间隔:60

待处理周期:180

恢复周期:180

FreeableMemory

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的可用内存低于阈值时发出警报。

意图:防止导致连接被拒绝的内存不足情形。

PromQL 标准:avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值说明:根据实例类内存进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

FreeLocalStorage

标签:DBInstanceIdentifier

警报描述:当可用本地存储空间低于 Aurora 实例的阈值时发出警报。

意图:防止 Aurora 本地存储耗尽。

PromQL 标准:avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据操作所需的最低值进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FreeStorageSpace

标签:DBInstanceIdentifier

警报描述:当可用存储空间低于 RDS 实例的阈值时发出警报。

意图:防止存储空间已满导致的停机。

PromQL 标准:min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据存储增长率和预置大小进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

MaximumUsedTransactionIDs

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的最大已用事务 ID 超过 10 亿时发出警报。

意图:防止 PostgreSQL 事务 ID 重叠。

PromQL 标准:avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

推荐阈值:1000000000(嵌入查询中)

阈值理由:10 亿表示接近重叠危险。

评估间隔:60

待处理周期:60

恢复周期:60

ReadLatency

标签:DBInstanceIdentifier

警报描述:当 p90 读取延迟超过 RDS 实例的阈值时发出警报。

意图:检测高读取延迟,表明存在磁盘问题。

PromQL 标准:histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的应用程序延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicaLag

标签:DBInstanceIdentifier

警报描述:当 RDS 只读副本的复制延迟超过 60 秒时发出警报。

意图:检测可能会导致数据丢失的复制延迟。

PromQL 标准:max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

推荐阈值:60(嵌入在查询中)

阈值理由:对于大多数工作负载,60 秒都表示显著延迟。

评估间隔:60

待处理周期:600

恢复周期:600

WriteLatency

标签:DBInstanceIdentifier

警报描述:当 p90 写入延迟超过 RDS 实例的阈值时发出警报。

意图:检测高写入延迟,表明存在磁盘问题。

PromQL 标准:histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的应用程序延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

DBLoad

标签:DBInstanceIdentifier

警报描述:当平均数据库负载超过 RDS 实例的阈值时发出警报。

意图:检测高数据库负载下降性能。

PromQL 标准:avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为 vCPU 计数的倍数。

评估间隔:60

待处理周期:900

恢复周期:900

AuroraVolumeBytesLeftTotal

标签:DBClusterIdentifier

警报描述:当 Aurora 集群剩余存储字节数低于阈值时发出警报。

意图:防止 Aurora 集群存储耗尽。

PromQL 标准:avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据增长率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

AuroraBinlogReplicaLag

标签:DBClusterIdentifier

警报描述:当 Aurora 二进制日志副本延迟指示错误状态时发出警报。

意图:检测写入器实例复制错误。

PromQL 标准:avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

推荐阈值:-1(嵌入在查询中)

阈值理由:-1 表示错误状态。

评估间隔:60

待处理周期:120

恢复周期:120

BlockedTransactions

标签:DBInstanceIdentifier

警报描述:当被阻止事务计数超过 RDS 实例的阈值时发出警报。

意图:检测导致性能下降的事务阻止。

PromQL 标准:avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的被阻止事务计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

BufferCacheHitRatio

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的缓冲区缓存命中率低于 80% 时发出警报。

意图:检测导致性能下降的缓存效率低下。

PromQL 标准:avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

推荐阈值:80(嵌入在查询中)

阈值理由:低于 80% 表示磁盘 I/O 过多。

评估间隔:60

待处理周期:600

恢复周期:600

EngineUptime

标签:DBClusterIdentifier

警报描述:当引擎正常运行时间降至零时发出警报,其表示 Aurora 写入器重启。

意图:检测 Aurora 写入器实例停机或崩溃。

PromQL 标准:avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零正常运行时间表示实例重启。

评估间隔:60

待处理周期:120

恢复周期:120

RollbackSegmentHistoryListLength

标签:DBInstanceIdentifier

警报描述:当 Aurora 实例的回滚分段历史记录列表长度超过 100 万时发出警报。

意图:检测导致 CPU 降级的高回滚历史记录。

PromQL 标准:avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

推荐阈值:1000000(嵌入在查询中)

阈值理由:高于 1M 导致性能问题。

评估间隔:60

待处理周期:300

恢复周期:300

StorageNetworkThroughput

标签:DBClusterIdentifier

警报描述:当存储网络吞吐量超过 Aurora 集群的阈值时发出警报。

意图:检测可能导致网络数据包丢弃的高吞吐量。

PromQL 标准:avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据实例网络容量进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

HealthCheckStatus

标签:HealthCheckId

警报描述:当 Route 53 运行状况检查报告端点运行状况不佳时发出警报。

意图:通过 Route 53 运行状况检查程序检测运行状况不佳的端点。

PromQL 标准:avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 表示端点未通过运行状况检查。

评估间隔:60

待处理周期:180

恢复周期:180

4xxErrors

标签:BucketName、FilterId

警报描述:当 S3 存储桶的 4xx 错误率超过 5% 时发出警报。

意图:检测异常的客户端错误率。

PromQL 标准:avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在设置或访问问题。

评估间隔:60

待处理周期:900

恢复周期:900

5xxErrors

标签:BucketName、FilterId

警报描述:当 S3 存储桶的 5xx 错误率超过 5% 时发出警报。

意图:检测影响应用程序的服务器端错误。

PromQL 标准:avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 S3 服务问题。

评估间隔:60

待处理周期:900

恢复周期:900

OperationsFailedReplication

标签:SourceBucket、DestinationBucket、RuleId

警报描述:当存储桶的 S3 复制操作失败时发出警报。

意图:检测可能导致数据不一致的复制失败。

PromQL 标准:max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何失败的复制都需要进行调查。

评估间隔:60

待处理周期:300

恢复周期:300

4xxErrors

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 4xx 错误率超过 5% 时发出警报。

意图:检测对象 Lambda 的异常客户端错误率。

PromQL 标准:avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在设置问题。

评估间隔:60

待处理周期:900

恢复周期:900

5xxErrors

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 5xx 错误率超过 5% 时发出警报。

意图:检测对象 Lambda 中的服务器端错误。

PromQL 标准:avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 Lambda 或 S3 问题。

评估间隔:60

待处理周期:900

恢复周期:900

LambdaResponse4xx

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 Lambda 函数 4xx 响应率超过 5% 时发出警报。

意图:检测 Lambda 函数客户端错误。

PromQL 标准:avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 Lambda 函数问题。

评估间隔:60

待处理周期:900

恢复周期:900

NumberOfMessagesPublished

标签:TopicName

警报描述:当 SNS 主题的已发布消息数量低于阈值时发出警报。

意图:检测发布量显著下降。

PromQL 标准:sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据最低预期流量进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsDelivered

标签:TopicName

警报描述:当 SNS 主题的已传递通知数量低于阈值时发出警报。

意图:检测通知传送量下降。

PromQL 标准:sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据最低预期交付进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFailed

标签:TopicName

警报描述:当失败的通知传送计数超过 SNS 主题的阈值时发出警报。

意图:检测传送失败。

PromQL 标准:sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的失败率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFilteredOut-InvalidAttributes

标签:TopicName

警报描述:当通知因消息属性无效而被筛选掉时发出警报。

意图:检测无效的消息属性。

PromQL 标准:sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何无效的筛选条件都表示配置错误。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFilteredOut-InvalidMessageBody

标签:TopicName

警报描述:当通知因消息正文无效而被筛选掉时发出警报。

意图:检测无效的消息正文。

PromQL 标准:sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何无效的筛选条件都表示配置错误。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsRedrivenToDlq

标签:TopicName

警报描述:当 SNS 主题的通知被发送到死信队列时发出警报。

意图:检测发送到死信队列的消息。

PromQL 标准:sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何 DLQ 消息都表示存在交付问题。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFailedToRedriveToDlq

标签:TopicName

警报描述:当 SNS 主题的通知未能发送到死信队列时发出警报。

意图:检测 DLQ 交付失败。

PromQL 标准:sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:失败的 DLQ 意味着缺失错误跟踪。

评估间隔:60

待处理周期:300

恢复周期:300

SMSMonthToDateSpentUSD

标签:TopicName

警报描述:当短信支出接近 SNS 主题的账户配额时发出警报。

意图:检测接近配额的短信支出。

PromQL 标准:max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据账户短信配额进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

SMSSuccessRate

标签:TopicName

警报描述:当 SNS 主题的短信传输成功率低于阈值时发出警报。

意图:检测失败的短信传输。

PromQL 标准:avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的传输速率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ApproximateAgeOfOldestMessage

标签:QueueName

警报描述:当最早消息期限超过 SQS 队列的阈值时发出警报。

意图:检测处理速度不够快的消息。

PromQL 标准:max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的消息处理时间进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ApproximateNumberOfMessagesNotVisible

标签:QueueName

警报描述:当动态消息数量超过 SQS 队列的阈值时发出警报。

意图:检测表明使用器问题的高动态消息。

PromQL 标准:avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期的处理量进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ApproximateNumberOfMessagesVisible

标签:QueueName

警报描述:当可见消息数量超过 SQS 队列的阈值时发出警报。

意图:检测表明使用器速度慢的消息积压。

PromQL 标准:avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期的队列深度进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

NumberOfMessagesSent

标签:QueueName

警报描述:当没有消息发送到 SQS 队列时发出警报。

意图:检测停止发送消息的产生器。

PromQL 标准:sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零条消息表示产生器失败。

评估间隔:60

待处理周期:900

恢复周期:900

TunnelState(VPN 级别)

标签:VpnId

警报描述:当至少一个 VPN 隧道处于 DOWN 状态时发出警报。

意图:检测处于 DOWN 状态的至少一条隧道。

PromQL 标准:min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 意味着隧道关闭。

评估间隔:300

待处理周期:900

恢复周期:900

TunnelState(隧道级别)

标签:TunnelIpAddress

警报描述:当特定 VPN 隧道处于 DOWN 状态时发出警报。

意图:检测处于 DOWN 状态的特定隧道。

PromQL 标准:min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 意味着隧道关闭。

评估间隔:300

待处理周期:900

恢复周期:900