glue.driver.aggregate.numFailedTasks 当 Glue 作业失败时,CloudWatch 指标不会记录失败

Sta*_*agg 5 amazon-web-services amazon-cloudwatch aws-glue

我有一个 Glue PySpark 作业,大约 2 分钟后失败AnalysisException,运行状态为Failed。我想检测它的 CloudWatch 警报。在 CloudWatch 指标中,我预计它在此期间记录的计数为 1,但实际记录为 0。我正在使用以下指标配置:

   MetricName: glue.driver.aggregate.numFailedTasks
   JobRunId: ALL
   JobName: <MyGlueJobName>
   Statistic: Sum
   Period: 1 min
   Type: Count
Run Code Online (Sandbox Code Playgroud)

看起来其他指标正在工作,例如glue.driver.jvm.heap.used但不是numFailedTasks。难道我做错了什么?

Sta*_*agg 1

我设法解决这个问题的唯一方法是创建一个自定义指标。我使用put_metric_data创建了一个指标。当 pyspark 脚本中引发异常时,我会调用它。