news 2026/7/31 13:46:41

你的 SLO 已经告急;下面介绍如何在 Elastic Observability 中找出罪魁祸首

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
你的 SLO 已经告急;下面介绍如何在 Elastic Observability 中找出罪魁祸首

作者:来自 Elastic Roshan Gonsalkorale

当 SLO 告警检测到燃烧率( burn rate )激增时,你可以从告警详情页面沿着 SLI 逐步深入,通过异常事件 span 和追踪瀑布图( trace waterfall )定位正在消耗你的 SLO 错误预算的具体依赖项,整个调查过程无需离开当前分析流程。

Elastic Observability 中重新设计的 SLO 燃烧率( burn rate )告警详情页面,将告警与 SLI、背后的事件以及展示哪个依赖项正在消耗你的服务级别目标( SLO )错误预算的追踪关联在一起。你可以查看燃烧率何时开始上升,并排比较正常事件和异常事件的 span,然后沿着异常事件进入追踪瀑布图( trace waterfall ),定位发生故障的具体调用链路,全程无需切换工具。

本演练将使用 OpenTelemetry Demo( Astronomy Shop )展示完整的排查流程,其中一个发生故障的发货依赖导致每一次结账 SLI 都失败。你可以通过在 Elastic Observability 中运行该 Demo、为 checkout 定义一个 APM 可用性 SLO,并引入一个发生故障的依赖项来复现这一场景。

可用性

SLO 燃烧率分析现已在 Elastic Observability Serverless 中提供,并将在 9.5 中登陆 Elastic Cloud Hosted 和自托管部署。

Elastic Observability 中 SLO 燃烧率告警的前提条件

你需要一个已完成监测的服务,并在 Elastic Observability 中基于其 APM 数据定义一个 SLO。

  • 应用程序监测:使用以下任一方式:
    • 适用于 Java、 .NET、 Node.js、 Python、 PHP、 Ruby、 Go 及其他受支持语言的 Elastic APM agent。

    • Elastic Distributions of OpenTelemetry( EDOT )语言 SDK。

    • 使用 OpenTelemetry SDK,通过 EDOT Collector、 Elastic Agent、 APM Server 或托管 OTLP 端点发送 OTLP 数据。如果你使用自定义的上游 Collector 流水线,请同时包含 elasticapm connector 和 elasticapm processor。这两个组件随 EDOT Collector(或自定义的 EDOT 类构建)一起提供,并不是标准 OpenTelemetry Collector Contrib 发行版的一部分。有关连接方式的详细信息,请参阅上游 Collector 配置。

  • SLO 定义:为需要保护的服务定义一个基于 APM 延迟或 APM 可用性的 SLO。保存 SLO 后,Elastic 会自动创建一条默认的燃烧率告警规则。
  • 后端:当前支持 Elastic Observability Serverless;待 9.5 发布后,还将支持运行 Elastic Stack 9.5 的 Elastic Cloud Hosted 和自托管部署。

SLO 燃烧率分析演练:从告警定位到故障依赖项

步骤 1:在告警详情页面查看 SLO 燃烧率

从通知中打开 SLO 燃烧率告警详情页面。

图表会显示燃烧率何时开始上升,以及在当前滚动周期内还剩余多少错误预算。接着,打开与该告警关联的 SLI,并判断当前看到的是短时间的突发峰值,还是持续性的性能下降,再进一步深入分析事件。

在本示例中,checkout 的可用性 SLO 正在快速消耗错误预算,而且燃烧率是最近才开始上升的,因此问题很可能是在最近几个小时内引入的,而不是长期逐渐恶化所导致的。

步骤 2:检查导致 SLO 错误预算消耗的 SLI 错误率

在 SLI 视图中,查看驱动 SLO 的错误率。

你可以在 APM UI 中将 SLI 作为 RED 指标查看,以快速了解服务整体状况;如果需要对计入 SLO 的 span 进行过滤、比较或细分分析,则可以在Discover 中打开 Traces。

在本示例中,checkout 的错误率已经上升,这与可用性 SLO 燃烧率的激增相吻合。

步骤 3:比较 SLI 的正常事件 span 与异常事件 span

打开 SLI 对应的事件,并在正常事件( good events )和异常事件( bad events )的 span 之间切换查看。

在打开单个追踪之前,这两组事件之间的差异通常就已经显现出来。在本示例中,异常事件具有一个正常事件所没有的共同特征,从而缩小了下一步需要排查的范围。

步骤 4:在追踪瀑布图中定位故障 span

打开几个异常事件的示例 span,并在追踪瀑布图( trace waterfall )中查看对应的追踪。

这样可以将发生故障的 span 放到完整的请求路径中进行分析,让你看到是哪一个调用环节导致了 SLI 未达标。在本示例中,发生故障的 span 来自一个下游调用,而不是 checkout 服务自身的应用程序逻辑。

步骤 5:确认哪个依赖项正在消耗你的 SLO 错误预算

打开拥有异常 span 的服务,并查看它的依赖项。

在本示例中,追踪瀑布图指向了shipping服务以及对quote-old的失败调用。发送到该依赖项的请求每次都会失败,因此导致 SLO 燃烧率上升的原因是外部依赖项,而不是checkout服务本身的代码。

SLO 燃烧率调查:从告警到根因

在 Elastic Observability 中,从一个 SLO 燃烧率告警开始,你可以查看燃烧率何时上升,打开关联的 SLI,比较正常事件和异常事件的 span,在追踪瀑布图中检查异常 span,并验证发生故障的依赖项,从而找到正在消耗错误预算的原因。

原文:SLO burn rate analysis: from alert to failing dependency — Elastic Observability Labs

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/31 13:44:06

76岁山东新首富拿下IPO,苏州资本热土还有多少企业排队上市?

【又一超级IPO诞生】7月30日,中际旭创(03308.HK)正式登陆港交所,今开报971港元/股,总市值约11400亿港元,至此,港交所年内最大IPO诞生。值得一提的是,中际旭创早在2012年便在深交所挂…

作者头像 李华
网站建设 2026/7/31 13:43:42

2026年应届生黑科技榜单9款AI论文平台亲测!

前言:AI 写论文乱象频发,实测 8 款工具理清适配边界 每到毕业季,本科生、硕博生都会扎堆寻找 AI 论文辅助工具,市面上各类写作软件层出不穷,但普遍存在几类硬伤:虚假参考文献、无法匹配本校格式、不支持公…

作者头像 李华
网站建设 2026/7/31 13:43:39

通达信缠论插件完整指南:从理论到实战的智能分析工具

通达信缠论插件完整指南:从理论到实战的智能分析工具 【免费下载链接】Indicator 通达信缠论可视化分析插件 项目地址: https://gitcode.com/gh_mirrors/ind/Indicator CZSC缠论插件是一款专为通达信用户设计的开源技术分析工具,通过高效的算法自…

作者头像 李华
网站建设 2026/7/31 13:38:07

Rust异步运行时核心原理:手搓极简Async Runtime实现物理射线检测

1. 项目概述:为什么要在 Rust 中手搓一个极简 Async Runtime? 如果你写过 Rust,尤其是涉足网络服务或并发编程,那么 async/await 肯定不陌生。它让异步代码写起来像同步一样直观,但背后那个负责调度和执行这些异步任…

作者头像 李华
网站建设 2026/7/31 13:36:10

智能题库与语音处理技术在中考英语听力训练中的应用

1. 项目背景与核心价值 中考英语听力满分是很多学生梦寐以求的目标,但传统刷题方式往往效率低下。这套"用技术与平台练真题4000"的方法,通过系统化的技术手段解决了三个关键痛点: 首先,真题资源分散难获取。我收集整理…

作者头像 李华
网站建设 2026/7/31 13:35:08

AI 编程控制面:模型、MCP、地域和审计怎么一起管

代码审查原本是 AI 开发工具里最克制的入口:模型看一眼 diff,留下几条评论,最后仍由人决定改不改。7 月 29 日,GitHub 往前走了一步。Copilot code review 正式接入 agent skills 和 MCP server。它不只看代码,还能读取…

作者头像 李华