news 2026/8/28 6:38:45

AI Agent 工程实践(33):Agent 如何监控

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI Agent 工程实践(33):Agent 如何监控

摘要:本文针对 AI Agent 上线后“服务活着却在胡说”的监控盲区,梳理了只看存活、只看成本、不盯幻觉三种常见错误,提出 Agent 监控应在传统指标之外额外关注成功率、Tool Error、Latency、Cost、Token、Memory Hit、Hallucination 七个 LLM 专属维度,并给出七指标看板、Mermaid 架构图、Prometheus 打点与离线 eval 示例,最后按“可用性必告警、质量类观察为主”的分级原则避免告警疲劳。

系列:AI Agent 工程实践
上一篇:第 32 篇《Agent 如何上线》
下一篇:第 34 篇《企业 AI Agent 架构》

一、开场:agent 变傻了,没人知道

运营说"最近 agent 答得不对"。工程师去查,发现三天前某个模型版本更新后,特定问题开始胡说。但因为没有监控,谁也说不清:是哪天开始的?哪个场景?哪个模型?影响多少用户?只能靠用户投诉反推。

上篇(32)讲"安全上线",这篇讲"上线后怎么知道它好不好"——监控。

二、问题背景:传统监控不够

只看服务存活:

# 健康检查只返回 200 @app.get("/health") def health(): return {"status": "ok"} # 服务活着 ≠ agent 答得好

Agent 挂了(HTTP 500)你会知道,但它活着却在胡说,传统监控毫无感知。Agent 监控 = 传统指标+ LLM 专属指标

三、错误尝试:三种监控盲区

错误 1:只看 CPU/内存/存活

服务没崩就以为没事,质量劣化完全盲区。等到发现,已经是大量错误回答被用户看见了。

错误 2:只看成本

成本没超就安心,但成本和质量是两个轴——可能又贵又烂,省钱但答非所问。

错误 3:不盯幻觉

"LLM 偶尔胡说正常",不量化幻觉率,等到客诉才暴露,信誉损失已发生。

四、关键观察:Agent 要盯七个指标

传统服务的指标(QPS、错误率、延迟)只是底座。Agent 额外要盯7 个 LLM 维度

  1. 成功率:请求完整跑完、未异常中断的比例。
  2. Tool Error:工具调用失败率——Agent 最常见的硬错误。
  3. Latency:端到端延迟(P50/P95)——用户体感。
  4. Cost:单请求成本 + 日/月总成本趋势。
  5. Token:输入/输出 token 消耗,成本与上下文膨胀的前兆。
  6. Memory Hit:记忆命中率——命中低说明"记不住用户",体验差。
  7. Hallucination:幻觉率——靠 eval 集 + 用户反馈打分量化。

前 5 个可直接打点,后 2 个要靠"埋点 + 评估 + 反馈"间接度量。缺任何一个,你对系统的认知就有盲区。

五、最终方案:七指标看板

指标定义为什么必须看异常信号
成功率未异常中断的请求占比系统基本可用性突降
Tool Error工具调用失败次数/总调用Agent 主要硬错误源持续 >2%
LatencyP50/P95 端到端耗时用户体感P95 翻倍
Cost单请求 + 周期总成本烧钱速度日均超预算
Token输入输出 token 量上下文膨胀/成本前兆陡增
Memory Hit命中长期记忆比例"是否记住用户"持续偏低
Hallucination幻觉回答占比质量底线上升

监控数据流向:Agent 运行时打点 → 日志/链路收集 → 指标聚合 → 看板 + 告警

六、架构图(Mermaid)

七、代码与配置示例

用计数器打点(伪 Prometheus):

from prometheus_client import Counter, Histogram REQ = Counter("agent_requests_total", "总请求") TOOL_ERR = Counter("agent_tool_errors_total", "工具失败") LAT = Histogram("agent_latency_seconds", "端到端延迟") @LAT.time() def handle(req): REQ.inc() try: return run_agent(req) except ToolError: TOOL_ERR.inc() # 工具失败单独计数 raise

幻觉率靠离线 eval:

# 每日跑 eval 集,统计答非所问比例 bad = sum(1 for c in eval_set if not is_correct(c)) hallucination_rate = bad / len(eval_set) # 趋势监控

八、设计权衡:告警 vs 观察

指标建议理由
成功率/Tool Error必告警直接影响可用
Latency P95告警体感硬指标
Cost/Token观察+预算线趋势性,不必秒级
Memory Hit观察体验指标
Hallucination周级观察需 eval,滞后

反过度告警:什么都告警 = 告警疲劳,真正异常被淹没。分级——可用性必告警,质量类观察为主。把告警留给"不处理就出事"的指标。

九、总结

  • ✅ 服务活着 ≠ agent 答得好,传统监控对质量劣化盲区。
  • ✅ 三种盲区:只看存活、只看成本、不盯幻觉。
  • ✅ Agent 监控 = 传统指标 + 7 个 LLM 维度(成功率/Tool Error/Latency/Cost/Token/Memory Hit/Hallucination)。
  • ✅ 前 5 直接打点,后 2 靠 eval + 用户反馈间接度量。
  • ✅ 分级:可用性必告警,质量类观察为主,防告警疲劳。

下一篇,把前面所有零件画成一张企业全链路图。(34)


参考资料(带用途说明)

  • 本系列(32)Agent 如何上线:本文监控指标是(32)灰度/全量判断的依据。
  • 本系列(27)日志系统:监控的打点数据来自(27)的日志字段设计。
  • 本系列(28)可观测性:Trace/Span 是本文链路追踪的理论基础。
  • 本系列(30)Agent 如何做测试:幻觉率评估复用(30)的 Golden Dataset。
  • Prometheus 文档(prometheus.io):指标打点与聚合的实现参考。

本文是 AI Agent 工程实践系列的第 33 篇(第四阶段第十三篇)。


系列导航

上一篇:第 32 篇《Agent 如何上线》
下一篇:第 34 篇《企业 AI Agent 架构》

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/28 6:37:54

动态规划实战:从最长公共子序列到蓝肽子序列问题解析

1. 从“蓝肽子序列”到最长公共子序列:一道国赛真题的深度拆解看到“蓝肽子序列”这个题目,很多初次接触的朋友可能会有点懵。这名字听起来有点怪,像是某种生物学术语,但实际上,它是一道来自蓝桥杯国赛的经典动态规划题…

作者头像 李华
网站建设 2026/8/28 6:37:48

【LLM】Qwen3-0.6B服务化部署、请求与性能测试

Qwen3-0.6B 功能:文本生成部署方式:使用1卡 nvidia A100/asend 910b 部署 模型下载 pip install modelscope mkdir Qwen3-0.6B modelscope download --model Qwen/Qwen3-0.6B --local_dir Qwen3-0.6B镜像 nvidia镜像 vllm/vllm-openai:latestasend镜像 q…

作者头像 李华
网站建设 2026/8/28 6:35:33

Pydantic 数据验证讲解

文章目录一、为什么需要 Pydantic?二、安装三、基础模型(BaseModel)四、Field:更精细的控制五、自定义验证器1. 字段验证器(field_validator)2. 模型级验证器(model_validator)六、嵌…

作者头像 李华
网站建设 2026/8/28 6:34:10

YOLO目标检测实战:从331张行人车辆数据集入门到部署

简介:目标检测是计算机视觉的核心任务之一,旨在识别图像中特定物体的位置和类别。其核心原理是通过深度学习模型学习图像特征与边界框坐标的映射关系,实现端到端的预测。这项技术的价值在于为各类智能系统提供环境感知能力,广泛应…

作者头像 李华
网站建设 2026/8/28 6:34:09

充电桩产线 ATE 自动测试系统架构设计:上下料/测试/分拣怎么拼

KRASSATE 嘉仕新能(新能源测试设备厂商)这几年接了不少充电桩产线的 ATE 项目,从 7kW 交流桩到 360kW 大功率直流堆都有。今天就把这套"上下料—测试—分拣"的拼接逻辑摊开讲,省得同行在方案阶段反复踩同一个坑。充电桩…

作者头像 李华
网站建设 2026/8/28 6:33:01

RustFS 加入 NVIDIA Inception:AI 原生存储路线走到哪了

2026 年 4 月 9 日,RustFS 官宣加入 NVIDIA Inception 计划。对一家做底层对象存储的公司来说,这是一次实打实的认可——意味着 RustFS 的「AI 原生存储」路线,拿到了 NVIDIA 生态的平台通道与技术资源。这篇把已经落地的、和正在推进的&…

作者头像 李华