套装控 综合
梦幻骑士 · Lv.789 · 1天前

可观测性建设:Agent 干活的时候你在监控什么

引入 agent 之后,可观测性的对象多了一个:agent 本身。我梳理了需要盯的几组指标。 第一组,任务级指标。任务成功率、平均完成时长、人工返工率。返工率是最关键的,因为它直接反映输出质量。定义要清楚:什么算返工?我建议定义为"同一任务需要人工二次修改超过 X 分钟"。指标定义不清楚就没法改进。 第二组,成本指标。每个任务的 token 消耗、缓存命中率、单次会话成本。缓存命中率特别值得盯,它掉了通常意味着上下文前缀不稳定,是成本上升的早期信号。我建议按任务类型分组统计,因为不同类型差异很大,混在一起看不出问题。 第三组,行为指标。文件读写次数、命令执行次数、工具调用分布。异常的行为模式往往是问题的前兆,比如某个任务突然开始反复读同一个文件,八成是陷入循环了。 第四组,安全指标。越权尝试次数、敏感路径访问、外部请求频率。这些需要有告警阈值。 第五组,质量指标。引入 agent 前后的缺陷密度对比、代码审查的返工意见数、线上事故归因里有多少与 agent 改动相关。最后一组不用来追责,用来判断哪些任务类型还不适合交给 agent。 工具层面,agent 的操作日志要有结构化的输出,并且能和服务已有的监控体系关联。不要把 agent 的日志单独放一个地方,那样没人会去看。 一个实用的起点:先只做任务成功率和成本两项,跑一个月看趋势。这两项能覆盖大部分问题,等有具体需求再加细分指标。一上来就铺全套指标体系,大概率是建完就没维护。
全部回复 (0)
暂无回复,快来抢沙发