观测云 Agent 输出质量评估上线!智能体答得好不好别再靠感觉
团队已经把 Agent 接进了自己的业务:智能客服、代码工具、数据分析……持续的监控也非常重要,
- 模型换了一个版本,回答质量是变好了还是悄悄退步了?
- 用户问的问题五花八门,智能体的回答到底有多少是「及格」的?
- 要求模型返回 JSON,结果它偶尔给你来一段自由发挥,下游直接报错?
- 线上每天成千上万次调用,靠人肉抽查,能查出多少问题?
观测云的 Agent 监测,此前已经帮大家解决了一些基础的问题:全链路追踪每一次对话的完整流程,精确计量每一次生成消耗的 Token,把 Agent / LLM 请求与整个应用链路关联起来做根因分析。
这次更新,我们把观测智能体回复质量这一块补齐了。
Agent / LLM 质量输出评估,正式上线。
它支持 Prompt Eval 和 Schema Eval 两种评估器,提供在线评估与批量评估两种执行方式,并配套完整的评估结果分析能力。从此,Agent 输出好不好,系统替你打分,用数据说话。
两种评估器:一个管内容质量,一个管结构正确
Prompt Eval:用提示词,给智能体内容质量把关
Prompt Eval 通过提示词对智能体的输入或输出进行判断,适用于内容质量、相关性、完整性和安全性等评估场景。
举个例子:你可以写一个评估提示词,让评估器扮演「严格的评审」,检查每一次客服智能体的回答是否真正解答了用户的问题、有没有编造不存在的信息、语气是否得体。评估结果按你定义的评分规则输出,比如 0–100 分,或者「通过 / 未通过」。
配置 Prompt Eval 只需要两件事:
- 评估提示词:明确评估目标、判断标准和返回格式——标准写得越清晰,评估结果越稳定;
- 评估结果及评分规则:什么样的输出算通过,分数怎么给。
本质上,这是「用 AI 评估 AI」,把你脑子里的质量标准,变成一条可以 7×24 小时自动执行的规则。

Schema Eval:结构化输出,字段、类型、结构一个都不能错
很多场景里,智能体按照特定结构返回合法的 JSON、字段齐全、类型正确,下游系统才能稳定消费。
Schema Eval 就是为此而生:配置目标 Schema,系统自动检查模型输出的字段、类型和结构是否符合要求。适用于所有要求模型返回 JSON 或其他结构化内容的场景。

评估器全生命周期:模板起步,试运行验证,发布生效
观测云把评估器的使用路径设计并调试得非常顺滑:
- 选择评估器 Skill 模板:开箱即用,快速起步;
- 选择评估目标类型:明确你要评的是智能体输入还是输出;
- 配置评估输入及判断规则;
- 使用测试数据试运行:测试结果会完整展示评估输出、评分或结构校验结果,不满意就调整提示词、Schema 或判断规则,再测,直到结果符合预期;
- 确认无误,一键发布:发布后的评估器才能用于正式评估任务。
先测试再发布的机制,确保每一条上线运行的评估规则,都是经过验证的。

两种执行方式:线上持续盯防 + 历史批量回扫
在线评估:给线上流量配一个质检员
在线评估用于持续检查线上产生的Agent调用数据。选择目标应用和评估器,配置好需要评估的数据范围,任务启用后,系统就会按照配置对符合条件的数据自动执行评估。
使用评估器,每一次线上调用都有机会被质检。质量水位是涨是跌,看评分趋势就知道,而不用等用户投诉上门。
评估与 Trace 是打通的。在 Trace 详情页,你可以直接看到这一次调用的评估面板:最终结论(通过 / 未通过)、每个评估器的单项得分、通过 / 未通过 / 执行异常的统计,以及评估器给出的评估理由。链路、Token、风险告警、质量评分——一次调用的所有关键信息,同屏呈现。

批量评估:历史数据,一次回扫
批量评估用于评估指定时间范围或查询条件下的历史模型调用数据,四步即可发起:
- 选择目标应用;
- 设置时间范围及筛选条件;
- 选择需要使用的评估器;
- 确认并启动评估任务。
两个非常实用的场景:
- 上线前回归:改了 Prompt、换了模型版本?先对历史真实数据跑一轮批量评估,新旧对比一目了然,上线更有底气;
- 存量问题排查:怀疑某类问题的回答质量一直不好?框定条件,批量扫一遍,用评分验证猜想。

评估结果分析:分数和改进的线索
在评估结果页面,你可以完整查看:
- 评估器及评估方式;
- 评估状态;
- 评分或规则校验结果;
- 模型输入和输出(评得低的那次,模型到底答了什么,直接点开看);
- 评估时间;
- 失败原因。
同时支持按应用、评估器、评估状态、时间范围等条件灵活筛选。无论是宏观上看质量趋势,还是微观上逐条复盘 Bad Case,都有据可依。
小提示:评估结果取决于模型输出、评估提示词及 Schema 配置。建议在正式启用评估任务前,先用具有代表性的测试数据验证评估器效果——评估器本身,也是需要「观测」的。

谁在用?怎么用?
| 角色 | 典型用法 |
|---|---|
| AI 应用工程师 | 模型 / Prompt 变更后,批量评估回归验证,拒绝「越改越差」 |
| 质量 / 运营团队 | 在线评估持续监控内容质量与安全性,Bad Case 自动浮出水面 |
| 平台 / 后端团队 | Schema Eval 守住结构化输出契约,保护下游系统稳定 |
| 团队负责人 | 用评分趋势量化 AI 应用质量水位,汇报和决策都有数据支撑 |
现在就开始
入口已经为你准备好:Agent 监测 > 评估 > 新建评估器。
评得出每一次输出的质量,观测云 Agent 监测正在把 AI 应用的可观测性,推向「全链路追踪 + 成本计量 + 质量评估」的完整形态。
你的 Agent,值得被更深度的观测。
详细配置指南,请查阅官方文档:https://docs.guance.com/agent/eval/


