观测云 Agent 输出质量评估上线!智能体答得好不好别再靠感觉

产品功能
banner.png

团队已经把 Agent 接进了自己的业务:智能客服、代码工具、数据分析……持续的监控也非常重要,

  • 模型换了一个版本,回答质量是变好了还是悄悄退步了?
  • 用户问的问题五花八门,智能体的回答到底有多少是「及格」的?
  • 要求模型返回 JSON,结果它偶尔给你来一段自由发挥,下游直接报错?
  • 线上每天成千上万次调用,靠人肉抽查,能查出多少问题?

观测云的 Agent 监测,此前已经帮大家解决了一些基础的问题:全链路追踪每一次对话的完整流程,精确计量每一次生成消耗的 Token,把 Agent / LLM 请求与整个应用链路关联起来做根因分析。

这次更新,我们把观测智能体回复质量这一块补齐了。

Agent / LLM 质量输出评估,正式上线。

它支持 Prompt Eval 和 Schema Eval 两种评估器,提供在线评估与批量评估两种执行方式,并配套完整的评估结果分析能力。从此,Agent 输出好不好,系统替你打分,用数据说话。

两种评估器:一个管内容质量,一个管结构正确

Prompt Eval:用提示词,给智能体内容质量把关

Prompt Eval 通过提示词对智能体的输入或输出进行判断,适用于内容质量、相关性、完整性和安全性等评估场景。

举个例子:你可以写一个评估提示词,让评估器扮演「严格的评审」,检查每一次客服智能体的回答是否真正解答了用户的问题、有没有编造不存在的信息、语气是否得体。评估结果按你定义的评分规则输出,比如 0–100 分,或者「通过 / 未通过」。

配置 Prompt Eval 只需要两件事:

  • 评估提示词:明确评估目标、判断标准和返回格式——标准写得越清晰,评估结果越稳定;
  • 评估结果及评分规则:什么样的输出算通过,分数怎么给。

本质上,这是「用 AI 评估 AI」,把你脑子里的质量标准,变成一条可以 7×24 小时自动执行的规则

Schema Eval:结构化输出,字段、类型、结构一个都不能错

很多场景里,智能体按照特定结构返回合法的 JSON、字段齐全、类型正确,下游系统才能稳定消费。

Schema Eval 就是为此而生:配置目标 Schema,系统自动检查模型输出的字段、类型和结构是否符合要求。适用于所有要求模型返回 JSON 或其他结构化内容的场景。

评估器全生命周期:模板起步,试运行验证,发布生效

观测云把评估器的使用路径设计并调试得非常顺滑:

  1. 选择评估器 Skill 模板:开箱即用,快速起步;
  2. 选择评估目标类型:明确你要评的是智能体输入还是输出;
  3. 配置评估输入及判断规则;
  4. 使用测试数据试运行:测试结果会完整展示评估输出、评分或结构校验结果,不满意就调整提示词、Schema 或判断规则,再测,直到结果符合预期;
  5. 确认无误,一键发布:发布后的评估器才能用于正式评估任务。

先测试再发布的机制,确保每一条上线运行的评估规则,都是经过验证的。

两种执行方式:线上持续盯防 + 历史批量回扫

在线评估:给线上流量配一个质检员

在线评估用于持续检查线上产生的Agent调用数据。选择目标应用和评估器,配置好需要评估的数据范围,任务启用后,系统就会按照配置对符合条件的数据自动执行评估。

使用评估器,每一次线上调用都有机会被质检。质量水位是涨是跌,看评分趋势就知道,而不用等用户投诉上门。

评估与 Trace 是打通的。在 Trace 详情页,你可以直接看到这一次调用的评估面板:最终结论(通过 / 未通过)、每个评估器的单项得分、通过 / 未通过 / 执行异常的统计,以及评估器给出的评估理由。链路、Token、风险告警、质量评分——一次调用的所有关键信息,同屏呈现。

批量评估:历史数据,一次回扫

批量评估用于评估指定时间范围或查询条件下的历史模型调用数据,四步即可发起:

  1. 选择目标应用;
  2. 设置时间范围及筛选条件;
  3. 选择需要使用的评估器;
  4. 确认并启动评估任务。

两个非常实用的场景:

  • 上线前回归:改了 Prompt、换了模型版本?先对历史真实数据跑一轮批量评估,新旧对比一目了然,上线更有底气;
  • 存量问题排查:怀疑某类问题的回答质量一直不好?框定条件,批量扫一遍,用评分验证猜想。

评估结果分析:分数和改进的线索

在评估结果页面,你可以完整查看:

  • 评估器及评估方式;
  • 评估状态;
  • 评分或规则校验结果;
  • 模型输入和输出(评得低的那次,模型到底答了什么,直接点开看);
  • 评估时间;
  • 失败原因。

同时支持按应用、评估器、评估状态、时间范围等条件灵活筛选。无论是宏观上看质量趋势,还是微观上逐条复盘 Bad Case,都有据可依。

小提示:评估结果取决于模型输出、评估提示词及 Schema 配置。建议在正式启用评估任务前,先用具有代表性的测试数据验证评估器效果——评估器本身,也是需要「观测」的。

谁在用?怎么用?

角色 典型用法
AI 应用工程师 模型 / Prompt 变更后,批量评估回归验证,拒绝「越改越差」
质量 / 运营团队 在线评估持续监控内容质量与安全性,Bad Case 自动浮出水面
平台 / 后端团队 Schema Eval 守住结构化输出契约,保护下游系统稳定
团队负责人 用评分趋势量化 AI 应用质量水位,汇报和决策都有数据支撑

现在就开始

入口已经为你准备好:Agent 监测 > 评估 > 新建评估器。

评得出每一次输出的质量,观测云 Agent 监测正在把 AI 应用的可观测性,推向「全链路追踪 + 成本计量 + 质量评估」的完整形态。

你的 Agent,值得被更深度的观测。

详细配置指南,请查阅官方文档:https://docs.guance.com/agent/eval/

获取专属方案

联系我们

加入社区

微信扫码
加入官方交流群

立即体验

在线开通,按量计费,真正的云服务!

立即开始

选择观测云版本

代码托管平台