AI Agent评测EvaluationLLM-as-JudgeRagasLangSmithLangfuse
评测与可观测
准确率怎么算、RAG/Agent 评测指标、LLM-as-Judge vs 确定性评测、Golden dataset、LangSmith/Langfuse 选型与线上监控。
评测与可观测
没有 evaluation 体系的 Agent 项目就是耍流氓。 2026 面试新焦点:从「会搭 Agent」到「能量化好坏、能定位问题」。这篇是拉开差距的地方。
一、「准确率 90%+」怎么算的?(必被追问)
三层递进,层层要答得清:
- 测试集怎么构建(最容易被追问):覆盖哪几类正常 case + 边界 case + 对抗样本?分布如何?为什么这些 case 能体现你想测的能力?——「随手造了 200 个」 vs 「5 类常见意图 + 3 类边界 + 2 类对抗样本」是两个档次
- 指标:只看准确率?有没有 precision/recall/F1?
- 自动化:每次改完 prompt 怎么回归?有没有 eval 平台/脚本?(LangSmith/Braintrust/Promptfoo 至少跑过一个)
二、RAG/Agent 评测核心指标(Ragas)
- Faithfulness(忠实度):答案是否忠于检索内容
- Answer relevance(答案相关性):答案是否切题
- Context precision/recall(上下文精确率/召回率):召回是否命中、命中是否干净
- Groundedness / 引用准确率:答案有没有依据
防闭环断掉:线上真失败 → 变成 eval case → 回归通过 → 上线。这个闭环必须完整。
三、LLM-as-Judge vs 确定性评测
| 方式 | 适用 | 特点 |
|---|---|---|
| 确定性 code evaluator | JSON schema 校验、正则、工具参数校验 | 免费、无抖动,能用的地方先用 |
| LLM-as-Judge | 主观质量(相关性/语气/合规) | 用模型打分,注意评委模型校准(few-shot correction:人工纠正评委输出回灌) |
Golden dataset:精选的输入-输出/标注对集合(数百~数千条),每次改 prompt/模型/链路跑一遍对比实验,分数下降不让上线(可挂 CI 当部署门禁)。
四、LangSmith vs Langfuse 怎么选
- LangSmith:LangChain/LangGraph 全家桶深度集成(设个环境变量零配置全链路 trace,含节点/边/状态,可 replay 换模型重跑),闭源 SaaS
- Langfuse:开源 MIT、可自托管、基于 OpenTelemetry 框架无关
选型逻辑:深度用 LangGraph 全家桶 → LangSmith;要自托管/数据主权/不想锁死 → Langfuse。
生产从第一天就要 trace——多 Agent 难 debug,每个路由决策、子 Agent 调用、工具调用都要留痕。
五、线上多 Agent 监控哪些指标
- 路由准确率(Supervisor 选对子 Agent 的比例,人工抽评)
- 子 Agent 成功率
- 端到端延迟 p50/p95
- 单请求 token 消耗(对比单 Agent 基线)
- 错误率(超时/死循环/工具错 per 1000 请求)
- 成本
在可观测平台(LangSmith/Langfuse)里看 trace 树定位是哪一步烂了。
实战落地(智能客服 Agent 的评测闭环)
- 离线评测:57 条真实语料(含边界/长尾),
--fail-under 0.9阈值门禁接入 GitHub Actions CI;实测 Recall@1/3/5 = 1.0、MRR = 1.0 - 红队门禁:
redteam_block_rate(安全阻断率,实测 1.0)作 CI 门禁——提示注入、越权查单、对抗样本三类攻击语料断言「被阻断」 - 在线指标:一次解决率、转人工率、工具成功率、无依据承诺率、响应时延 P50/P95