← 返回知识库
AI Agent评测EvaluationLLM-as-JudgeRagasLangSmithLangfuse

评测与可观测

准确率怎么算、RAG/Agent 评测指标、LLM-as-Judge vs 确定性评测、Golden dataset、LangSmith/Langfuse 选型与线上监控。

评测与可观测

没有 evaluation 体系的 Agent 项目就是耍流氓。 2026 面试新焦点:从「会搭 Agent」到「能量化好坏、能定位问题」。这篇是拉开差距的地方。

一、「准确率 90%+」怎么算的?(必被追问)

三层递进,层层要答得清:

  1. 测试集怎么构建(最容易被追问):覆盖哪几类正常 case + 边界 case + 对抗样本?分布如何?为什么这些 case 能体现你想测的能力?——「随手造了 200 个」 vs 「5 类常见意图 + 3 类边界 + 2 类对抗样本」是两个档次
  2. 指标:只看准确率?有没有 precision/recall/F1?
  3. 自动化:每次改完 prompt 怎么回归?有没有 eval 平台/脚本?(LangSmith/Braintrust/Promptfoo 至少跑过一个)

二、RAG/Agent 评测核心指标(Ragas)

  • Faithfulness(忠实度):答案是否忠于检索内容
  • Answer relevance(答案相关性):答案是否切题
  • Context precision/recall(上下文精确率/召回率):召回是否命中、命中是否干净
  • Groundedness / 引用准确率:答案有没有依据

防闭环断掉:线上真失败 → 变成 eval case → 回归通过 → 上线。这个闭环必须完整。

三、LLM-as-Judge vs 确定性评测

方式适用特点
确定性 code evaluatorJSON schema 校验、正则、工具参数校验免费、无抖动,能用的地方先用
LLM-as-Judge主观质量(相关性/语气/合规)用模型打分,注意评委模型校准(few-shot correction:人工纠正评委输出回灌)

Golden dataset:精选的输入-输出/标注对集合(数百~数千条),每次改 prompt/模型/链路跑一遍对比实验,分数下降不让上线(可挂 CI 当部署门禁)。

四、LangSmith vs Langfuse 怎么选

  • LangSmith:LangChain/LangGraph 全家桶深度集成(设个环境变量零配置全链路 trace,含节点/边/状态,可 replay 换模型重跑),闭源 SaaS
  • Langfuse:开源 MIT、可自托管、基于 OpenTelemetry 框架无关

选型逻辑:深度用 LangGraph 全家桶 → LangSmith;要自托管/数据主权/不想锁死 → Langfuse。

生产从第一天就要 trace——多 Agent 难 debug,每个路由决策、子 Agent 调用、工具调用都要留痕。

五、线上多 Agent 监控哪些指标

  • 路由准确率(Supervisor 选对子 Agent 的比例,人工抽评)
  • 子 Agent 成功率
  • 端到端延迟 p50/p95
  • 单请求 token 消耗(对比单 Agent 基线)
  • 错误率(超时/死循环/工具错 per 1000 请求)
  • 成本

在可观测平台(LangSmith/Langfuse)里看 trace 树定位是哪一步烂了。

实战落地(智能客服 Agent 的评测闭环)

  • 离线评测:57 条真实语料(含边界/长尾),--fail-under 0.9 阈值门禁接入 GitHub Actions CI;实测 Recall@1/3/5 = 1.0、MRR = 1.0
  • 红队门禁redteam_block_rate(安全阻断率,实测 1.0)作 CI 门禁——提示注入、越权查单、对抗样本三类攻击语料断言「被阻断」
  • 在线指标:一次解决率、转人工率、工具成功率、无依据承诺率、响应时延 P50/P95