← 返回性能专题
指标体系

性能指标体系

Agent、Web、3D 三套指标:TTFT/TPOT/P95、LCP/INP/CLS、FPS/首帧/检测耗时,以及 SLO 与性能预算分层。

性能指标体系

先量化,再优化。不同技术域有各自的性能语言,但都遵循「定义指标 → 设预算 → 观测」的统一方法。

三套指标体系

graph TD
  subgraph Agent
    A1[TTFT 首 token 延迟]
    A2[TPOT 每 token 延迟]
    A3[P95 端到端]
    A4[成功率]
    A5[成本]
  end
  subgraph Web
    W1[LCP 最大内容绘制]
    W2[INP 交互延迟]
    W3[CLS 布局偏移]
  end
  subgraph 3D
    D1[FPS 帧率]
    D2[首帧时间]
    D3[检测耗时]
  end

Agent 指标

指标含义优化方向
TTFT首 token 延迟分段优化 + 流式,把感知延迟降到 TTFT
TPOT每 token 生成时间换更快的模型 / 引擎
P95端到端延迟分位容量规划、限流降级
成功率任务成功比例重试、降级
成本每任务 token 成本模型档位、缓存、Prompt 精简

关键认知:延迟与吞吐互斥。单请求要快,就得牺牲并发吞吐;要吞吐就得接受排队延迟。

Web 核心指标(Core Web Vitals)

  • LCP(最大内容绘制):加载性能,≤ 2.5s
  • INP(交互到下一帧):交互响应,≤ 200ms(已取代 FID)
  • CLS(累积布局偏移):视觉稳定性,≤ 0.1

3D 指标

  • FPS:渲染流畅度,目标 ≥ 60
  • 首帧时间:模型加载到可交互
  • 检测耗时:干涉检测等算法耗时(如 200 零部件 < 200ms)

SLO 与性能预算分层

性能预算要分层设定,每层独立观测:

  1. 前端层:包体预算、Lighthouse 阈值、Web Vitals
  2. 服务端层:API P95、单副本承载
  3. 算法层:关键算法耗时(干涉检测、检索)

黄金指标与 SLO

监控三大支柱 + 黄金指标:

  • RED(面向请求):Rate 请求量 / Errors 错误 / Duration 延迟
  • USE(面向资源):Utilization 利用率 / Saturation 饱和度 / Errors 错误
  • SLO / 错误预算:定义服务目标,用错误预算驱动发布决策