指标体系
性能指标体系
Agent、Web、3D 三套指标:TTFT/TPOT/P95、LCP/INP/CLS、FPS/首帧/检测耗时,以及 SLO 与性能预算分层。
性能指标体系
先量化,再优化。不同技术域有各自的性能语言,但都遵循「定义指标 → 设预算 → 观测」的统一方法。
三套指标体系
graph TD
subgraph Agent
A1[TTFT 首 token 延迟]
A2[TPOT 每 token 延迟]
A3[P95 端到端]
A4[成功率]
A5[成本]
end
subgraph Web
W1[LCP 最大内容绘制]
W2[INP 交互延迟]
W3[CLS 布局偏移]
end
subgraph 3D
D1[FPS 帧率]
D2[首帧时间]
D3[检测耗时]
end
Agent 指标
| 指标 | 含义 | 优化方向 |
|---|---|---|
| TTFT | 首 token 延迟 | 分段优化 + 流式,把感知延迟降到 TTFT |
| TPOT | 每 token 生成时间 | 换更快的模型 / 引擎 |
| P95 | 端到端延迟分位 | 容量规划、限流降级 |
| 成功率 | 任务成功比例 | 重试、降级 |
| 成本 | 每任务 token 成本 | 模型档位、缓存、Prompt 精简 |
关键认知:延迟与吞吐互斥。单请求要快,就得牺牲并发吞吐;要吞吐就得接受排队延迟。
Web 核心指标(Core Web Vitals)
- LCP(最大内容绘制):加载性能,≤ 2.5s
- INP(交互到下一帧):交互响应,≤ 200ms(已取代 FID)
- CLS(累积布局偏移):视觉稳定性,≤ 0.1
3D 指标
- FPS:渲染流畅度,目标 ≥ 60
- 首帧时间:模型加载到可交互
- 检测耗时:干涉检测等算法耗时(如 200 零部件 < 200ms)
SLO 与性能预算分层
性能预算要分层设定,每层独立观测:
- 前端层:包体预算、Lighthouse 阈值、Web Vitals
- 服务端层:API P95、单副本承载
- 算法层:关键算法耗时(干涉检测、检索)
黄金指标与 SLO
监控三大支柱 + 黄金指标:
- RED(面向请求):Rate 请求量 / Errors 错误 / Duration 延迟
- USE(面向资源):Utilization 利用率 / Saturation 饱和度 / Errors 错误
- SLO / 错误预算:定义服务目标,用错误预算驱动发布决策