← 返回性能专题
优化实践

优化实践

高并发七层手段、容量规划、CI 性能回归门禁,以及 Agent/Web/3D 各自的优化抓手。

优化实践

优化不是「加缓存」式的零散动作,而是「度量 → 定位 → 优化 → 守住」的闭环。

高并发七层手段

graph LR
  A[缓存] --> B[信号量]
  B --> C[队列]
  C --> D[优先级]
  D --> E[路由降级]
  E --> F[降级]
  F --> G[背压]
  1. 缓存:相似请求缓存,Prompt Caching / KV Cache
  2. 信号量:限制并发调用上游,避免打爆 LLM / 向量库
  3. 队列:削峰填谷,入队即返回
  4. 优先级:轻重任务分级,模型档位区分
  5. 路由降级:多模型路由,快速模型处理简单任务
  6. 降级:工具不可用降级 Mock,保证流程能跑完
  7. 背压:拒绝过载请求,保护核心链路

容量规划

梯度加压找拐点

  • 从低到高逐步加压,观察延迟/吞吐/错误率
  • 找到单副本承载拐点(延迟开始陡增的点)
  • 容量 = 峰值 ÷ 单副本承载 × 安全系数

LLM 压测的四个特殊性:

  1. 延迟与吞吐互斥
  2. 成本约束(烧 token)
  3. 长尾请求(长回答)
  4. 上游配额限制

CI 性能回归门禁

优化完必须守住,否则三个月后性能反弹:

  • 包体增长:超预算直接 fail
  • Lighthouse:分数低于阈值 fail
  • 关键算法耗时:干涉检测、检索等超预算 fail

各域优化抓手

优化抓手
AgentTTFT 优化(分段 + 流式)、Prompt Caching、模型档位、降级
Web包体治理(-35.3%)、Lighthouse、按需引入、资源压缩
3DDraco/Meshopt 压缩(-75%)、BVH + OBB-SAT 两阶段检测

成本优化(降本)

成本 = 单价 × token 量。降本按性价比排序:

  1. 模型档位(fast/strong 分级)
  2. Prompt Caching
  3. 相似请求缓存
  4. Prompt 精简
  5. 缩短上下文