优化实践
优化实践
高并发七层手段、容量规划、CI 性能回归门禁,以及 Agent/Web/3D 各自的优化抓手。
优化实践
优化不是「加缓存」式的零散动作,而是「度量 → 定位 → 优化 → 守住」的闭环。
高并发七层手段
graph LR
A[缓存] --> B[信号量]
B --> C[队列]
C --> D[优先级]
D --> E[路由降级]
E --> F[降级]
F --> G[背压]
- 缓存:相似请求缓存,Prompt Caching / KV Cache
- 信号量:限制并发调用上游,避免打爆 LLM / 向量库
- 队列:削峰填谷,入队即返回
- 优先级:轻重任务分级,模型档位区分
- 路由降级:多模型路由,快速模型处理简单任务
- 降级:工具不可用降级 Mock,保证流程能跑完
- 背压:拒绝过载请求,保护核心链路
容量规划
梯度加压找拐点:
- 从低到高逐步加压,观察延迟/吞吐/错误率
- 找到单副本承载拐点(延迟开始陡增的点)
- 容量 = 峰值 ÷ 单副本承载 × 安全系数
LLM 压测的四个特殊性:
- 延迟与吞吐互斥
- 成本约束(烧 token)
- 长尾请求(长回答)
- 上游配额限制
CI 性能回归门禁
优化完必须守住,否则三个月后性能反弹:
- 包体增长:超预算直接 fail
- Lighthouse:分数低于阈值 fail
- 关键算法耗时:干涉检测、检索等超预算 fail
各域优化抓手
| 域 | 优化抓手 |
|---|---|
| Agent | TTFT 优化(分段 + 流式)、Prompt Caching、模型档位、降级 |
| Web | 包体治理(-35.3%)、Lighthouse、按需引入、资源压缩 |
| 3D | Draco/Meshopt 压缩(-75%)、BVH + OBB-SAT 两阶段检测 |
成本优化(降本)
成本 = 单价 × token 量。降本按性价比排序:
- 模型档位(fast/strong 分级)
- Prompt Caching
- 相似请求缓存
- Prompt 精简
- 缩短上下文