AI AgentTokenizerEmbeddingTransformer注意力幻觉
AI / LLM 原理速记
Tokenizer、Embedding、Transformer 注意力、temperature/top_p、幻觉与四层防御、Agent vs RAG。
AI / LLM 原理速记
前端转后端救急:把 LLM 的几个底层概念用「能扛追问」的颗粒度讲清楚。每节一句话结论 + 可展开要点。
1. Tokenizer
- 最小文本单位;BPE 子词切分
- 中文单字信息密度高 → 同样内容 token 更多 → 更贵更慢
2. Embedding
- 文本 → 高维向量;语义近 → 向量近;相似度用余弦(cosine)
- RAG:query 和文档块都向量化,检索取 top-K
- 稀疏向量(BM25,精确匹配)vs 稠密向量(BERT,语义理解)
3. Transformer 注意力(Q/K/V)
生成每个词时关注输入其他词:
- Q 与 K 算相似度(点积)→ softmax 权重 → 加权求和 V
- 多头 = 多组并行捕捉不同关系
不需要推公式,能讲清「Q 查 K,权重加权 V」即可。
4. temperature / top_p
- temperature:高 → 更随机更有创造性;低 → 更确定(写代码/事实问答用低)
- top_p:只从累计概率 p 的 token 采样(核采样)
5. 幻觉与防御(必讲强项)
幻觉 = 看似合理但错误/编造。
四层防御(项目里都有):
- RAG 引用溯源
[来源N] - 审核循环校验引用
- 提示约束(未覆盖标「存疑」)
- HITL 人工兜底
加分:评测集 + LLM-as-judge 做持续回归。
6. RAG 链路 + chunk(完整工程版)
- 链路八步:解析 → 清洗 → 分块 → 向量化/存储 → 检索 → 重排 → 注入 prompt → 生成 + 引用溯源
- chunk 大小:200-500 token + overlap 10-20% 是常见起点;按内容类型定
一句话:「RAG 落地效果由三段决定:检索质量(查得到)、注入格式(读得懂)、引用校验(敢信它)。」
7. Agent vs RAG
- RAG = 检索增强生成,单轮能力,减少幻觉
- Agent = 能规划 + 调工具 + 多步决策的闭环;RAG 是 Agent 的一个组件
8. 上下文工程关键概念
- Lost in the middle:模型对上下文首尾信息利用最好,中间明显衰减 → 关键指令放首尾
- 滚动摘要(rolling summary):历史对话压缩成摘要,控制上下文长度