← 返回知识库
AI AgentTokenizerEmbeddingTransformer注意力幻觉

AI / LLM 原理速记

Tokenizer、Embedding、Transformer 注意力、temperature/top_p、幻觉与四层防御、Agent vs RAG。

AI / LLM 原理速记

前端转后端救急:把 LLM 的几个底层概念用「能扛追问」的颗粒度讲清楚。每节一句话结论 + 可展开要点。

1. Tokenizer

  • 最小文本单位;BPE 子词切分
  • 中文单字信息密度高 → 同样内容 token 更多 → 更贵更慢

2. Embedding

  • 文本 → 高维向量;语义近 → 向量近;相似度用余弦(cosine)
  • RAG:query 和文档块都向量化,检索取 top-K
  • 稀疏向量(BM25,精确匹配)vs 稠密向量(BERT,语义理解)

3. Transformer 注意力(Q/K/V)

生成每个词时关注输入其他词:

  • Q 与 K 算相似度(点积)→ softmax 权重 → 加权求和 V
  • 多头 = 多组并行捕捉不同关系

不需要推公式,能讲清「Q 查 K,权重加权 V」即可。

4. temperature / top_p

  • temperature:高 → 更随机更有创造性;低 → 更确定(写代码/事实问答用低)
  • top_p:只从累计概率 p 的 token 采样(核采样)

5. 幻觉与防御(必讲强项)

幻觉 = 看似合理但错误/编造。

四层防御(项目里都有):

  1. RAG 引用溯源 [来源N]
  2. 审核循环校验引用
  3. 提示约束(未覆盖标「存疑」)
  4. HITL 人工兜底

加分:评测集 + LLM-as-judge 做持续回归。

6. RAG 链路 + chunk(完整工程版)

  • 链路八步:解析 → 清洗 → 分块 → 向量化/存储 → 检索 → 重排 → 注入 prompt → 生成 + 引用溯源
  • chunk 大小:200-500 token + overlap 10-20% 是常见起点;按内容类型定

一句话:「RAG 落地效果由三段决定:检索质量(查得到)、注入格式(读得懂)、引用校验(敢信它)。」

7. Agent vs RAG

  • RAG = 检索增强生成,单轮能力,减少幻觉
  • Agent = 能规划 + 调工具 + 多步决策的闭环;RAG 是 Agent 的一个组件

8. 上下文工程关键概念

  • Lost in the middle:模型对上下文首尾信息利用最好,中间明显衰减 → 关键指令放首尾
  • 滚动摘要(rolling summary):历史对话压缩成摘要,控制上下文长度