阅读前置:本系列是 Transformer深度解读 的续篇。强烈建议先读完上一篇,再来看 LLM 是怎么”长大”的。


从 Transformer 到 LLM:中间发生了什么?

上一篇我们搞懂了 Transformer 单层的工作原理。但 GPT、Kimi K3、DeepSeek 这些”大语言模型”(Large Language Model, LLM),不是一个 Transformer 层,而是几十上百层堆叠 + 海量数据训练的产物。

一个核心问题:为什么把 Transformer 堆大、喂数据,模型就”会说话”了?

答案是:下一个词预测(Next Token Prediction)——所有 LLM 的核心训练目标,简单到令人难以置信。


一、预训练:让模型学会”接话”

1.1 核心思想

把互联网上几乎所有公开文本(书籍、网页、代码、论文……)喂给模型,让它做一件事:

看到前面的词,预测下一个词是什么。

比如给模型看 “今天天气真”,它要预测最可能的词是”好”(而不是”桌子”)。

就这么一个简单的目标,配合千亿级参数 + 万亿级 token 数据,模型在”预测下一个词”的过程中,被迫学会了:

  • 语法(主谓宾搭配)
  • 知识(事实性信息隐含在文本中)
  • 推理(因果、逻辑链条)
  • 代码(代码库中蕴含的编程模式)

这就是”涌现”(Emergence):一个简单的目标,在足够大的规模下,涌现出复杂的智能行为。

1.2 预训练的技术细节

1
2
3
4
输入: "The cat sits on the [MASK]"  →  模型预测 → "mat"
损失: 交叉熵损失(预测分布 vs 真实词)
优化: AdamW + 学习率调度 + 梯度裁剪
并行: 数据并行 + 张量并行 + 流水线并行(Kimi K3 开源的 MoonEP 就是干这个的)

1.3 算力门槛

  • GPT-3(2020):1750 亿参数,训练成本约 460 万美元
  • Kimi K3(2026):2.8 万亿参数,成本是当年的数十倍
  • 这也是为什么大模型公司疯狂融资、建数据中心(还记得创刊号里 Meta + 贝莱德 140 亿美元建数据中心吗?)

二、指令微调(SFT):让模型”听话”

预训练完成的模型(基座模型)只会”接话”,不会”回答问题”。你问它”1+1等于几”,它可能回”1+1等于2吗?1+1等于……”——因为训练数据里没有”问答”这种格式。

指令微调(Supervised Fine-Tuning, SFT) 解决这个问题:用人工标注的”问题-答案”对,让模型学会对话格式。

1
2
用户: 解释一下什么是注意力机制
助手: 注意力机制是让模型在处理序列时...

数据量通常只有几万到几十万条(相比预训练的万亿 token 是九牛一毛),但效果立竿见影:模型从”文字接龙”变成”智能助手”。


三、RLHF:让模型”讨人喜欢”

光会答题还不够——模型可能答得正确但语气生硬,或者输出有害内容。RLHF(基于人类反馈的强化学习) 登场:

  1. 训练奖励模型:让人类对模型的多个回答排序(哪个更好),训练一个”打分器”
  2. 强化学习:用 PPO 等算法,让主模型学会”怎么回答才能拿高分”
1
2
3
步骤1: 收集人类偏好数据(A/B 排序)
步骤2: 训练奖励模型(Reward Model)
步骤3: 用强化学习微调主模型(PPO)

这就像训练一个实习生:先教他知识(预训练),再教他格式(SFT),最后告诉他”这么说老板更喜欢”(RLHF)。


四、推理:模型到底在做什么?

4.1 自回归生成

训练时预测下一个词,推理时也是预测下一个词——只不过把预测出的词接回输入,继续预测下一个:

1
2
3
4
5
6
7
输入: "中国的首都是"
→ 预测: "北"
→ 输入: "中国的首都是北"
→ 预测: "京"
→ 输入: "中国的首都是北京"
→ 预测: "<结束>"
→ 输出: "北京"

这个过程叫自回归生成(Autoregressive Generation)。一次生成一个 token(约 1-2 个汉字或半个单词),所以大模型”说话”其实是一步一步挤出来的。

4.2 推理 vs 思考

重要澄清:模型推理时没有”思考”——没有意识,没有意图,只是在做概率计算。但为什么 DeepSeek V4-Flash 的 Agent 能力”大幅增强”?

关键在于 推理时扩展(Inference-time Scaling)

  • 思维链(Chain-of-Thought):让模型”先想再答”,把推理过程写出来再给结论
  • 树搜索 / 自我反思:模型生成多个候选答案,自我评估挑选(DeepSeek-R1 开创的范式)
1
2
3
用户: 17 × 23 = ?
模型(思维链): 17 × 20 = 340, 17 × 3 = 51, 340 + 51 = 391
结论: 391

这也是 2026 年最大的技术主线——从”模型变聪明”转向”让模型多想一会儿”


五、上下文窗口与 KV Cache

5.1 上下文窗口

Kimi K3 支持 100 万 token 上下文——意味着单次能处理约 75 万单词(几本《三体》)。上下文窗口 = 模型”工作记忆”的大小。

但注意:上下文 ≠ 记忆。模型不会”记住”上次对话,每次对话都是全新计算。所谓”长记忆”,是把历史都塞进上下文窗口。

5.2 KV Cache:为什么长上下文贵?

回忆 Transformer 注意力公式:softmax(QK^T/√d_k)V。生成每个新 token 时,需要和前面所有 token 计算注意力。为了不重复计算,模型把之前所有 token 的 K 和 V 缓存下来,这就是 KV Cache

  • 上下文越长,KV Cache 越大(10 万 token 可能要几十 GB 显存)
  • 这就是”长上下文很贵”的技术根源
  • GQA(上一篇讲的)通过共享 K/V 头,大幅压缩 KV Cache——DeepSeek 的”极致性价比”秘密之一

六、量化与部署:模型怎么”变小”

Kimi K3 有 2.8 万亿参数,按 FP16 存储需要 5.6 TB 显存——没有单机能装下。实际部署靠:

  1. 量化(Quantization):把参数从 16 位压缩到 8 位/4 位,模型体积缩小 4 倍,精度损失很小
  2. 分布式推理:权重切分到多张 GPU(Kimi K3 用 MoE 架构,每 token 只激活 16 个专家,所需显存大幅降低)
  3. 蒸馏(Distillation):用大模型教小模型(DeepSeek V4-Flash 130 亿激活参数,就是”小而强”的代表)

想在浏览器里跑小模型?下一篇 WebGPU 实战:在浏览器里跑大模型 带你零成本上手。


七、LLM 全景图(一张表看懂)

阶段 做什么 数据量 成本量级
预训练 学语言+知识(接话) 万亿 token 数千万美元
SFT 学会问答格式 数万条 数万美元
RLHF 学会讨喜+安全 数十万条偏好 数万美元
推理优化 量化/蒸馏/缓存 持续优化

八、总结与联动

核心记忆点

  1. LLM 的一切始于预测下一个词,规模带来涌现
  2. 预训练 → SFT → RLHF 三步,模型从”会接话”到”会聊天”
  3. 推理是自回归,一次一个 token;”推理”≠”思考”
  4. 上下文窗口是工作记忆,KV Cache 是长上下文贵的根源
  5. 量化 + MoE 让 2.8 万亿参数的模型能跑起来

联动阅读


思考题:如果 LLM 只是”预测下一个词”,为什么它写代码比大多数程序员好?欢迎评论区讨论——提示:答案在”规模”和”数据”里。