大语言模型(LLM)原理:从训练到推理的完整流程
阅读前置:本系列是 Transformer深度解读 的续篇。强烈建议先读完上一篇,再来看 LLM 是怎么”长大”的。
从 Transformer 到 LLM:中间发生了什么?
上一篇我们搞懂了 Transformer 单层的工作原理。但 GPT、Kimi K3、DeepSeek 这些”大语言模型”(Large Language Model, LLM),不是一个 Transformer 层,而是几十上百层堆叠 + 海量数据训练的产物。
一个核心问题:为什么把 Transformer 堆大、喂数据,模型就”会说话”了?
答案是:下一个词预测(Next Token Prediction)——所有 LLM 的核心训练目标,简单到令人难以置信。
一、预训练:让模型学会”接话”
1.1 核心思想
把互联网上几乎所有公开文本(书籍、网页、代码、论文……)喂给模型,让它做一件事:
看到前面的词,预测下一个词是什么。
比如给模型看 “今天天气真”,它要预测最可能的词是”好”(而不是”桌子”)。
就这么一个简单的目标,配合千亿级参数 + 万亿级 token 数据,模型在”预测下一个词”的过程中,被迫学会了:
- 语法(主谓宾搭配)
- 知识(事实性信息隐含在文本中)
- 推理(因果、逻辑链条)
- 代码(代码库中蕴含的编程模式)
这就是”涌现”(Emergence):一个简单的目标,在足够大的规模下,涌现出复杂的智能行为。
1.2 预训练的技术细节
1 | 输入: "The cat sits on the [MASK]" → 模型预测 → "mat" |
1.3 算力门槛
- GPT-3(2020):1750 亿参数,训练成本约 460 万美元
- Kimi K3(2026):2.8 万亿参数,成本是当年的数十倍
- 这也是为什么大模型公司疯狂融资、建数据中心(还记得创刊号里 Meta + 贝莱德 140 亿美元建数据中心吗?)
二、指令微调(SFT):让模型”听话”
预训练完成的模型(基座模型)只会”接话”,不会”回答问题”。你问它”1+1等于几”,它可能回”1+1等于2吗?1+1等于……”——因为训练数据里没有”问答”这种格式。
指令微调(Supervised Fine-Tuning, SFT) 解决这个问题:用人工标注的”问题-答案”对,让模型学会对话格式。
1 | 用户: 解释一下什么是注意力机制 |
数据量通常只有几万到几十万条(相比预训练的万亿 token 是九牛一毛),但效果立竿见影:模型从”文字接龙”变成”智能助手”。
三、RLHF:让模型”讨人喜欢”
光会答题还不够——模型可能答得正确但语气生硬,或者输出有害内容。RLHF(基于人类反馈的强化学习) 登场:
- 训练奖励模型:让人类对模型的多个回答排序(哪个更好),训练一个”打分器”
- 强化学习:用 PPO 等算法,让主模型学会”怎么回答才能拿高分”
1 | 步骤1: 收集人类偏好数据(A/B 排序) |
这就像训练一个实习生:先教他知识(预训练),再教他格式(SFT),最后告诉他”这么说老板更喜欢”(RLHF)。
四、推理:模型到底在做什么?
4.1 自回归生成
训练时预测下一个词,推理时也是预测下一个词——只不过把预测出的词接回输入,继续预测下一个:
1 | 输入: "中国的首都是" |
这个过程叫自回归生成(Autoregressive Generation)。一次生成一个 token(约 1-2 个汉字或半个单词),所以大模型”说话”其实是一步一步挤出来的。
4.2 推理 vs 思考
重要澄清:模型推理时没有”思考”——没有意识,没有意图,只是在做概率计算。但为什么 DeepSeek V4-Flash 的 Agent 能力”大幅增强”?
关键在于 推理时扩展(Inference-time Scaling):
- 思维链(Chain-of-Thought):让模型”先想再答”,把推理过程写出来再给结论
- 树搜索 / 自我反思:模型生成多个候选答案,自我评估挑选(DeepSeek-R1 开创的范式)
1 | 用户: 17 × 23 = ? |
这也是 2026 年最大的技术主线——从”模型变聪明”转向”让模型多想一会儿”。
五、上下文窗口与 KV Cache
5.1 上下文窗口
Kimi K3 支持 100 万 token 上下文——意味着单次能处理约 75 万单词(几本《三体》)。上下文窗口 = 模型”工作记忆”的大小。
但注意:上下文 ≠ 记忆。模型不会”记住”上次对话,每次对话都是全新计算。所谓”长记忆”,是把历史都塞进上下文窗口。
5.2 KV Cache:为什么长上下文贵?
回忆 Transformer 注意力公式:softmax(QK^T/√d_k)V。生成每个新 token 时,需要和前面所有 token 计算注意力。为了不重复计算,模型把之前所有 token 的 K 和 V 缓存下来,这就是 KV Cache。
- 上下文越长,KV Cache 越大(10 万 token 可能要几十 GB 显存)
- 这就是”长上下文很贵”的技术根源
- GQA(上一篇讲的)通过共享 K/V 头,大幅压缩 KV Cache——DeepSeek 的”极致性价比”秘密之一
六、量化与部署:模型怎么”变小”
Kimi K3 有 2.8 万亿参数,按 FP16 存储需要 5.6 TB 显存——没有单机能装下。实际部署靠:
- 量化(Quantization):把参数从 16 位压缩到 8 位/4 位,模型体积缩小 4 倍,精度损失很小
- 分布式推理:权重切分到多张 GPU(Kimi K3 用 MoE 架构,每 token 只激活 16 个专家,所需显存大幅降低)
- 蒸馏(Distillation):用大模型教小模型(DeepSeek V4-Flash 130 亿激活参数,就是”小而强”的代表)
想在浏览器里跑小模型?下一篇 WebGPU 实战:在浏览器里跑大模型 带你零成本上手。
七、LLM 全景图(一张表看懂)
| 阶段 | 做什么 | 数据量 | 成本量级 |
|---|---|---|---|
| 预训练 | 学语言+知识(接话) | 万亿 token | 数千万美元 |
| SFT | 学会问答格式 | 数万条 | 数万美元 |
| RLHF | 学会讨喜+安全 | 数十万条偏好 | 数万美元 |
| 推理优化 | 量化/蒸馏/缓存 | — | 持续优化 |
八、总结与联动
核心记忆点
- LLM 的一切始于预测下一个词,规模带来涌现
- 预训练 → SFT → RLHF 三步,模型从”会接话”到”会聊天”
- 推理是自回归,一次一个 token;”推理”≠”思考”
- 上下文窗口是工作记忆,KV Cache 是长上下文贵的根源
- 量化 + MoE 让 2.8 万亿参数的模型能跑起来
联动阅读
- 上一篇:Transformer深度解读
- 速递里说的”Agent 能力”到底指什么?→ 看 AI双周速递·创刊号
- 想动手调模型?→ 开源项目贡献指南 了解如何参与开源模型生态
- 下一篇:WebGPU实战:在浏览器里跑大模型
思考题:如果 LLM 只是”预测下一个词”,为什么它写代码比大多数程序员好?欢迎评论区讨论——提示:答案在”规模”和”数据”里。
