第 7 章 · Transformer
2017 年 6 月,Google 一篇《Attention is All You Need》改变了整个 AI 领域。这篇论文提出的 Transformer 架构,成了后来 BERT、GPT、ChatGPT、Sora、Claude、DeepSeek 的共同基石。这一章分五个子篇,把 Transformer 的心脏拆给你看。
本章要回答什么
2017 年之前,为什么 RNN 走进了死胡同?Attention 注意力机制是什么魔法,让每个词都能"看到"整句话的其他词?QKV、多头、Encoder/Decoder、MoE 这几个词你听过很多遍——它们到底是什么?看完这五篇,你就掌握了 2017 年至今整个大模型革命的技术底座。
具体来说,这五节各回答一个问题:
- 为什么"注意力"能取代逐字阅读?——老办法读句子像传话游戏,一个人传给下一个人,传到第五十个词,第一个词早忘光了。注意力让每个词直接跟所有词打照面,谁都不用等。
- QKV 这三个字母到底代表什么?——听着玄,其实就是图书馆查书的三件东西:你要查的问题、每本书书脊上的标签、书里真正的内容。
- 为什么要"多头"?一个头不够用吗?——一个人看合同容易只盯着价格,漏了违约条款。请八个各有专长的人同时看同一份材料,各看各的重点,最后汇总。
- BERT 和 GPT 明明都是 Transformer,为什么本事不一样?——同一套骨架有三种装法:只会读的、只会写的、一边读一边写的。最后是"只会写"的那种统一了天下。
- 参数上千亿,每次却只用其中几十亿,怎么做到的?——MoE 混合专家:像大医院分科室,挂号台按症状分诊,不是每个医生都给你看一遍。
读一句话"那只猫追着球跑,最后它抓到了",你的眼睛会本能地跳回去看"猫"——判断"它"指谁。这个"跳回去关注前面某个词"的能力,就是 Attention。Transformer 给了每个词一个"随时看整句话所有其他词"的超能力——这就是它爆火的根本原因。
先搞清楚它到底解决了什么麻烦
要理解 Transformer 为什么是个大事,得先知道它之前的日子有多难过。
2017 年以前,处理文字的主流办法叫 RNN(Recurrent Neural Network,循环神经网络)。它读句子的方式,跟人一个字一个字念出声差不多:读第一个词,记点笔记;读第二个词,把笔记更新一下;读第三个词,再更新……一直往后。
这办法有两个要命的毛病。第一是记不住远处的事——笔记本大小是固定的,读到第五十个词的时候,第一个词的信息早被后面挤没了。就像你听人讲了十分钟的长句子,问你开头说的是什么,你也答不上来。第二是没法同时干活——必须读完第一个词才能读第二个,一千个词就得老老实实排队一千次。显卡明明有上万个计算核心,却只能一个一个来,就像一条只能站一个人的流水线。
Transformer 一下把这两个问题都解掉了。它不再排队,而是让所有词一次性摊在桌面上,每个词同时看向所有其他词——想看多远看多远,而且全部并行。这就是那篇论文标题的意思:"注意力就是你所需要的一切",言下之意是"那套循环的老办法可以扔了"。
为什么这一章值得啃透
说一个数字你就明白它的分量:今天你听说过的几乎所有大模型——GPT、Claude、Gemini、DeepSeek、Llama、通义、文心——骨架全是 Transformer。GPT 里那个字母 T,就是 Transformer 的首字母。八年过去,中间无数新架构挑战过它,到 2026 年它仍然坐在王座上。
更值得留意的是它跨界的本事。这套东西发明时是用来做机器翻译的,结果后来发现:拿它处理图片也行(ViT)、处理语音也行(Whisper)、处理蛋白质结构也行(AlphaFold 2)、处理围棋棋谱也行。一套架构横扫所有模态,这在 AI 历史上是头一回——在此之前,图像归 CNN、语音归 RNN、各管一摊,谁也不服谁。
所以这五节不是可选的补充知识。它是理解当今 AI 的唯一必经之路:不懂注意力,就没法真正理解为什么大模型有上下文长度限制、为什么长文本推理这么烧钱、为什么模型会"忘记"对话开头说过的话。这些日常能感知到的现象,根都在这一章。
这一章怎么读
五节是层层递进的,建议按顺序读,别跳。
§7.1 先讲清"注意力"这个念头本身,不碰任何数学。§7.2 拆开它的三个零件 QKV,会带你手算一遍三个词的完整例子——这一节是全章的地基,值得慢一点。§7.3 讲为什么要并排放八个、六十四个注意力模块。§7.4 把整个架构的三种装法摆在一起对比,顺带讲位置编码、前馈层这些配套零件。§7.5 讲当前扩容的主流路线 MoE。
不必担心数学。这一章的所有公式都会先用生活场景讲一遍"它在干什么",再给算式;每个算式都配了具体数字的手算例子。如果某个地方卡住了,往前翻一节——十次有九次是前一节的地基没打牢。
本章的五节
Attention · 注意力
每个词都能"看到"其他所有词——图书馆查资料式加权。
QKV · Query/Key/Value
打分 → Softmax → 加权求和——Attention 的完整公式。
Multi-head · 多头
多组 QKV 并行——像多个专家同时会诊。
Encoder / Decoder 派系
BERT(懂)vs GPT(写)vs T5(翻)——三种主流架构。
MoE · 专家混合
万亿参数只激活一小部分——DeepSeek 的降本秘籍。
学之前先记住这一点
- Attention 是核心"Attention is All You Need"——去掉 RNN、去掉 CNN,光靠注意力就够了。
- 并行 = 快RNN 只能顺序算,Transformer 所有词并行——训练效率数量级提升。
- 现代 LLM 清一色 Decoder-onlyGPT/Claude/Llama/Qwen/DeepSeek 都是——因为它最灵活。
- MoE 是 2024 后的新趋势让万亿参数模型也能高效运行——DeepSeek-V3 把它玩到极致。