Chapter · 07
第 7 章 · Transformer
Attention is All You Need · 现代 AI 的基石
2017 年 6 月,Google 一篇《Attention is All You Need》改变了整个 AI 领域。这篇论文提出的 Transformer 架构,成了后来 BERT、GPT、ChatGPT、Sora、Claude、DeepSeek 的共同基石。这一章分五个子篇,把 Transformer 的心脏拆给你看。
本章要回答什么
2017 年之前,为什么 RNN 走进了死胡同?Attention 注意力机制是什么魔法,让每个词都能"看到"整句话的其他词?QKV、多头、Encoder/Decoder、MoE 这几个词你听过很多遍——它们到底是什么?看完这五篇,你就掌握了 2017 年至今整个大模型革命的技术底座。
Analogy · 譬喻
读一句话"那只猫追着球跑,最后它抓到了",你的眼睛会本能地跳回去看"猫"——判断"它"指谁。这个"跳回去关注前面某个词"的能力,就是 Attention。Transformer 给了每个词一个"随时看整句话所有其他词"的超能力——这就是它爆火的根本原因。
本章的五个子篇
§ 7.1
Attention · 注意力篇
每个词都能"看到"其他所有词——图书馆查资料式加权。
§ 7.2
QKV · Query/Key/Value 篇
打分 → Softmax → 加权求和——Attention 的完整公式。
§ 7.3
Multi-head · 多头篇
多组 QKV 并行——像多个专家同时会诊。
§ 7.4
Encoder / Decoder 派系篇
BERT(懂)vs GPT(写)vs T5(翻)——三种主流架构。
§ 7.5
MoE · 专家混合篇
万亿参数只激活一小部分——DeepSeek 的降本秘籍。
学之前先记住这一点
- Attention 是核心"Attention is All You Need"——去掉 RNN、去掉 CNN,光靠注意力就够了。
- 并行 = 快RNN 只能顺序算,Transformer 所有词并行——训练效率数量级提升。
- 现代 LLM 清一色 Decoder-onlyGPT/Claude/Llama/Qwen/DeepSeek 都是——因为它最灵活。
- MoE 是 2024 后的新趋势让万亿参数模型也能高效运行——DeepSeek-V3 把它玩到极致。
Xue Hai Wu Ya · Vol.03 AI · Chapter 07