Chapter · 07

第 7 章 · Transformer

Attention is All You Need · 现代 AI 的基石

2017 年 6 月,Google 一篇《Attention is All You Need》改变了整个 AI 领域。这篇论文提出的 Transformer 架构,成了后来 BERT、GPT、ChatGPT、Sora、Claude、DeepSeek 的共同基石。这一章分五个子篇,把 Transformer 的心脏拆给你看。

本章要回答什么

2017 年之前,为什么 RNN 走进了死胡同?Attention 注意力机制是什么魔法,让每个词都能"看到"整句话的其他词?QKV、多头、Encoder/Decoder、MoE 这几个词你听过很多遍——它们到底是什么?看完这五篇,你就掌握了 2017 年至今整个大模型革命的技术底座。

Analogy · 譬喻

读一句话"那只猫追着球跑,最后它抓到了",你的眼睛会本能地跳回去看"猫"——判断"它"指谁。这个"跳回去关注前面某个词"的能力,就是 Attention。Transformer 给了每个词一个"随时看整句话所有其他词"的超能力——这就是它爆火的根本原因。

本章的五个子篇

§ 7.1

Attention · 注意力篇

每个词都能"看到"其他所有词——图书馆查资料式加权。

§ 7.2

QKV · Query/Key/Value 篇

打分 → Softmax → 加权求和——Attention 的完整公式。

§ 7.3

Multi-head · 多头篇

多组 QKV 并行——像多个专家同时会诊。

§ 7.4

Encoder / Decoder 派系篇

BERT(懂)vs GPT(写)vs T5(翻)——三种主流架构。

§ 7.5

MoE · 专家混合篇

万亿参数只激活一小部分——DeepSeek 的降本秘籍。

学之前先记住这一点

☰ 主页
Xue Hai Wu Ya · Vol.03 AI · Chapter 07