§ 2.5 · Section

大语言模型 · LLM

Large Language Model

大语言模型(LLM)是生成式 AI 里最当红的一支——ChatGPT、Claude、DeepSeek、通义、Kimi、豆包,你天天在用的这些"AI 对话产品",背后都是一个 LLM。这一篇讲清楚它是什么、有多大、以及"大"到底大在哪。更重要的是,讲清它为什么会这样犯错:为什么它数不清一个单词里有几个字母、为什么它能编出一个不存在的法律条文还引用得头头是道、为什么同一个问题换个问法答案就变了。这些不是产品的 bug,而是它的构造方式必然带来的性格。理解了 Token、Scaling Law、涌现、上下文窗口这几个概念,你对它的所有行为都会突然变得可预期。

生活场景
📚 一个读完整个互联网的"学徒"

想象一个学徒,从小把人类整个互联网的文本都读了一遍——维基百科、小说、论坛、代码、论文、新闻。
读完之后,你问他任何一个问题,他都能"接得上话"——因为在过去的阅读里,他见过无数相似的问答模式。
这就是 LLM。它不是"知道答案",是"熟悉语言的下一个词该是什么"

先把术语翻译成人话

这一节的名词几乎全是英文缩写,听着玄得厉害,拆开却都能落到生活里。先一次性摊平——换成大白话再各配一个对应场景:

术语换成大白话生活里对应什么
LLM(Large Language Model,大语言模型——读了海量文字、学会接话的程序)它不是"知道答案",是"熟悉下一个词该是什么"图书馆待了一辈子的人,你说半句他能接下半句
Token(词元——模型眼里的最小单位,一段被切开再编号的文字碎片)它看不见字母,只看见一串编号快递面单上的条码:机器只认那串数字,不认你写的收件人名字
Tokenizer(分词器——决定怎么切、怎么编号的那套规则)负责把整句话剁成碎块的那把刀厨房里的案板和刀:同一条鱼,切法不同,后面菜就不同
参数(Parameter——网络里那一大堆可以拧的旋钮)几千亿个旋钮,机器自己一遍遍拧到位一整面墙的开关,没人贴标签,全靠反复试出来的手感
上下文窗口(Context Window——它一次能看到的 token 总量)它的桌面有多大,桌面外的东西对它不存在办公室那张办公桌:摊得开的材料它能看,塞进抽屉的它当没有
Scaling Law(缩放定律——参数、数据、算力和效果之间的稳定幂律关系)投入和产出之间有条可以画出来的线,所以能提前算划不划算装修报价单:面积乘单价,动工前就能估出总价
涌现(Emergent Ability——小模型完全不会、大模型突然会了的能力)量堆到某个点,忽然多出一样本来没有的本事孩子背了三年古诗都在硬记,某天突然自己会用了
上下文学习(In-Context Learning——不改一个参数,看几个例子就临时学会新任务)不用回炉重训,你举两个例子它就照着办新同事看你做过两遍作业,第三遍自己就能做
思维链(Chain-of-Thought——让它把中间步骤写出来再给答案)给它一张草稿纸,别逼它心算做数学题在笔记上列竖式,而不是盯着题干硬想
预训练(Pre-training——喂海量文本学"接下一个词")先把书全读完,读的时候没人管他会不会说话把整个图书馆读完的人,学问很大但不会应酬
SFT(Supervised Fine-Tuning,监督微调——用人写的问答示范教它怎么答)给他示范"人家问这个,你该这么回"入职培训:老员工带着做三天,他就知道窗口该怎么接待
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)人给他的回答打分,他照着高分的方向改服务员按客人评分拿绩效,慢慢就摸出客人爱听什么
RAG(Retrieval-Augmented Generation,检索增强生成——先查资料再回答)不许凭记忆答,先去把原文翻出来摆在桌上图书馆先按索书号找到那本书,再照着书上写
MoE(Mixture of Experts,混合专家——把网络切成很多子网,每次只用其中几个)店里挂着二十位专家的牌子,但每次只叫两位出来接诊医院有几十个科室,你挂号那天只走进其中一两个
幻觉(Hallucination——一本正经地编造)它追求"听着像",不追求"确实是"一个记忆模糊的人复述开会内容,句句通顺,细节全是自己补的

这张表里最要紧的是 Token 那一行。它眼里的世界不是字,是一串编号——这一条能解释它一大半的"低级错误"说白了:让它数"strawberry 里有几个 r",就像让你数一个手机号里有几笔画——不是它笨,是它手上那份材料里根本没有笔画这个东西。

再把整个 LLM 打个比方收成一句。想象一下一个人被关在图书馆里读了几万年的书,然后所有书被搬走,他手里什么都没留下——你现在问他任何问题,他能给你一段读起来严丝合缝的回答,因为他脑子里留着"这类句子后面通常接什么"的强烈直觉。他说的每一句都极像出自某本书,但那本书可能并不存在其实就是这么个东西:它干的活儿从头到尾只有一件——猜下一个词该是什么,然后把猜出来的那个词也当成条件,再猜下一个。

简单说,理解 LLM 只需要抓住两句话:它的全部本事来自"猜下一个词"这一个动作被重复了几百次;它的全部毛病也来自这同一个动作。逐字输出、答案不稳定、开头错了就顺着错下去、数不清字母、编造却语气笃定——这五件事本质上就是同一个机制的五种表现。

三个字:大 · 语言 · 模型

大 · Large

规模巨大

参数从几十亿到几万亿;训练数据从数千亿到十几万亿 token;训练用的 GPU 从几百张到上万张。

语言 · Language

专攻文本

核心任务是"预测下一个词"——所以它是文本生成的天然选手。多模态(图/音/视频)是在此基础上扩展的。

模型 · Model

一个大函数

本质是"输入若干 token,输出下一个 token 的概率分布"的函数。所有的"神奇能力"都来自这个函数的复杂度。

第三张卡片值得反复咀嚼,因为它是一切的根。把一个几千亿参数的模型剥到最里面,它做的事情用一句话就能说完:给定前面的一串 token,输出词表里每一个 token 作为"下一个"的概率。仅此而已。没有意图、没有计划、没有"想说什么",只有一个概率分布。你看到的长篇回答,是这个动作被重复了几百次的结果——每次吐出一个 token,把它追加到输入后面,再重新算一次。

输入: "今天天气真"
输出的概率分布:
    好      42.1%   ← 采样一个,比如选中"好"
    不错    18.7%
    热      11.2%
    冷       6.4%
    ...(词表里剩下十几万个 token 分摊剩余概率)

下一轮输入变成: "今天天气真好"  →  再算一次  →  ","
再下一轮:       "今天天气真好," →  再算一次  →  "适合"
                              ↑ 就这样一个字一个字滚出整篇文章

理解这一点,你就能解释一大堆看似诡异的现象:它为什么逐字输出(因为必须串行,前一个不定后一个算不了);它为什么同一个问题两次答得不一样(因为是从概率分布里采样,不是取最大);它为什么一旦开头说错就会顺着错下去(因为错的 token 已经进了上下文,成了它接下来推理的既定前提);以及它为什么不擅长"先想好整体结构再写"(它没有草稿纸,除非你让它把思考过程也写出来——这就是"思维链"提示为什么有效的原因)。

Token 与分词:模型眼里的世界不是字

这是初学者最容易忽略、却能解释最多怪现象的一个概念。模型看不到字符,它看到的是 token——一串被切分后再映射成整数的片段。切分规则由分词器(Tokenizer)决定,主流方法是 BPE(字节对编码):从单字节开始,统计语料里哪两个相邻单元最常一起出现,就把它们合并成一个新单元,重复几万次,得到一张几万到几十万条的词表。

结果是 token 的粒度很不均匀:常见英文单词通常是 1 个 token,生僻词会被拆成几块("unbelievable"可能被切成"un + believ + able");中文因为字符本身信息密度高,一个常用汉字大约是 1 个 token,生僻字可能占 2 到 3 个。粗略经验值:1 个英文 token 约等于 4 个字符或 0.75 个英文单词;1000 个汉字大约需要 700 到 1500 个 token(各家分词器差异很大)。

为什么这件小事这么重要?因为它直接决定了三件你每天都会碰上的事:

还有一个更隐蔽的影响:分词方式会造成语言之间的不公平。早期模型的词表以英文为中心,同样内容的中文、阿拉伯语、泰语要消耗几倍的 token,意味着同样的内容更贵、更容易撑爆上下文、效果也更差。这就是为什么各家在做中文模型时都要重新训练分词器、扩充中文词表——它不是锦上添花,而是直接影响成本和性能的基础设施。本页末尾的分词器互动组件可以让你亲手看看一段文字是怎么被切碎的,读完全文后不妨回去试一试。

规模一览(举例以公开数字为准,型号会随迭代变化)

档位参数量训练成本估算代表模型
< 10 亿几万美元Qwen-0.5B、Phi-3
7B–70B几十万美元Llama-7B/70B、Mistral
百亿到千亿数百万美元DeepSeek-V3、Claude 3.5
超大 (MoE)万亿级几千万美元GPT-4o、Gemini 1.5

把这张表放进时间轴,才能看出这条曲线有多陡。下面是 GPT 系列的公开数字,它几乎就是整个行业的缩影:

模型年份参数量训练数据量关键意义
GPT-120181.17 亿约 5GB 图书语料确立"预训练 + 微调"范式
GPT-2201915 亿约 40GB 网页文本第一次展示零样本能力,OpenAI 曾以"太危险"为由延迟发布完整版
GPT-320201750 亿约 3000 亿 token规模跃升 100 倍,上下文学习(few-shot)出现,行业转向
InstructGPT2022基于 GPT-3+ 人工标注偏好数据引入 RLHF,让模型"听话"——ChatGPT 的直接前身
ChatGPT2022.11两个月破亿用户,把 LLM 变成全民产品
GPT-42023未公开(推测 MoE 万亿级)推测十万亿级 token多模态、专业考试接近人类前列
推理模型(o 系列 / R1 等)2024–2025+ 强化学习长思维链转向"推理时算力":让模型多想一会儿再答

这条时间轴上有两个转折特别值得注意。第一个是 GPT-3 到 InstructGPT:参数没变,只是加了人类偏好对齐,可用性却发生质变。这说明"能力"和"可用"是两件事——原始预训练模型像个博览群书但答非所问的怪人,对齐是把它教成一个助手的过程。第二个是 2024 年后的推理模型路线:不再单纯堆参数,而是让模型在回答前生成长长的内部思考过程,用"推理时的算力"换准确率。这是一次范式补充——过去是训练时花钱,现在也可以在回答时花钱。

还要说清 MoE(混合专家)这个让参数量数字变得暧昧的技术。传统"密集"模型每生成一个 token 都要动用全部参数;MoE 把网络切成很多"专家"子网,每次只激活其中少数几个。于是一个"总参数万亿级"的模型,实际每次计算可能只用了几百亿——总参数决定它能装多少知识,激活参数决定它跑起来多贵。所以今后看到参数量,一定要问一句是总参数还是激活参数,否则数字没有可比性。

Analogy · 大 = 深 × 广 × 通用

"大"不是营销词,它对应真实的三层扩展:
· ——网络层数变多(从几十层到上百层);
· 广——每层的参数变多(从上万到上亿);
· 通用——训练数据从单一领域扩展到"人类整个数字文明"。
三者一起放大,才有了今天让人震惊的表现。

再补一个直观的体量感:一个 700 亿参数的模型,如果每个参数用 16 位浮点存储,光是把它装进显存就需要约 140GB——这已经超过任何一张消费级显卡,必须多卡切分,或者做量化压缩(压到 4 位约需 35–40GB,才勉强能在高端工作站上跑)。这就是为什么"本地部署大模型"听起来美好、实际门槛很高,也是为什么小尺寸模型和量化技术是一条独立的重要赛道。

Scaling Law:为什么整个行业都在赌"更大"

2020 年 OpenAI 的 Kaplan 等人发表了一篇改变行业走向的论文,提出了缩放定律(Scaling Law):模型的损失(可以粗略理解为"预测错误的程度")与参数量、数据量、训练算力三者之间存在稳定的幂律关系——把它们画在双对数坐标上,是一条相当漂亮的直线。

这条直线的意义远超学术:它把"要不要投十亿美元训一个更大的模型"从赌博变成了可以计算的工程决策。你可以先用小模型在小算力上跑几个点,拟合出那条直线,然后外推预测"如果我把算力放大一百倍,损失会降到多少"。整个 2020—2024 年的军备竞赛,赌的就是这条外推线不会提前拐弯。

2022 年 DeepMind 的 Chinchilla 论文做了一个重要修正。此前大家的直觉是"参数越多越好",于是 GPT-3 用 1750 亿参数只喂了 3000 亿 token。Chinchilla 通过大量实验指出:在固定算力预算下,参数量和数据量应该大致同比例增长,经验比例约为每 1 个参数配 20 个 token。按这个标准,GPT-3 是严重"训练不足"的——同样的算力如果换成"参数少一些、数据多得多",效果会更好。DeepMind 用 700 亿参数、1.4 万亿 token 训出的 Chinchilla 在多项测试上打败了 1750 亿参数的 GPT-3。这篇论文把行业的注意力从"堆参数"扭向了"堆数据",也直接引出了后来的"高质量语料会不会耗尽"这个焦虑。

时期主流信条典型做法瓶颈变成了
2020–2021参数越大越强把参数从亿级推到千亿级算力和显存
2022–2023数据要配得上参数(Chinchilla)参数适中、数据加到万亿 token高质量语料的供给
2023–2024数据质量 > 数据数量精细清洗、去重、配比、合成数据数据工程能力
2024–至今推理时也可以堆算力长思维链 + 强化学习训练推理推理成本与延迟

需要提醒的是:缩放定律描述的是损失的下降,而损失和"你关心的那个能力"之间不是线性关系。损失平滑地降,某些具体能力却可能长期为零、然后突然出现——这就引出了下一个概念。

涌现能力:小模型完全不会,大模型突然会了

2022 年 Google 的一篇论文给出了这个现象的正式定义:涌现能力是指在小模型上不存在、但在模型规模跨过某个阈值后突然出现的能力。典型例子包括三位数加减法、根据上下文示例学会新任务、多步推理、理解反事实条件、执行复杂指令格式。曲线特征很明显——在阈值之前它接近随机猜测水平,跨过之后陡然拉升。

最有名的涌现能力叫上下文学习(In-Context Learning)。它的意思是:你不需要重新训练模型,只要在对话里给它几个例子,它就临时学会了一个新任务。比如你写"开心→😀,难过→😢,生气→",它会接上"😡"。这在传统机器学习框架里是不可思议的——学习本该发生在训练阶段,参数一旦固定就不再变。但 LLM 能在不改一个参数的情况下从提示词里"学会"任务。这个特性直接催生了"提示工程"这个新职业方向,也是所有 few-shot 技巧的基础。

另一个重要涌现是思维链(Chain-of-Thought):在提示里加一句"请一步一步思考",复杂推理题的正确率能大幅提升。原因回到前面那句——模型没有草稿纸,它的"思考"只能发生在输出的 token 里。让它把中间步骤写出来,等于给了它一块草稿纸;直接要答案,等于要求它心算。有意思的是,这个技巧在小模型上完全无效甚至有害,只在足够大的模型上才生效——它本身就是一种涌现。

但这个概念也有严肃的争议。2023 年斯坦福有研究者提出:所谓涌现可能是评价指标造成的幻象。如果你用"整道题全对才算分"这种非连续指标去衡量,那么模型能力的平滑提升在图上就会表现为突然跳变;换成"部分正确也给分"的连续指标,曲线就变得平滑了。这不否认大模型更强,但它提醒我们:涌现可能不是能力的相变,而是我们尺子的刻度太粗。这个争论至今没有定论,但它是一个很好的思维训练——看到"突然出现"的曲线,先怀疑一下是不是量的方式有问题。

上下文窗口:它的"工作记忆"有多大

上下文窗口(Context Window)是模型一次能"看到"的 token 总量,包括系统提示、你的全部历史对话、你上传的文档、以及它自己正在生成的回答。它是 LLM 最硬的一条物理边界,因为窗口之外的东西对它来说不存在——不是"记得不清楚",而是完全没有。

年份典型窗口大致相当于带来的新用法
2019 (GPT-2)1K token一两页纸只能做短文本续写
2020 (GPT-3)2K–4K几页纸短对话、单段改写
20238K–32K一篇论文整篇文档问答
2024128K–200K一本书整个代码库分析、长报告审阅
2024 后1M+几十本书 / 数小时视频把知识库直接塞进提示词

为什么变长这么难?因为标准注意力机制的计算量随序列长度平方级增长——序列长十倍,计算量涨一百倍。所以长上下文是一系列硬工程堆出来的:FlashAttention 优化显存读写、稀疏与滑窗注意力削减计算、旋转位置编码(RoPE)及其外推让模型能处理超出训练长度的序列、KV Cache 量化压缩推理内存。

更要紧的是:窗口大不等于用得好。有一项被广泛引用的研究发现了"中间遗失(Lost in the Middle)"现象——把关键信息放在长上下文的开头或结尾,模型能准确找到;放在正中间,准确率明显下降。这就像人读一本很厚的书,最记得开头和结尾。所以实用建议是:把最重要的指令和材料放在开头或末尾,别埋在中间;能精简就精简,不要因为窗口大就无脑往里塞。

还有一个概念区分必须讲清:上下文不是记忆。窗口内的信息是"短期工作记忆",对话一结束就全部消失,模型的参数一个字节都没变。你今天教它的东西,明天开新对话它完全不知道。产品里的"记忆功能"是外部实现的——把要点存到数据库,下次对话时再悄悄塞进提示词。真正把知识写进参数需要训练,那是另一件事。

Analogy · 一张只有这么大的办公桌

上下文窗口最贴身的类比,是一张固定大小的办公桌。它坐在办公室里,桌面就那么大——所有它能参考的东西,必须此刻正摊在桌面上。
你发的系统提示、你们之前聊的每一句、你上传的那份文档、以及它正在写的这段回答,全都要挤在同一张桌上。所以你摊进去的资料越厚,留给它落笔的空地就越小——这就是"输入和输出共享额度"这句话的实际含义。
桌子之外的东西,对它不是"记不清",而是"不存在"。上一次对话的内容没有被留在桌上,那不是它忘了,是那些纸从来没进过这间屋子。所以产品里那个"记忆功能",其实是有人在你开口之前偷偷把几张旧纸重新摆回桌面,而不是它自己想起来了。
这个类比还能顺手解释"中间遗失":桌上材料一多,它最容易盯住的是最上面那几张和最下面那几张,正中间夹着的那页反而容易被压住——就像你翻一本厚笔记,最记得住的永远是开头和结尾。所以要紧的话往头尾放,别埋在中间。
最后一层:桌面变大是有代价的。桌子每宽一倍,它要在纸与纸之间比对的次数就涨四倍——这就是为什么长上下文不是"改个数字",而是一堆硬工程堆出来的。

LLM 是怎么"学会说话"的

训练一个 LLM 主要分三阶段(第 6 章"训练三部曲"会详讲):

1. 预训练 · Pre-training

喂海量文本(几万亿字),让它学会"预测下一个词"。这一步做完,它已经知道很多,但还不太会"聊天"。

2. 指令微调 · SFT

给它示范"人类问答对"——你问什么、应该怎么答。它开始像 ChatGPT 那样对话。

3. 对齐 · RLHF / DPO

用人类偏好反馈教它"哪种回答更有用、更礼貌、更安全"。这一步让它变得"讨人喜欢"。

三个阶段的成本和产出完全不成比例,这个不对称很值得记住。预训练吃掉了 99% 以上的算力,动用上万张卡跑几个月,产出的是一个"知识渊博但不会好好说话"的基座模型——你给它一句话它会自动往下续写,可能续出一段广告、一段论坛吵架,因为互联网上就是这样的。SFT 只需要几万到几十万条高质量人工示范、几天算力,就能把它变成一个规规矩矩的助手。对齐阶段的算力占比更小,但它决定了这个模型"讨不讨人喜欢"。

这个不对称有个重要推论:知识几乎全部来自预训练,行为几乎全部来自后两步。所以"微调能不能给模型灌新知识"这个常见问题的答案是——效率很低且容易破坏原有能力,要补知识更好的办法是 RAG(检索增强生成):把资料放外部数据库,回答时先检索相关片段、塞进上下文再让模型作答。微调改变的是"怎么说",RAG 改变的是"知道什么"。

对齐这一步还有个必须知道的副作用,叫对齐税(Alignment Tax):为了让模型更安全、更礼貌,它在某些能力上可能反而变弱——过度拒答(把无害问题也当危险拒绝)、变得啰嗦(因为人类评分者倾向于给长答案更高分)、以及谄媚倾向(你一质疑它就立刻改口道歉,即使它原本是对的)。这些不是设计者想要的,而是"用人类偏好当奖励信号"必然带来的偏差——因为人类偏好本身就不完美。

Analogy · 从"读完图书馆"到"能站柜台"的三步

预训练、SFT、对齐这三步,用一个人从读书到上岗的过程可以一次讲透。
预训练 = 他在图书馆里把书全读完了。没人教他怎么应酬,也没人管他读的是学术专著还是论坛吵架帖——他只是把见过的文字统统消化了一遍。这一步吃掉了 99% 以上的算力。读完之后你跟他说一句话,他会自动往下续写,因为他学到的规律就是"这句后面通常接什么"。相当于一个学问极大但完全不懂待人接物的人。
SFT = 入职培训三天。老员工在窗口边上带着他,示范几万次"客人问这个,你该这么答"。他很快就规规矩矩了。这一步只要几天算力,却把他从"会续写"变成了"会应答"。注意:这三天没有给他增加任何学问,只是教了他说话的规矩。
对齐 = 按客人评分发绩效。每次接待完,客人给个分,他照高分方向调。这一步让他变得讨人喜欢,但也带来了几个可以预料的副作用:评分的人偏爱长答案,他就变啰嗦;评分的人不喜欢被拒绝,他就什么都先答应;你一质疑他就立刻道歉改口,哪怕他原本是对的。
这个类比最值钱的推论是:学问全部来自第一步,脾气全部来自后两步。所以"微调能不能给他灌新知识"这个问题的答案是——效率极低,好比指望三天入职培训让他多读一屋子书。真要补知识,正确做法是把资料直接摆在他桌上让他照着念,也就是 RAG翻译成人话:微调改的是"怎么说",检索改的是"知道什么",两件事千万别混。

为什么 LLM 会"看似聪明"

第一条值得展开,因为它是整件事最反直觉的地方。为什么"预测下一个词"这么一个平庸的目标,能训出看起来会推理的东西?一个有说服力的解释是:要把这个游戏玩到极致,你被迫学会背后的规律。要准确预测"水的沸点是 100"后面接什么,你得知道物理常数;要预测"因为下雨,所以比赛"后面接什么,你得掌握因果和常识;要预测一段代码的下一行,你得理解程序逻辑;要预测侦探小说结尾"凶手是"后面的名字,你甚至得跟上整本书的线索。压缩就是理解的一种形式——为了用有限的参数记住无限的文本,模型不得不去提取规律而非死记原文。

但同一条逻辑也是它局限的来源。它的目标始终是"什么话最像是接下来会出现的",而不是"什么话是真的"。当这两者在训练数据里大体一致时,它表现得像个专家;当二者分道扬镳时(罕见事实、精确数字、最新事件),它会毫不犹豫地选择"像"而放弃"真"。所以它不是在"说谎"——它从来就没有一个"真"的概念可言。

LLM 的三大"坑"

幻觉需要更细的分类才好防。一类是事实性幻觉——编造不存在的论文标题、法律条文、API 函数、历史事件。最著名的现实案例是 2023 年美国有律师用 ChatGPT 写法律文书,引用了六个完全不存在的判例,被法官发现并处罚。另一类是忠实性幻觉——你给了它一份资料,它总结时却添加了资料里没有的内容。后者在做文档问答时更危险,因为你以为"有资料就不会瞎说"。

为什么幻觉在原理上无法根除?因为模型的目标函数里没有"真"这一项,只有"像"。它的参数是对训练语料的有损压缩,回忆细节时必然要"填空",而填出来的东西在语法和语义上都通顺自然——这就是最危险的地方:它的错误听起来和正确答案一模一样。可行的缓解手段有:让它引用来源(用 RAG 把资料摆在上下文里并要求逐句标注出处)、降低温度要求它承认不知道(显式给出"如果资料中没有,请回答不知道"的指令)、以及交叉验证(同一个问题问两三次或换模型问,答案不一致的地方就是高风险点)。

除了这三条,还有几个同样值得警惕的固有局限:

今天你能接触到的主流 LLM

阵营代表特色
OpenAIGPT-5.6 Sol / Terra / Luna官方文档首推 Sol 处理复杂推理与编码,Terra 平衡成本,Luna 面向高吞吐(截至 2026 年 8 月)
AnthropicClaude 系列长文本、安全性、写作水平顶尖
GoogleGemini 3.6 / 3.5 系列超长上下文、原生多模态;Gemini 2.0 系列官方已标注关停
MetaLlama开源旗手,可本地部署
DeepSeekV4-Flash / V4-Pro高性价比、缓存命中价极低,开放权重;旧的 deepseek-chat / deepseek-reasoner 已于 2026-07-24 弃用
阿里Qwen · 通义千问开源生态强,中文表现好
字节豆包 / Doubao中文场景投入大、迭代快
月之暗面Kimi超长文本擅长

★ 一个诚实的提醒:这张表明年就不准了

上面那张表,我写的时候是准的,但你读到它的时候很可能已经不准了。这不是偷懒,而是这个领域的客观状况——模型型号的迭代速度比任何教材的修订速度都快。所以这里教你一件比"记住哪个模型最强"有用得多的事:怎么自己去查,以及查的时候会遇到什么坑。

最大的坑是:官方文档自己会前后矛盾。这听起来不可思议,但它真实发生,而且相当常见。

就在我核对这一节的 2026 年 8 月 7 日,OpenAI 的两个官方文档站点给出了不同答案:developers.openai.com 的模型页把 GPT-5.6 Sol 列在最前面推荐;而 platform.openai.com 的模型页上还写着 "use gpt-5.5, our flagship model"(用 gpt-5.5,我们的旗舰模型)。同一家公司、同一天、两个官方页面,说法不一致。

换成大白话:这就像去一家餐厅,门口的招牌写着"本店招牌菜是红烧肉",进去翻开菜单,菜单第一页却推荐"今日主打糖醋鱼"。不是有人在骗你,是招牌换得比菜单快——大公司的文档分散在不同团队维护,更新节奏对不齐,落后的那一份就成了"过期的官方说法"。

遇到这种情况,正确做法不是挑一个自己信,而是把两个都摆出来。你可以说"截至某日,A 页面推荐 X,B 页面仍写 Y"——这既诚实,也把判断权交还给读者。硬要在两个官方说法里选一个当"真相",那是你在替官方做决定,而你并没有这个依据。

这不是 OpenAI 独有的毛病。本书 § 11.6 讲 MCP 协议时会遇到一模一样的情况:MCP 官方的版本说明页写着"当前版本是 2025-11-25",但它的"最新规范"链接实际指向 2026-07-28 的修订版,而且那份修订已经有了完整的变更日志。两个官方页面互相打脸,我们同样把两个都写了出来。

你看到的说法不该怎么做该怎么做
两个官方页面说法不同挑一个看起来更新的当真相并列写出两者,标注各自出处与查询日期
某模型被称为「最新」「最强」直接抄进笔记当结论记下"某日某官方页面如此表述",日期是关键
自媒体给出的排名与跑分当作事实引用回到官方文档或论文原文核对,查不到就写"未取得"
某产品「即将上线」当作已经可用区分公告与实际可用性,注明状态与时间

所以给你的实用建议是:需要确认某个模型的当前状态时,直接去厂商的 API 文档页(不是营销博客),那里的型号列表和定价通常是最新的,因为它要对开发者的账单负责。说白了——要花钱的那一页,通常比不花钱的那一页更新得勤。

这张表最重要的一条分野是开源与闭源,它决定了你能不能把模型握在自己手里。这里还要先澄清一个用词问题:多数所谓"开源模型"其实是开放权重(open-weight)——它公开了训练好的参数,让你能下载、部署、微调,但通常不公开训练数据和完整训练代码,而且许可协议往往带有商用规模限制。这和软件领域"开源"的严格含义并不相同,是行业里被广泛借用的一个宽松说法。

维度闭源 API(GPT / Claude / Gemini)开放权重(Llama / Qwen / DeepSeek)
能力上限通常领先半代到一代追赶速度很快,差距在收窄
数据隐私数据要出本地,受合规约束可完全私有化部署,数据不出内网
成本结构按调用量付费,无前期投入要先买硬件,但量大后单位成本更低
可定制性只能有限微调,架构不可动可任意微调、蒸馏、量化、改架构
稳定性风险厂商随时可能改版或下线,行为会变权重在手,版本永久可复现
适合谁快速验证、要最强效果的团队有合规要求、有量、要深度定制的团队

这场竞争的实际后果对普通用户是纯利好:开放权重把能力下限整个抬高了,逼得闭源厂商必须持续降价并往上突破。2023 年之后 API 的单位价格下降了一到两个数量级,而一台高配工作站就能跑起两年前顶级水准的模型。趋势判断是:最前沿的能力仍会由闭源领跑一段,但"够用"这条线正在被开放权重快速拉低成本。

最后给一条挑模型的实用建议,比看榜单靠谱得多:用你自己的真实任务做一套二十到三十条的私有测试集,让候选模型各跑一遍,人工比对。公开榜单存在数据污染(测试题可能已进入训练语料)和过拟合基准的问题,而你的私有任务不会。同时别忘了成本与延迟——很多场景下一个便宜快速的中等模型,配上好的提示词和检索,效果胜过昂贵的顶级模型裸用。

Recap · 收束

大语言模型是过去 5 年 AI 最重要的一个词。往里看它是"深度学习 + Transformer + 海量语料 + 巨额算力"四件事的组合;往外看它是我们和 AI 对话的入口。从这一篇开始,后面的所有章节都会围绕它展开。

八条要点收束这一节:(1) 剥到最里面,它只做一件事——输出下一个 token 的概率分布,逐字输出、答案不稳定、错了会顺着错下去,全由此而来;(2) 它眼里的世界是 Token 不是字,这解释了计费方式、窗口长度,也解释了它为什么数不清 strawberry 里的 r;(3) 参数规模从 GPT-1 的 1.17 亿到 GPT-4 的万亿级 MoE,六年放大了近万倍;(4) Scaling Law 把"要不要投更多钱"变成了可计算的决策,Chinchilla 又把重心从堆参数扭向了堆数据;(5) 涌现带来了上下文学习和思维链,但它可能部分是评价指标太粗造成的幻象;(6) 上下文窗口是工作记忆不是长期记忆,且存在"中间遗失",重要信息要放头尾;(7) 预训练给知识、SFT 和对齐给行为,补知识该用 RAG 而非微调;(8) 幻觉在原理上无法根除,因为它的目标里只有"像"没有"真"。所以最实用的一句话:把它当成一个博览群书、表达极佳、但从不查证也从不负责的合作者——你负责验证,它负责产出。

☰ 主页
Xue Hai Wu Ya · § 2.5 · LLM