大语言模型 · LLM 篇
大语言模型(LLM)是生成式 AI 里最当红的一支——ChatGPT、Claude、DeepSeek、通义、Kimi、豆包,你天天在用的这些"AI 对话产品",背后都是一个 LLM。这一篇讲清楚它是什么、有多大、以及"大"到底大在哪。
想象一个学徒,从小把人类整个互联网的文本都读了一遍——维基百科、小说、论坛、代码、论文、新闻。
读完之后,你问他任何一个问题,他都能"接得上话"——因为在过去的阅读里,他见过无数相似的问答模式。
这就是 LLM。它不是"知道答案",是"熟悉语言的下一个词该是什么"。
三个字:大 · 语言 · 模型
规模巨大
参数从几十亿到几万亿;训练数据从数千亿到十几万亿 token;训练用的 GPU 从几百张到上万张。
专攻文本
核心任务是"预测下一个词"——所以它是文本生成的天然选手。多模态(图/音/视频)是在此基础上扩展的。
一个大函数
本质是"输入若干 token,输出下一个 token 的概率分布"的函数。所有的"神奇能力"都来自这个函数的复杂度。
规模一览(截至 2026)
| 档位 | 参数量 | 训练成本估算 | 代表模型 |
|---|---|---|---|
| 小 | < 10 亿 | 几万美元 | Qwen-0.5B、Phi-3 |
| 中 | 7B–70B | 几十万美元 | Llama-7B/70B、Mistral |
| 大 | 百亿到千亿 | 数百万美元 | DeepSeek-V3、Claude 3.5 |
| 超大 (MoE) | 万亿级 | 几千万美元 | GPT-4o、Gemini 1.5 |
"大"不是营销词,它对应真实的三层扩展:
· 深——网络层数变多(从几十层到上百层);
· 广——每层的参数变多(从上万到上亿);
· 通用——训练数据从单一领域扩展到"人类整个数字文明"。
三者一起放大,才有了今天让人震惊的表现。
LLM 是怎么"学会说话"的
训练一个 LLM 主要分三阶段(第 6 章"训练三部曲"会详讲):
1. 预训练 · Pre-training
喂海量文本(几万亿字),让它学会"预测下一个词"。这一步做完,它已经知道很多,但还不太会"聊天"。
2. 指令微调 · SFT
给它示范"人类问答对"——你问什么、应该怎么答。它开始像 ChatGPT 那样对话。
3. 对齐 · RLHF / DPO
用人类偏好反馈教它"哪种回答更有用、更礼貌、更安全"。这一步让它变得"讨人喜欢"。
为什么 LLM 会"看似聪明"
- 语言即知识人类几乎所有知识都用语言承载——学会"接下一个词",等价于学会了大量隐含的世界规律。
- 规模涌现当参数量到达某条阈值线,一些能力(推理、抽象、多步计算)会"突然"出现——这就是"涌现"。
- 上下文学习你在对话里给几个例子(few-shot),它就能马上"学会"新任务——不需要重新训练。
LLM 的三大"坑"
- 幻觉它是在"猜下一个词",不是"查事实"。凡是事实、人名、数字、引用,都必须复核。
- 上下文限制它一次能看的 token 是有限的(今天主流 128K–1M);再长就会忘前面。
- 时效性训练数据有截止日期。问它最新新闻,除非开了"联网搜索",否则会瞎编。
今天你能接触到的主流 LLM
| 阵营 | 代表 | 特色 |
|---|---|---|
| OpenAI | GPT-4o / o3 / o4 | 综合能力最强,推理和多模态领先 |
| Anthropic | Claude 系列 | 长文本、安全性、写作水平顶尖 |
| Gemini 1.5 / 2.0 | 超长上下文(百万 token)、多模态强 | |
| Meta | Llama | 开源旗手,可本地部署 |
| DeepSeek | V3 / R1 | 高性价比、推理见长,开源 |
| 阿里 | Qwen · 通义千问 | 开源生态强,中文表现好 |
| 字节 | 豆包 / Doubao | 用户量最大,快速迭代 |
| 月之暗面 | Kimi | 超长文本擅长 |
大语言模型是过去 5 年 AI 最重要的一个词。往里看它是"深度学习 + Transformer + 海量语料 + 巨额算力"四件事的组合;往外看它是我们和 AI 对话的入口。从这一篇开始,后面的所有章节都会围绕它展开。