§ 2.5 · Sub-chapter

大语言模型 · LLM 篇

Large Language Model

大语言模型(LLM)是生成式 AI 里最当红的一支——ChatGPT、Claude、DeepSeek、通义、Kimi、豆包,你天天在用的这些"AI 对话产品",背后都是一个 LLM。这一篇讲清楚它是什么、有多大、以及"大"到底大在哪。

生活场景
📚 一个读完整个互联网的"学徒"

想象一个学徒,从小把人类整个互联网的文本都读了一遍——维基百科、小说、论坛、代码、论文、新闻。
读完之后,你问他任何一个问题,他都能"接得上话"——因为在过去的阅读里,他见过无数相似的问答模式。
这就是 LLM。它不是"知道答案",是"熟悉语言的下一个词该是什么"

三个字:大 · 语言 · 模型

大 · Large

规模巨大

参数从几十亿到几万亿;训练数据从数千亿到十几万亿 token;训练用的 GPU 从几百张到上万张。

语言 · Language

专攻文本

核心任务是"预测下一个词"——所以它是文本生成的天然选手。多模态(图/音/视频)是在此基础上扩展的。

模型 · Model

一个大函数

本质是"输入若干 token,输出下一个 token 的概率分布"的函数。所有的"神奇能力"都来自这个函数的复杂度。

规模一览(截至 2026)

档位参数量训练成本估算代表模型
< 10 亿几万美元Qwen-0.5B、Phi-3
7B–70B几十万美元Llama-7B/70B、Mistral
百亿到千亿数百万美元DeepSeek-V3、Claude 3.5
超大 (MoE)万亿级几千万美元GPT-4o、Gemini 1.5
Analogy · 大 = 深 × 广 × 通用

"大"不是营销词,它对应真实的三层扩展:
· ——网络层数变多(从几十层到上百层);
· 广——每层的参数变多(从上万到上亿);
· 通用——训练数据从单一领域扩展到"人类整个数字文明"。
三者一起放大,才有了今天让人震惊的表现。

LLM 是怎么"学会说话"的

训练一个 LLM 主要分三阶段(第 6 章"训练三部曲"会详讲):

1. 预训练 · Pre-training

喂海量文本(几万亿字),让它学会"预测下一个词"。这一步做完,它已经知道很多,但还不太会"聊天"。

2. 指令微调 · SFT

给它示范"人类问答对"——你问什么、应该怎么答。它开始像 ChatGPT 那样对话。

3. 对齐 · RLHF / DPO

用人类偏好反馈教它"哪种回答更有用、更礼貌、更安全"。这一步让它变得"讨人喜欢"。

为什么 LLM 会"看似聪明"

LLM 的三大"坑"

今天你能接触到的主流 LLM

阵营代表特色
OpenAIGPT-4o / o3 / o4综合能力最强,推理和多模态领先
AnthropicClaude 系列长文本、安全性、写作水平顶尖
GoogleGemini 1.5 / 2.0超长上下文(百万 token)、多模态强
MetaLlama开源旗手,可本地部署
DeepSeekV3 / R1高性价比、推理见长,开源
阿里Qwen · 通义千问开源生态强,中文表现好
字节豆包 / Doubao用户量最大,快速迭代
月之暗面Kimi超长文本擅长
Recap · 收束

大语言模型是过去 5 年 AI 最重要的一个词。往里看它是"深度学习 + Transformer + 海量语料 + 巨额算力"四件事的组合;往外看它是我们和 AI 对话的入口。从这一篇开始,后面的所有章节都会围绕它展开。

☰ 主页
Xue Hai Wu Ya · § 2.5 · LLM