§ 12.2 · Section

海外基础模型

OpenAI、Anthropic、Google、Meta · 以及官方文档自相矛盾时怎么办

这一节讲海外四家造基础大模型的公司。但它的写法和你在别处看到的「格局分析」都不一样:这里不排名、不评谁最强,只做一件事——把各家官方文档在 2026 年 8 月 8 日这一天写了什么,原封不动地摆给你看。为什么这么写?因为排名是记者的活儿,而核对官方原文是读者自己能学会的手艺。而且这一节会撞上一件极有教学价值的事:OpenAI 的三个官方页面,在「我们的旗舰模型是哪个」这个问题上给出了不一致的答案。这不是我们抓错了,双边原文都在下面。遇到这种情况该怎么处理,是本节比任何型号名都更值得你带走的东西。

生活场景
🍽️ 一家餐厅的三份菜单

你走进一家连锁餐厅,想知道他们家的招牌菜是什么。你手边有三个信息来源。

第一个:桌上摆的那本纸质菜单。翻开第一页写着「主厨推荐:红烧狮子头」。

第二个:门口那块电子屏。上面滚动播放「本店招牌:蟹粉豆腐」。

第三个:收银台旁边的价目表。你仔细找了两遍——上面压根没有「蟹粉豆腐」这一项,只有狮子头的价格。

你该信哪个?这时候有三种反应。最糟的反应是随便挑一个自己觉得靠谱的,回去告诉朋友「他家招牌是蟹粉豆腐」——你替所有人做了一个自己没资格做的判断。次糟的反应是认定这家店在骗人。正确的反应是:三份都记下来,注明各自出自哪里、哪天看到的,然后意识到一件更有用的事——这家店大概正在换菜单,纸质菜单和价目表还没跟上电子屏。

说白了,大公司的官方文档就是这三份菜单:不同团队维护、更新节奏不一样、改动传导有延迟。矛盾本身不是丑闻,而是一条信息——它告诉你「这里正在发生变化」。

先把「基础模型」这个词说清楚

基础模型(foundation model)这个词听着抽象,其实就是:一个用海量通用数据从零训出来的大模型,它不专门为某一件事服务,而是像一块料子,谁都能拿去裁成自己想要的衣服。

用面粉厂打比方最贴切。面粉厂不做包子、不做面条、不做蛋糕,它只做一件事——把麦子磨成面粉。但正因为它做的是「通用原料」,所以包子铺、面馆、蛋糕店全都得来找它买。造基础模型的公司就是这样的面粉厂:它自己不一定做出你天天用的那个产品,但你用的产品背后大概率有它的面粉。

这一层生意有三个特点,值得先记住,因为它们决定了这个行业为什么就那么几家:

下面开始逐家看,所有内容的查询日期统一为 2026 年 8 月 8 日,出处逐条列明。

OpenAI:三个官方页面,三种口径

这是本章第一处「官方内部不一致」,也是最干净的一处——因为双边原文都是同一天抓下来的,语法结构几乎一模一样,只有型号名不同。先看第一份。

出处一:platform.openai.com/docs/models,官方原文:

"If you're not sure where to start, use gpt-5.5, our flagship
model for complex reasoning and coding. If you're optimizing for
latency and cost, choose a smaller variant like gpt-5.4-mini or
gpt-5.4-nano."

翻译:「如果你不确定从哪开始,就用 gpt-5.5,我们面向复杂推理与编码的旗舰模型。如果你更在意延迟和成本,可以选 gpt-5.4-mini 或 gpt-5.4-nano 这类更小的变体。」

该页的 Frontier models(前沿模型)卡片列出:

模型输入价(每百万 token)输出价上下文最大输出知识截止
GPT-5.5$5$301M128K2025 年 12 月 1 日
GPT-5.4$2.50$151M2025 年 8 月 31 日
GPT-5.4 mini$0.75$4.50400K

现在看第二份。出处二:developers.openai.com/api/docs/models,同一天,官方原文:

"If you're not sure where to start, use GPT-5.6 Sol, our flagship
model for complex reasoning and coding. Choose GPT-5.6 Terra to
balance intelligence and cost, or GPT-5.6 Luna for cost-sensitive,
high-volume workloads."

翻译:「如果你不确定从哪开始,就用 GPT-5.6 Sol,我们面向复杂推理与编码的旗舰模型。想平衡智能与成本可选 GPT-5.6 Terra,对成本敏感、量大的场景可选 GPT-5.6 Luna。」

请把两段原文并排读一遍。句式完全相同,「our flagship model for complex reasoning and coding」这个短语一字不差,唯一的差别是主角从 gpt-5.5 换成了 GPT-5.6 Sol。这几乎可以肯定是同一份文案模板在两个域名下的不同版本。

developers 域的 Frontier models 列出:

模型模型 ID别名输入价输出价上下文最大输出知识截止
GPT-5.6 Solgpt-5.6-solgpt-5.6$5$301.05M128K2026 年 2 月 16 日
GPT-5.6 Terragpt-5.6-terra$2$121.05M
GPT-5.6 Lunagpt-5.6-luna$0.20$1.201.05M

还有第三份。出处三:openai.com/api/pricing/,官方定价页。它列的价格是:

模型输入缓存输入输出
GPT-5.5$5.00$0.50$30.00
GPT-5.4$2.50$0.25$15.00
GPT-5.4 mini$0.75$0.075$4.50

该页还有一条注释:「上述价格反映了 270K 以下上下文长度的标准处理费率」。这条注释本身就是个知识点——同一个模型,上下文超过某个长度之后可能换一档价格。后面讲 Google Gemini 时会看到更明显的例子。

而这份定价页当天最关键的一件事是:它完全没有列 GPT-5.6 系列的价格。

把这三份口径摆到一张表里

三个官方页面,三种说法,摊开看最清楚(全部截至 2026 年 8 月 8 日):

官方入口它说的 flagship 是列了 5.6 系列吗这个入口的性质
platform.openai.com/docs/modelsgpt-5.5否,Frontier 卡片里没有老的开发者平台文档
developers.openai.com/api/docs/modelsGPT-5.6 Sol是,且给了完整 ID 与价格新的开发者站文档
openai.com/api/pricing/未表述 flagship否,完全没有 5.6 的价格面向所有人的定价页

从这张表能读出一个相当可信的推断:OpenAI 正在把开发者文档从 platform 域迁到 developers 域,而 5.6 系列是在这次迁移期间发布的——新站已经更新,老站和定价页还没跟上。这就是本节开头「三份菜单」那个场景的真实版本。

但请注意「推断」和「事实」的界限:「两个域名口径不同」是事实,双边原文可查;「这是因为文档正在迁移」是推断,OpenAI 官方没有这么说过。写作时必须把这两类东西分开标注,否则读者会把你的猜测当成官方结论。

那实践中该怎么办?给你一套可操作的做法:

Analogy · 装修报价单上的三个数

官方文档自相矛盾这件事,如果你装修过就完全不陌生。

你找了一家装修公司。销售给你的宣传册上写「全包 1288 元一平米」。设计师发你的报价表里,同样的项目算出来是 1450。而你去他们门店看到的公示价目牌,上面某几项压根没列。三个都是这家公司的官方材料。

这时候一个有经验的人不会问「你们到底哪个是真的」,他会问「这三份材料各自是谁编的、什么时候编的」。宣传册是市场部半年前印的;报价表是设计师昨天按你家实际面积算的;价目牌是前台三个月没换过。搞清了这个,三份材料的矛盾就从「疑点」变成了「线索」。

OpenAI 那三个页面完全同理:platform 域是老平台文档,developers 域是新站文档,定价页是面向公众的商务页面——三者由不同团队按不同节奏维护。本质上就是:任何足够大的组织,它的对外说法都不可能瞬时同步。

所以这一节真正想教你的手艺是:看一份资料时,先问它是谁写的、什么时候写的、写给谁看的。这三个问题回答清楚了,矛盾自己就解开了;回答不清楚,你手上再权威的资料也只是一句话。

Anthropic:官方是怎么措辞的,值得逐字看

Anthropic 是 Claude 系列模型的公司。它官方模型总览页(docs.claude.com/en/docs/about-claude/models/overview,截至 2026 年 8 月 8 日)的表述,是一个措辞极其克制的范本。原文:

"If you're unsure which model to use, consider starting with
Claude Opus 4.7 for the most complex tasks. It is our most capable
generally available model, with a step-change improvement in
agentic coding over Claude Opus 4.6."

翻译:「如果不确定用哪个模型,最复杂的任务可以考虑从 Claude Opus 4.7 开始。它是我们可普遍获取的能力最强的模型,在智能体编码方面相比 Claude Opus 4.6 有阶跃式提升。」

请特别注意「generally available」(可普遍获取的)这个限定词。它不是废话,而是一个有法律和商务分量的措辞。它的意思是:我们可能还有更强的东西,但那些还没开放给所有人,所以不在这句话的比较范围里。

这个限定词不是空穴来风,同一页里就有对应的证据:

"Claude Mythos Preview is offered separately as a research preview
model for defensive cybersecurity workflows as part of Project
Glasswing. Access is invitation-only and there is no self-serve
sign-up."

翻译:「Claude Mythos Preview 作为 Project Glasswing 的一部分,以研究预览模型的形式单独提供,面向防御性网络安全工作流。仅限受邀访问,没有自助注册入口。」

所以「可普遍获取的最强」和「最强」是两句不同的话。打个比方:餐厅菜单上写「本店最贵的菜是佛跳墙 888 元」,这句话完全为真——但后厨可能有一道只给熟客做、菜单上压根不写的菜。「菜单上最贵」不等于「店里最贵」。这种措辞方式在这个行业里非常普遍,学会识别它,你就不会被「最强」这两个字牵着走。

官方模型表(截至 2026 年 8 月 8 日):

模型API 调用 ID价格(每百万 token,输入 / 输出)上下文最大输出
Claude Opus 4.7claude-opus-4-7$5 / $251M128k
Claude Sonnet 4.6claude-sonnet-4-6$3 / $151M64k
Claude Haiku 4.5claude-haiku-4-5-20251001$1 / $5200k64k

这张表有三个细节值得说:

第一,命名分三档,而且是拉丁语诗歌体裁的名字。Opus(长篇作品)、Sonnet(十四行诗)、Haiku(俳句)——从长到短,正好对应从大到小、从贵到便宜。相当于咖啡店的大杯、中杯、小杯,只是名字起得文雅些。这套命名逻辑一旦记住,你看到一个新型号名就能立刻猜出它在哪一档。

第二,Haiku 的 ID 带日期后缀,另外两个不带。claude-haiku-4-5-20251001 里的 20251001 就是 2025 年 10 月 1 日。说白了这是版本快照——指名要这一天发布的这个版本,以后官方更新了也不影响你相当于你在照相馆洗照片时说「就按上次那个底片洗,别调色」。生产环境往往需要这种确定性。

第三,价格和上下文不是线性关系。Opus 4.7 比 Sonnet 4.6 贵不到一倍($5 vs $3),但上下文一样是 1M;而 Haiku 便宜到 $1,上下文却掉到 200k。所以选模型不是「预算多就买贵的」,得看你的活儿到底卡在哪一项上。

Google Gemini:一张表教你看懂「Stable」和「Preview」

Google 的官方模型列表页(ai.google.dev/gemini-api/docs/models)有一个很值得学习的做法:它明确把模型分成 Stable(稳定)和 Preview(预览)两栏。该页面自带的更新标记是 Last updated 2026-08-05 UTC,我们的查询日期是 2026 年 8 月 8 日。

先把这两个词翻译清楚,因为它们决定了你敢不敢把它用在正经项目里:

官方当天的分栏情况(截至 2026 年 8 月 8 日):

状态官方列出的模型
StableGemini 3.6 Flash、Gemini 3.5 Flash、Gemini 3.5 Flash-Lite、Gemini 3.1 Flash-Lite、Nano Banana 2、Nano Banana 2 Lite、Nano Banana Pro
PreviewGemini 3.1 Pro、Gemini 3 Flash、Gemini 3.5 Live Translate、Gemini 3.1 Flash Live、Gemini 3.1 Flash TTS、Omni Flash
已关停Gemini 3 Pro Preview —— 官方页面上直接标着 (Shut down)

这张表里有两件事特别值得注意。

第一件:Pro 系列当天全在 Preview 栏,Flash 系列才在 Stable 栏。这跟很多人的直觉相反——大家会以为「Pro 是高端货,肯定更稳」。实际上恰恰相反:能力最强的那些往往刚发布不久,还在预览期;而稳定可用的是已经跑了一段时间的中量级型号。打个比方:菜市场里最新到货的稀罕食材摊在最显眼的位置,但真正天天有货、你随时能买到的是常规菜。

第二件:Gemini 3 Pro Preview 页面上明明白白标着「(Shut down)」(已关停)。这是一个极其有用的信号,它说明 Preview 状态的东西真的会被关掉,不是理论风险。如果你半年前把它接进了产品,现在就得改代码了。

官方对两个主力型号的描述原文,措辞差别也很讲究:

模型官方原文描述翻译与解读
Gemini 3.6 Flash「Our latest model that balances speed with intelligence to deliver strong performance in agentic and multimodal tasks.」我们最新的模型,平衡速度与智能,在智能体与多模态任务上表现强劲。关键词是 latest(最新)和 balances(平衡)——它没说自己最强
Gemini 3.5 Flash「Most intelligent model for sustained frontier performance on agentic and coding tasks.」在智能体与编码任务上持续保持前沿表现的最智能模型。注意这个「Most intelligent」给的是 3.5 而不是 3.6

这一处细节非常值得琢磨:版本号更高的 3.6 被描述为「最新且平衡」,版本号更低的 3.5 才被描述为「最智能」。换成大白话——3.6 不是 3.5 的全面升级版,而是一条不同取向的产品线。所以「版本号大就一定更强」这个直觉,在这里直接失效了。相当于手机的 Pro 和 Plus——数字大的那个不一定各项都更好,可能只是屏幕大了、电池大了,芯片反而一样。

官方定价(Paid Tier 付费档,每百万 token,Standard 标准处理,截至 2026 年 8 月 8 日):

模型输入输出备注
Gemini 3.6 Flash$1.50$7.50输出是输入的 5 倍价
Gemini 3.5 Flash$1.50$9.00输入同价,输出比 3.6 更贵
Gemini 3.5 Flash-Lite$0.30$2.50Lite 档,便宜五倍
Gemini 3.1 Flash-Lite$0.25(文本/图像/视频)
$0.50(音频)
$1.50音频输入是文本的两倍价——不同模态不同价
Gemini 3.1 Pro Preview$2.00(≤200k 上下文)
$4.00(>200k 上下文)
$12.00(≤200k)
$18.00(>200k)
阶梯定价:上下文一过 20 万 token,输入输出双双涨价

这张定价表里藏着三个非常实用的规律:

规律一:输出永远比输入贵,而且贵好几倍。为什么?因为输入是一次性读进去的(可以并行、可以批量),输出是一个字一个字生成的(必须串行)。相当于快递公司收你的件是一车拉走,派件却要挨家挨户按门铃。这条规律有个直接的实用推论:让模型「少说话、说重点」是真的能省钱的,省的还是最贵的那部分。

规律二:不同模态不同价。Gemini 3.1 Flash-Lite 的音频输入是文本的两倍价($0.50 vs $0.25)。说白了:处理声音比处理文字费劲,所以收得更贵。做语音类产品要特别注意这一行。

规律三:上下文越长,单价越高。Gemini 3.1 Pro Preview 在 20 万 token 这个门槛上翻倍。前面 OpenAI 定价页那条「270K 以下上下文长度的标准处理费率」是同一个意思。用停车场打比方:前两小时五块钱一小时,超过两小时后每小时十块。所以「把所有资料一股脑塞进上下文」这个做法,除了 §11.4 讲过的效果问题,还有一笔账要算。

诚实声明 · 上下文窗口数字未取得

你可能注意到上面 Google 的表里没有给上下文窗口大小,而 OpenAI 和 Anthropic 的表里都给了。这不是遗漏。

Google 官方模型列表页当天没有在同一张表里列出各型号的上下文窗口,而我们没有逐个型号点进详情页取证。所以本节不给任何 Gemini 型号的上下文窗口数字

网上流传着「Gemini 某型号支持 200 万 token 上下文」这类说法,本节不采用——不是说它一定错,而是我们没有从官方页面核实到。如果你需要这个数字,请自己去 ai.google.dev/gemini-api/docs/models 点开具体型号的卡片查看。

Meta Llama:走了完全不同的一条路

前面三家的模式是一样的:模型放在自己的服务器上,你通过 API 调用,按 token 付费。Meta 走的是第四条路:把模型权重直接下载给你,让你自己跑。

这个差别有多大?用面粉厂的比方来说:前三家是「你把订单发过来,我磨好面粉给你发货,按斤收钱」;Meta 是「磨粉机的图纸和调好的参数我都给你,你自己回家磨」。

这条路的吸引力显而易见——不用付按次的钱、数据不出自己的门、想怎么改就怎么改。但它有一个大多数人不会去读的前提条件:许可协议。这一小节就把这份协议里最要紧的几条摊开来看。

先说清版本:截至 2026 年 8 月 8 日,llama.com/llama4/license/ 上现行公开的许可是 Llama 4 Community License AgreementVersion Effective Date: April 5, 2025(生效日 2025 年 4 月 5 日)。

诚实声明 · 不宣称 Llama 4 是「最新版本」

我们尝试核实是否存在比 Llama 4 更新的版本,但 llama-downloads 页面是由 JavaScript 动态渲染的,静态抓取拿不到正文内容。所以本节不宣称「Llama 4 是最新版本」,只说它是 llama.com 上现行公开的那份许可所对应的版本。

这个区别不是咬文嚼字。「我查到的是这个」和「这就是最新的」,中间隔着一整轮穷尽检索。前者我做到了,后者我没做到,所以只写前者。

现在看协议里最关键的那一条。Section 2 Additional Commercial Terms(附加商业条款)原文:

"If, on the Llama 4 version release date, the monthly active users
of the products or services made available by or for Licensee, or
Licensee's affiliates, is greater than 700 million monthly active
users in the preceding calendar month, you must request a license
from Meta, which Meta may grant to you in its sole discretion, and
you are not authorized to exercise any of the rights under this
Agreement unless or until Meta otherwise expressly grants you such
rights."

翻译:「如果在 Llama 4 版本发布日,你(或你的关联方)提供的产品或服务,在前一个日历月的月活跃用户数超过 7 亿,你必须向 Meta 申请一份许可;Meta 可自行酌情决定是否给你。在 Meta 明确授予之前,你无权行使本协议下的任何权利。」

这一条要拆成四层来理解,每一层都有实际后果:

条款要素原文关键词大白话
门槛greater than 700 million monthly active users月活超过 7 亿。这个数字换算成能感知的量:大约是全球人口的十二分之一,全世界能跨过这条线的公司数得出来
时间点on the Llama 4 version release date版本发布那一天的规模算。说白了:发布时你还小,后来长大了,也不受这一条约束
算法范围by or for Licensee, or Licensee's affiliates包括关联方。子公司、母公司的用户数可能要合并计算,不是只算你自己这个 App
决定权Meta may grant in its sole discretionMeta 完全自主决定给不给,没有任何客观标准,也不承诺一定给。这是本条最重的四个字

这条款是针对谁写的,其实不难猜。全球月活超过 7 亿的公司只有几家,而它们恰好是 Meta 最直接的竞争者。说白了就是:这份许可对所有人开放,唯独把最大的几个同行挡在门外。

用小区的比方讲这件事最直观:小区门口贴了张告示——「本小区花园免费向公众开放,欢迎大家来玩。但如果你是隔壁三家大房产商的员工,得先来物业申请,批不批我们说了算。」告示确实写着「免费开放」,但它显然不是对所有人一样开放。

除了这条门槛,协议还有两项持续性义务。Section 1.b.i 原文:

"you shall (A) provide a copy of this Agreement with any such Llama
Materials; and (B) prominently display 'Built with Llama' on a
related website, user interface, blogpost, about page, or product
documentation. If you use the Llama Materials or any outputs or
results of the Llama Materials to create, train, fine tune, or
otherwise improve an AI model, which is distributed or made
available, you shall also include 'Llama' at the beginning of any
such AI model name."

翻译成三条能执行的要求:

还有一条归属声明的固定格式:「Llama 4 is licensed under the Llama 4 Community License, Copyright © Meta Platforms, Inc. All Rights Reserved.」

所以整份协议的性质是什么?官方给它的名字是 Community License(社区许可),这是 Meta 自定义的一份协议,不是 Apache 2.0、不是 MIT,也不是任何 OSI 认可的开源许可。它包含月活门槛、命名义务、署名义务,并适用加州法律。

「这算不算开源」这个问题,我们留到 §12.4 用 OSI 的正式定义来回答——那一节会告诉你,连「只发布权重」这件事本身,按 OSI 的标准都不构成开源,跟许可条款宽不宽松还是两回事。

四家横向对照:不比强弱,只比路数

把四家放在一起,最有价值的对比维度不是「谁分高」,而是「你要用它,得付出什么、承担什么」。下面这张表就按这个思路排(全部截至 2026 年 8 月 8 日):

OpenAIAnthropicGoogleMeta
怎么给你用云端 API云端 API云端 API下载权重自己跑
官方首推的那个两种口径:platform 说 gpt-5.5,developers 说 GPT-5.6 SolClaude Opus 4.7(限定为「可普遍获取的最强」)未用「flagship」措辞,分 Stable / Preview 两栏许可页对应 Llama 4
命名规律数字版本 + 代号(Sol/Terra/Luna)诗歌体裁分档(Opus/Sonnet/Haiku)数字版本 + 档位(Pro/Flash/Flash-Lite)版本号 + 参数规模
最贵档输入价$5(5.5 与 5.6 Sol 同价)$5(Opus 4.7)$2.00 / $4.00 阶梯(3.1 Pro Preview)不按 token 收,改为你自付算力
最便宜档输入价$0.20(5.6 Luna)$1(Haiku 4.5)$0.25(3.1 Flash-Lite 文本)同上
成本长什么样用多少付多少,可变成本同左同左买卡或租机器,固定成本 + 运维人力
你要承担的风险厂商改型号、涨价、下线同左Preview 会被 (Shut down),官方已有实例许可合规风险:7 亿月活门槛、署名与命名义务
数据去哪发到厂商服务器同左同左可以完全不出你的机房

这张表读下来,你会发现前三家和 Meta 根本不在一个赛道上比赛——前三家在比「谁的面粉又好又便宜」,Meta 在比「谁的磨粉机图纸更容易上手」。

用外卖和买菜的比方来收这一段:点外卖(云端 API)的好处是你不用管厨房,坏处是每顿都要付钱、菜单由店家定、店家关门你就没饭吃。自己买菜做饭(本地部署)的好处是想吃什么吃什么、成本可控、饭菜不出自己家门,坏处是你得自己有厨房、有厨具、有时间,还得看得懂那本厚厚的「使用须知」(也就是许可协议)。

本质上就是:这不是一个「哪个更好」的问题,是一个「你的约束条件是什么」的问题。有些行业(医疗、金融、政务)数据不能出境不能外传,那再便宜的 API 也用不了;有些小团队一共三个人,那再自由的权重也养不起运维。

模型命名这件事,为什么全行业都这么乱

看完上面四家,你大概已经被型号名搞晕了:GPT-5.5、GPT-5.6 Sol/Terra/Luna、Claude Opus/Sonnet/Haiku 4.5-4.7、Gemini 3.1/3.5/3.6 Pro/Flash/Flash-Lite、Nano Banana 2 Pro……这不是你的问题,这是整个行业的问题。但乱中有序,把规律说清楚能省你很多困惑。

规律一:几乎每家都有「大中小」三档。这是最稳定的一条规律,因为它对应的是真实的成本结构。

档位OpenAI 的叫法Anthropic 的叫法Google 的叫法咖啡店类比
大 · 最强最贵旗舰主型号(如 5.6 Sol)OpusPro大杯特调
中 · 平衡Terra / 无后缀次级SonnetFlash中杯常规
小 · 便宜量大mini / nano / LunaHaikuFlash-Lite小杯美式

记住这三档,你看到任何新型号名都能立刻定位它在哪一层。比如你看到「Luna」这个名字不知道是什么,但看到它输入价 $0.20(同门 Sol 是 $5,差 25 倍),就知道它是最小最便宜那一档。说白了:价格是最诚实的档位标签。

规律二:小数点后的版本号不一定代表全面更强。前面 Gemini 3.6 与 3.5 那个例子已经证明了这一点:官方把「Most intelligent」给了 3.5,把「latest」给了 3.6。所以看到版本号更高就以为全面更好,是这一节最该纠正的直觉。

规律三:带日期后缀的 ID 是「快照」,不带的是「会变的」。Anthropic 的 claude-haiku-4-5-20251001 就是快照写法。相当于你在银行办事拿到的号码——指定就是这一号,别人再插队也不影响。生产环境优先用快照 ID,做实验用别名(如 gpt-5.6)更方便。

规律四:代号越花,越可能是新一代产品线的重命名。Sol、Terra、Luna 是拉丁语的「日、地、月」;Nano Banana 这种名字更是完全跳出数字体系。为什么厂商爱这么干?因为纯数字版本号有个尴尬:版本号只能往上走,一旦走到 GPT-6、7、8,读者会自动期待「每一代都是巨大飞跃」,而实际迭代往往是渐进的。换成大白话:换个代号,就把「必须比上一代强多少」这个隐含承诺给绕开了。

规律五:这些名字半年后大概率就不对了。所以本节的所有型号名都绑着「截至 2026 年 8 月 8 日」这个日期。正确的用法是:把本节当成一份「看官方文档的方法说明」,而不是一份「型号对照表」。型号表你自己去官网查,方法是能带走的。

怎么读一份模型文档:一套可复用的六步法

这一节到这里已经翻过了四家官方文档。把这个过程抽象出来,是一套你以后查任何模型都能用的顺序。它的核心思路和 §12.1 看规格表的清单一样:先确定这份资料的身份,再读它的内容。

这套六步法的价值在于它把「读文档」从一件感觉活变成了一件流程活。就像挂号看病有固定流程——先分诊、再挂号、再候诊、再就诊,你不会跳着来。读技术文档同理,顺序错了会让你在一堆宣传形容词里绕半天,却漏掉真正决定成败的那两行小字。

常见误解澄清

误解一:「排行榜上分最高的就是最好的,选它就对了。」

这句话有两个问题。第一,本节没有取到任何官方或权威第三方的 2026 年横向评测数据,所以本书不给排名,任何自称「2026 最强模型排行」的内容你都该先问它的数据来自哪里。第二,即便有可信榜单,榜单测的任务和你的任务大概率不是一回事。相当于考试排名选家教——数学第一名的老师不一定适合辅导你孩子的作文。

误解二:「贵的模型一定比便宜的强,所以有预算就一直用最贵的。」

价格反映的是厂商的成本与定位,不是你任务上的效果。而且这笔账很容易算错:Gemini 3.1 Flash-Lite 的输入价 $0.25,Claude Opus 4.7 是 $5,差 20 倍。如果你的活儿是「把一万条用户评论分成好评差评」,用最贵的那个纯属烧钱。说白了:杀鸡不用牛刀,而且这里的牛刀是按次收费的。

误解三:「Meta 的模型免费,所以自己部署一定更便宜。」

权重免费,算力不免费,人力更不免费。你要自备 §12.1 讲过的那些显存和带宽,还要有人维护。用买菜做饭打比方:菜是比外卖便宜,但你得算上厨房的租金、水电、你自己的时间。对小规模用量来说,自己部署往往比调 API 更贵;只有量大到某个规模,账才翻过来。另外别忘了那份许可里的合规义务——Built with Llama 的标注、派生模型的命名,这些也是成本。

误解四:「官方文档写的一定是对的,照抄就行。」

这一节整个前半部分就是这条误解的反例。官方文档是可靠性最高的一类资料,但不等于绝对正确且内部一致正确的态度是:官方文档是最好的起点,但要看它的身份、日期,并且尽量交叉验证两个官方入口。

误解五:「模型能力靠版本号判断,5.6 一定比 5.5 全面强。」

Gemini 3.6 与 3.5 的官方描述已经反驳了这一点。而 OpenAI 那边更微妙:GPT-5.5 和 GPT-5.6 Sol 的价格完全一样($5 / $30),上下文只从 1M 涨到 1.05M——如果 5.6 Sol 是一次全面代际跃升,很难解释为什么价格一分没变。注意这句是推断不是结论,官方没有说明原因,我们只是把可核实的两组数字并排放在这里。

Recap · 这一节收束

一、本节最重要的收获是方法,不是型号名。型号名半年就过期,「先确认资料的身份、日期、写给谁看的」这套方法不会过期。所有内容的查询日期统一为截至 2026 年 8 月 8 日

二、官方文档会自相矛盾,这是事实而非丑闻。同一天:platform 域说 flagship 是 gpt-5.5,developers 域说是 GPT-5.6 Sol,定价页完全没列 5.6 的价格。处理办法是三处原文并列、标明出处,不替读者挑一个。实践中的取舍则分三种:写文章两边都写、写代码以能调通的 ID 为准、做预算以定价页为准。

三、限定词是官方措辞里最重的部分。Anthropic 说 Opus 4.7 是「our most capable generally available model」(可普遍获取的最强),而同页就列着受邀预览的 Claude Mythos Preview——「菜单上最贵」不等于「店里最贵」。Google 把「Most intelligent」给了 3.5、「latest」给了 3.6,版本号高不等于全面更强。

四、Stable 与 Preview 的区别,比型号强弱重要。Google 官方页面上 Gemini 3 Pro Preview 已标 (Shut down)——Preview 真的会被关掉。而当天 Pro 系列全在 Preview 栏、Flash 系列才在 Stable 栏,与「Pro 更稳」的直觉相反。

五、定价表里有三条通用规律。输出比输入贵好几倍(生成必须一个字一个字来);不同模态不同价(Gemini 3.1 Flash-Lite 音频输入是文本的两倍);上下文越长单价越高(Gemini 3.1 Pro Preview 在 200k 门槛上翻倍,OpenAI 也有 270K 的费率说明)。

六、Meta 走的是另一条路,代价写在许可里。Llama 4 Community License(生效日 2025 年 4 月 5 日)含三项硬义务:发版日月活超 7 亿须另行申请且 Meta「可自行酌情决定」、产品页须显著标注「Built with Llama」、派生模型名开头须带「Llama」。这是 Meta 自定义的社区许可,不是任何 OSI 认可的开源许可。

七、本节的留白清单(诚实交代):是否存在比 Llama 4 更新的版本未取得(下载页 JS 渲染,故本节不宣称 Llama 4 是「最新版本」);Gemini 各型号的上下文窗口数字未取得(官方列表页未在同表给出,未逐页取证,故一律不给);2026 年任何横向评测与排名数据未取得,故本节不做任何强弱排序。

☰ 主页
学海无涯 · 智能篇 · § 12.2