§ 12.3 · Section

中国阵营

DeepSeek、Qwen、豆包、Kimi、GLM · 以及为什么本节不给排名

这一节讲中国这边造基础模型的五支队伍。写法延续上一节:不排名、不评优劣,只把各家官方文档在 2026 年 8 月 8 日这一天写了什么摆出来,并且逐条标注可靠度。但这一节比上一节多了一个必须认真对待的问题:关于中国 AI,网上流传的「市场份额」「用户量第一」「国产最强」这类说法特别多,而它们几乎全都找不到官方出处。所以本节会用整整一小节的篇幅,讲清楚为什么这些数字一个都不给,以及一个「厂商自述」和「第三方评测」被混在一起时该怎么拆开。这一节还有一个很实用的收获:中国这几家的 API 价格便宜到什么程度,看完那张对照表你会有直观感受。

生活场景
🏪 五家新开的面馆,各有各的活法

你家附近的美食街上,半年内开了五家面馆。它们卖的东西差不多,但活法完全不同。

第一家:主打「便宜到不可思议」。同样一碗牛肉面,别家二十八,它卖六块。老板不解释怎么做到的,就是敢这么卖。这一家是 DeepSeek。

第二家:把配方公开挂在墙上,还印成小册子免费发。你可以拿回家自己照着做,它不介意。这一家是阿里的 Qwen。

第三家:开在一个巨大商场的美食广场里。它自己一家店,但整个美食广场的其他摊位也归同一个物业管,你在这里能顺手点到别家的菜。这一家是字节的豆包(火山方舟平台)。

第四家:专门做「特别能记住老客口味」的活儿。你上次说不要香菜、汤要少,它这次全记得,而且还能看照片认菜。这一家是月之暗面的 Kimi。

第五家:门口挂了个牌子写「本店水准可与米其林某某餐厅比肩」。注意——这块牌子是老板自己挂的,不是米其林评的。这一家是智谱的 GLM,而这块牌子会成为本节一个重要的教学点。

DeepSeek:价格表本身就是最大的信息

DeepSeek 官方定价页(api-docs.deepseek.com/quick_start/pricing,截至 2026 年 8 月 8 日)列出两个当前型号:

项目deepseek-v4-flashdeepseek-v4-pro
官方版本名DeepSeek-V4-FlashDeepSeek-V4-Pro
上下文1M1M
最大输出384K384K
输入价(缓存命中)$0.0028 / 百万 token$0.003625
输入价(缓存未命中)$0.14$0.435
输出价$0.28$0.87
并发上限2500500

先把这张表最惊人的一行拎出来说。缓存命中时的输入价是 $0.0028 每百万 token。而 §12.2 里 GPT-5.5 和 Claude Opus 4.7 的输入价都是 $5 每百万 token——差了大约一千八百倍。

这个数字太抽象,换算成能感知的量:$0.0028 是不到两分钱人民币。一百万 token 大概相当于几十万汉字,也就是几本长篇小说的量。说白了:让它读几本小说,收你两分钱。

但这里必须把「缓存命中」这个前提讲清楚,否则这个数字是误导性的。

什么是缓存命中?说白了就是:你这次发过去的开头部分,跟上次发的一模一样,服务器还留着上次算好的结果,就直接拿来用,不重算。

用餐厅打比方:你是熟客,每次来都点「一碗牛肉面,面硬一点,不要香菜,汤少放」。前十个字每次都一样。熟练的服务员听到「一碗牛肉」就已经在往后厨喊了,剩下的话他都不用听完。省下的就是这部分重复劳动的钱。

所以这两档价格的实际含义是:

Flash 与 Pro 的差别也值得琢磨。Pro 的输出价($0.87)是 Flash($0.28)的三倍多,但并发上限(500)只有 Flash(2500)的五分之一。换成大白话:Pro 是「慢工出细活的老师傅,一次只接少量单」,Flash 是「手脚快的伙计,能同时招呼一屋子人」。选哪个不取决于预算,取决于你是要「质量」还是要「吞吐」。

一条官方脚注,教你「模型下线」是怎么发生的

DeepSeek 定价页上有一条脚注,信息密度极高:

"The model names `deepseek-chat` and `deepseek-reasoner` will be
deprecated on 2026/07/24 15:59 UTC. For compatibility, they
correspond to the non-thinking mode and thinking mode of
`deepseek-v4-flash`, respectively."

翻译:「模型名 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC 弃用。为兼容起见,它们分别对应 deepseek-v4-flash 的非思考模式与思考模式。」

这条脚注有四个层面的信息,值得逐层拆:

第四点值得多说一句,因为它教的是「读日期」这个习惯。如果你不看日期,很可能以为「哦,那我现在还能用 deepseek-chat,只是以后不行」——实际上已经不行了。打个比方:你在小区电梯里看到一张通知「本周六停水检修」,但你没看那张纸是哪天贴的,结果那是三个月前贴的。通知的内容和通知的日期,必须一起读。

另外这一页还给了两个接口地址,一个细节很有意思:

Base URL兼容格式这意味着什么
https://api.deepseek.comOpenAI 格式你原本调 OpenAI 的代码,改一行地址就能用
https://api.deepseek.com/anthropicAnthropic 格式你原本调 Claude 的代码,同样改一行地址就能用

这个设计说明了一件事:兼容别人的接口格式,是后来者最有效的一招。用装修的比方讲:你新出一款开关面板,最聪明的做法不是设计一个全新的漂亮尺寸,而是让它的螺丝孔位和市面上最通用的那款完全一样——这样师傅换的时候不用重新打孔,五分钟搞定。本质上就是:降低别人换到你这里的成本,比夸自己好用有效得多。

Analogy · 门口那块自己挂的牌子

本节最重要的一个方法论,用一家面馆门口的牌子就能讲透。

假设你路过两家店,都挂着牌子。第一家挂的是一块印着某权威美食评级机构标志的铜牌,上面有编号和年份。第二家挂的是一块自己做的木牌,上面写着「本店水准可与城中一流名店比肩」。

这两块牌子的字面意思可能差不多,但它们的性质完全不同。第一块是别人评的,评的过程有标准、有记录、可追溯;第二块是自己写的,写什么完全由老板决定。说白了:前者是证书,后者是广告。

两块牌子都不是「假的」。第二家店的面可能真的很好吃,老板那句话也可能是真心话。但你在向朋友转述时,如果说成「那家店被评为可与名店比肩」,你就把一块木牌升级成了一块铜牌——这是转述过程中最常见、也最容易被原谅、但确实错了的一种失真。

本节后面讲智谱 GLM 时会遇到一句完全属于「木牌」性质的官方表述。处理办法很简单,也是本章从头到尾在用的那一招:照抄原文,然后在旁边明确写上「这是厂商自述,不是第三方评测」。不删除、不美化、也不假装它是证书。

为什么不干脆不写?因为厂商自己怎么定位自己,本身就是有价值的信息——它告诉你这家公司想被看成什么。把它标好性质放进来,比把它删掉更有信息量。

阿里 Qwen:把尺码表整个公开

阿里的 Qwen(通义千问)系列,最大的特点是把不同规模的模型全都公开发布。官方文档站(qwen.readthedocs.io)关于 Qwen3 的原文:

"Dense and Mixture-of-Experts (MoE) models, available in 0.6B,
1.7B, 4B, 8B, 14B, 32B and 30B-A3B, 235B-A22B."

这句话里有三个术语要当场翻译:

这份尺码表为什么重要?因为它直接决定了「你的机器能不能跑」。回忆 §12.1 那个显存的账:

规模16 位下只放参数约需大概什么设备能跑生活类比
0.6B约 1.2 GB普通手机、树莓派一本随身小册子
4B约 8 GB带独显的笔记本一本厚字典
14B约 28 GB较高端的单张消费级显卡(配合量化)一整套百科全书
32B约 64 GB专业卡或多卡一面墙的书架
235B-A22B约 470 GB(按总参数算)必须多卡集群一整间图书馆

注意这张表是按定义做的量级估算,不是任何厂商的官方数字。实际占用还受量化档位、上下文长度、推理框架影响,可能差不少。放这张表的目的不是让你照着买硬件,是让你对「B」这个数字有实感——看到 235B 时能立刻反应「这个我家里跑不了」。

官方对 Qwen3-2507 系列的描述:「Qwen3-Instruct-2507」「Qwen3-Thinking-2507」,官方称「Enhanced capabilities in 256K long-context understanding, extensible to 1M.」——增强了 256K 长上下文理解能力,可扩展到 1M。

「extensible to 1M」(可扩展到 1M)这个措辞要留个心。「可扩展到」和「支持」不是一回事。相当于家里的水管——「可以接到六分管」意味着你得自己去改,不是开箱就是六分的。这类措辞通常暗示需要额外配置或特定技术手段。

诚实声明 · 两处留白

第一,页面更新日期未知。Qwen 官方文档站的这一页没有标注更新日期。按 §12.2 那套六步法的第一条,这会让可靠度降一档——所以本小节的可靠度评为(页面是官方的,但新鲜度无法确认)。

第二,Qwen 的开源许可原文未取得。我们尝试抓取 Hugging Face 上的模型页面失败。所以本节不宣称「Qwen3 是 Apache 2.0 许可」——这个说法在网上很常见,可能是对的,但我们没有从官方渠道核实到,就不写。

这一条尤其要克制,因为许可证类型是会直接影响你能不能商用的法律事实说白了:搞错一个型号名最多是尴尬,搞错一个许可证可能是官司。如果你要商用,请自己去模型卡页面读 LICENSE 文件原文。

字节豆包:一家自己开的美食广场

字节跳动的模型叫豆包(Doubao),但它对外的入口是一个叫火山方舟的平台。这个结构本身就值得说一句:平台上不只有自家的豆包,还挂着别家的模型。

官方模型列表页(volcengine.com/docs/82379/1330310)标注的更新时间是 2025.12.10,我们的查询日期是 2026 年 8 月 8 日——也就是说这份清单可能已经滞后了大半年,这一点务必记住。

清单上的自家系列(截至该页 2025.12.10 的状态):

模型版本号上下文最大输入最大回答特点
doubao-seed-1.6250615 / 251015256k224k32k主力通用型,另标最大思维链 32k
doubao-seed-1.6-vision250815256k224k32k带视觉,能看图
doubao-seed-1.6-flash250828256k224k32k快速档
doubao-seed-1.6-thinking250715256k224k32k思考档

这张表有一个细节特别值得学:上下文 256k,但最大输入只有 224k。为什么不一样?因为上下文窗口是「输入 + 输出」的总额度,得给回答留位置。256k 减去 32k 的最大回答,正好等于 224k。

用停车场打比方:整个停车场有 256 个位(上下文),但门口划了 32 个位专门留给待出场的车(输出),所以能进来停的最多 224 个(输入)。说白了:你不能把上下文填满输入,否则模型就没地方说话了。这个账很多人第一次算的时候都会算错。

而这个平台真正有意思的地方,是它同时挂着别家的模型。同一份官方清单里还有:

模型来自上下文其他
deepseek-v3.1(terminus / 250821)DeepSeek128k最大输入 96k
kimi-k2-thinking-251104月之暗面256k最大回答 32k

这就是「自己开美食广场」的意思:字节既卖自家的面,也把隔壁两家的招牌菜摆进自己的档口。为什么要这么干?因为对客户来说,「一个账号能调所有模型」比「哪家模型最强」更省事。相当于超市不会只卖自有品牌的酱油,它把所有牌子都摆上货架——你在我这里买了什么牌子不重要,重要的是你在我这里买。

清单上还有图像与向量两类,也一并列出(同为该页 2025.12.10 状态):

类别官方列出的模型官方标记
图像生成doubao-seedream-4.5(251128)官方标「强烈推荐
doubao-seedream-4.0(250828)官方标「推荐」
doubao-seedream-3.0-t2it2i = text to image,文生图
doubao-seededit-3.0-i2ii2i = image to image,图改图
向量(Embedding)doubao-embedding-large、doubao-embedding、doubao-embedding-vision把文字或图片变成一串数字,§9.2 讲过

「强烈推荐」和「推荐」这两个标记也是官方自述,性质上属于前面那块「木牌」——它告诉你官方希望你用哪个,不构成任何客观优劣评价。

诚实声明 · 豆包价格未取得

你可能注意到豆包这一小节完全没有价格,而 DeepSeek 那一节价格列得很细。原因是:火山方舟这个官方页面的价格数据在 HTML 里没有渲染出来(应该是由 JavaScript 动态加载的),静态抓取拿不到。

所以本节不给豆包任何每百万 token 的价格数字。要查价格请自己去火山方舟控制台看,那里的价格才是会开发票的那一版。

另外再强调一次这一小节的可靠度:。页面是官方的(可靠度加分),但它自标的更新时间是 2025.12.10,距我们查询日已过大半年(可靠度减分)。说白了:这份清单可以用来了解产品线结构,不适合用来确认「现在有哪些型号」。

月之暗面 Kimi:一个官方自承文档过期的例子

月之暗面的 Kimi 官方定价页(platform.moonshot.ai/docs/pricing/chat)把模型分成三组:

官方给出的具体定价(截至 2026 年 8 月 8 日):

模型单位输入(缓存命中)输入(缓存未命中)输出上下文
kimi-k2.5每百万 token$0.10$0.60$3.00262,144

这里有个小细节值得指出:上下文写的是 262,144,不是「256k」。262144 = 256 × 1024,也就是精确的 256K。官方用精确数字而不是约数,说明这是一个硬性的技术上限,不是市场宣传的圆整说法。相当于电梯里写「限载 13 人 / 1000 公斤」——那个 1000 是设计值,不是「大概一吨」。

官方对 K2.5 能力的原文:「Kimi K2.5 supports text, image, and video input, thinking and non-thinking modes, and dialogue and agent tasks.」——支持文本、图像、视频输入,支持思考与非思考模式,支持对话与智能体任务。

而这一页上最有教学价值的一句,是官方自己承认文档过期:

"The web search (web_search) is currently being updated. We do not
recommend using this functionality in the near term. This
documentation is outdated; please follow subsequent content
updates."

翻译:「联网搜索(web_search)功能目前正在更新。我们不建议近期使用该功能。本文档已过期,请关注后续内容更新。」

这是本章能找到的最诚实的一段官方文案。它做了三件很少有厂商会做的事:主动承认某个功能正在改、主动劝你别用、主动声明自己这页文档是旧的。

用医院打比方:大多数科室的门牌都是「本科室正常接诊」;而这一句相当于门口贴了张纸——「本科室 CT 机正在维修,这段时间的检查结果不准,建议改天再来,墙上贴的流程图也是旧版的」。看到这种告示你不该觉得这家医院差,恰恰相反,它是少数愿意把自己的不完整状态告诉你的地方。

对你的实际启示是:文档上的「过期声明」是最有价值的信息之一,看到了就该额外留意。因为绝大多数过期文档是不会自己声明的——它就那么静静地挂在那里,看起来跟正常文档一模一样。

本小节可靠度:中高。定价数字来自官方页面且结构完整(加分),但官方自承部分内容已过期(减分)。

智谱 GLM:那块「自己挂的牌子」长什么样

轮到本节前面预告过的那个教学点了。智谱的 GLM 官方文档(docs.z.ai/guides/llm/glm-4.6,截至 2026 年 8 月 8 日)关于 GLM-4.6 的规格:

项目官方值
输入 / 输出模态Text(纯文本)
上下文长度200K
最大输出128K
API 地址https://api.z.ai/api/paas/v4/chat/completions
model 参数名glm-4.6

官方对上下文扩容的说明原文:「Longer context window: The context window has been expanded from 128K to 200K tokens, enabling the model to handle more complex agentic tasks.」——上下文窗口从 128K 扩展到 200K,使模型能处理更复杂的智能体任务。这一句是可核实的客观描述,说的是自己的两个版本之间的变化,没有涉及任何跨厂商比较。

而下面这一句性质完全不同,请注意我怎么标注它:

"GLM-4.6 achieves performance on par with Claude Sonnet 4/Claude
Sonnet 4.6 on several leaderboards, solidifying its position as the
top model developed in China."

翻译:「GLM-4.6 在若干榜单上达到与 Claude Sonnet 4 / Claude Sonnet 4.6 相当的表现,稳固了其作为中国研发的顶尖模型的地位。」

★ 这是厂商官方自述,不是第三方评测结论。这个标注不是为了贬低这句话,而是为了准确说明它的性质。我们逐层拆一下这句话,你会看到它由三种不同强度的成分组成:

句子成分原文性质能不能直接引用
比较对象on par with Claude Sonnet 4 / 4.6具体、可验证的对标声明可以引用,但必须写「智谱官方称」
比较依据on several leaderboards「若干榜单」——没说是哪几个,没给分数,没给日期信息量很低。相当于说「在好几次考试里」,但不说是哪几门
结论the top model developed in China排名式断言,无客观标准不能作为事实引用。这属于本章明确不采用的那一类断言

把这三层摊开之后,事情就清楚了。第一层是可核实的对标声明(虽然要标明是谁说的);第二层「several leaderboards」是本句最薄弱的一环——没有列出榜单名、没有分数、没有测试日期,实际上无法核实。第三层「中国研发的顶尖模型」是纯粹的排名式断言,本章从头到尾不采用这类说法。

用招聘打个比方,你就明白该怎么读这句话了。一份简历上写「本人在多个项目中表现与行业顶尖工程师相当,是国内最优秀的开发者之一」。作为面试官,你不会认为这句话是假的,但你也不会把它当成录用依据——你会问「具体哪几个项目?评价来自谁?有什么可查的记录?」得不到这三个答案时,这句话就只是一句自我陈述。

那本书为什么还要把它写出来?因为「一家公司怎么定位自己」本身是有价值的信息。它告诉你:智谱把自己的对标对象设成了 Claude Sonnet 系,并且把「中国最好」当成对外的核心叙事。这个定位信息,比一个虚假的准确分数有用得多。说白了:我们不是在传播这个断言,我们是在展示这个断言存在。

诚实声明 · GLM 的两处留白

第一,GLM 的 API 定价未取得。本节没有列 GLM 的每百万 token 价格,因为我们没有从官方渠道核实到。

第二,GLM 开源权重的许可证未取得。智谱有公开发布模型权重的做法(§12.1 里引用的 GLM-5.2 模型卡就是证据),但我们没有取得它的 LICENSE 原文,所以不宣称它是任何具体的许可类型。

顺带把本节涉及的许可情况一起交代清楚,避免你在别处看到不同说法时困惑:

为什么本节不给市场份额、用户量、排名

这一小节没有任何数字,但它是本节写作立场最集中的地方。

关于中国 AI 公司,网上最常见的说法长这样:「某某月活破亿,稳居国内第一」「某某在 C 端市场份额超过百分之几十」「国产大模型第一梯队排名」。这类数字本节一个都不给。

原因很朴素:我们在核实过程中,没有在任何厂商的财报或官方公告里找到这类数据。

请注意这句话的措辞——不是「这些数字是假的」,而是「我们没有找到官方出处」。这两句话差别很大。用一件生活里的事打比方:你听说邻居家孩子考了全区第一。这可能是真的,但如果你没见过成绩单,你就不该把它当成事实转述给第三个人。

这类数据为什么特别难核实?三个原因:

所以本节的立场是:这类断言一律标「未取得权威来源」,宁可留白。

这个原则本书是一贯的。§2.5 原本有一处关于豆包的排名式断言(说它用户量最大),在 2026 年 8 月的一次全站核查中被改成了「中文场景投入大、迭代快」这样的中性描述——因为原来那句话违反了本书自己定的核实原则。说白了:规则得对自己也生效,否则就不是规则。

那你想了解真实格局怎么办?给三条可操作的替代路径:

五家横向对照:一张表看清各自的路数

把五家摊在一起,仍然按 §12.2 那个思路排——不比强弱,比「你要用它得付出什么、要注意什么」(全部截至 2026 年 8 月 8 日):

DeepSeek阿里 Qwen字节豆包月之暗面 Kimi智谱 GLM
最鲜明的特点价格极低规模全公开,从 0.6B 到 235B平台化,也卖别家的多模态 + 长上下文对标叙事清晰
当前主力型号V4-Flash / V4-ProQwen3 系、Qwen3-2507 系doubao-seed-1.6 四个变体K2.5 / K2 / Moonshot V1GLM-4.6
官方上下文1M(两档同)256K,官方称「可扩展到 1M」256k(其中最大输入 224k)262,144(即精确 256K)200K
最大输出384K官方未在该页给出32k官方未在该表给出128K
输入价(未命中)$0.14 / $0.435不适用(发布权重)★ 未取得$0.60(k2.5)★ 未取得
输出价$0.28 / $0.87不适用★ 未取得$3.00(k2.5)★ 未取得
开源权重许可★ 未取得★ 未取得未涉及未涉及★ 未取得
页面新鲜度好(含 2026-07 的弃用公告)未标更新日期自标 2025.12.10,滞后大半年官方自承部分内容过期
本节评的可靠度中高高(就该页而言)

这张表里「★ 未取得」出现了七次。这不好看,但它是诚实的。一张全是数字的漂亮表格,和一张有七处留白但每个数字都能追溯到出处的表格,后者才是能用的。

打个比方:银行办贷款,柜员给你一份材料清单,上面有三项标着「暂缺,需补交」。你不会因此觉得这家银行不专业——恰恰相反,如果他给你一份全部打勾但其中三项是他随手替你填的,那才是真正的问题。

把价格拉平对比:中国这边到底便宜多少

前面几张表的价格分散在各小节里,这里集中拉平对比一次。因为这个对比是本节最硬、最可核实、也最有实际决策价值的信息。(全部为官方公布价,每百万 token,截至 2026 年 8 月 8 日)

模型来自输入输出相对 GPT-5.5 的输入价
GPT-5.5OpenAI(§12.2)$5.00$30.00基准 1×
Claude Opus 4.7Anthropic(§12.2)$5.00$25.00
Gemini 3.6 FlashGoogle(§12.2)$1.50$7.50约 0.3×
kimi-k2.5月之暗面$0.60$3.00约 0.12×(便宜约 8 倍)
deepseek-v4-proDeepSeek$0.435$0.87约 0.087×(便宜约 11 倍)
deepseek-v4-flashDeepSeek$0.14$0.28约 0.028×(便宜约 36 倍)
deepseek-v4-flash(缓存命中)DeepSeek$0.0028$0.28约 0.00056×(便宜约 1800 倍)

把最极端的那个对比换算成生活里的钱,感受会很强烈。假设你要处理一亿 token 的输入(大概相当于几千万汉字,一个中型企业的全部文档):

三千六百元和两块钱。这个差距大到会改变产品形态——有些应用在前一种价格下压根不成立,在后一种价格下才变得可行相当于从「打车」变成「坐公交」:不是省了点钱,是让原本不会天天出门的人开始天天出门了。

但必须把三条限定说清楚,否则这张表就成了误导:

限定一:价格不代表效果。这张表只说明「花多少钱」,完全不说明「效果好不好」。本节没有取到任何权威第三方横向评测,所以不做任何「便宜且效果一样」的暗示。

限定二:缓存命中价有严格前提。$0.0028 只在「重复的长前缀」这个条件下生效。如果你每次问的内容都不一样,就是 $0.14。说白了:那个 1800 倍不是常态价,是特定用法下的价。

限定三:豆包和 GLM 的价格未取得,所以它们没进这张表。不进表不代表它们贵或便宜,只代表我们没查到。

常见误解澄清

误解一:「中国模型便宜是因为在补贴烧钱,早晚要涨回去。」

这个说法本节既不支持也不反驳——因为我们没有取到任何厂商的成本结构数据,无法判断。能确认的只有一件事:这些价格是官方公布的、可查的、当天有效的。至于它能维持多久,任何人的说法都是推测。相当于看到超市某个牌子的鸡蛋比别家便宜一半——你可以猜它是促销、是产地优势、还是马上要过期,但站在货架前你能确认的只有标价。

误解二:「国产模型只能用来做简单的活儿。」

这类判断需要横向评测支撑,而本节明确没有取到。但有两条可核实的间接证据值得放在一起看:火山方舟这个字节自家平台的官方清单里,挂着 DeepSeek 和 Kimi 的模型;§12.5 会看到 TRAE 的官方内置模型清单里,MiniMax、GLM、DeepSeek、Kimi、Qwen 五家全在。被同行的商业平台选进内置清单,是一个比任何自我宣称都硬的信号——因为平台方要为效果负责,选错了是自己挨骂。

误解三:「上下文 1M 就意味着能一次读完一整本书还记得住。」

这是把「装得下」和「用得好」混为一谈了。§11.4 讲 RAG 时提过 Lost in the Middle(迷失在中间)这个现象——它测的是关键信息放在长文本不同位置时的表现差异,说明「塞进去」和「找得到」不是一回事。用图书馆打比方:图书馆再大,也不等于你能在里面迅速找到那本书;书架越长,你越需要一个索引。

误解四:「上下文 256k,所以我可以塞 256k 的输入。」

豆包那张表已经反驳了这一点:上下文 256k,但最大输入只有 224k,因为要给 32k 的输出留位置。说白了:上下文是「一间屋子的总面积」,不是「你能堆多少货」——得留出走路的地方。这个账算错了,请求会直接被拒。

误解五:「官方文档写了就一定还有效。」

DeepSeek 那条「deepseek-chat 将于 2026 年 7 月 24 日弃用」的脚注,在我们查询的 8 月 8 日已经过期了,但它还挂在页面上。豆包那份清单自标 2025.12.10。Kimi 更是官方自承文档过期。三家里三家都有新鲜度问题——这不是个别现象,这是常态。所以「看更新日期」这个动作不是洁癖,是必要步骤。

Recap · 这一节收束

一、五家的路数各不相同。DeepSeek 走极低价(缓存未命中 $0.14,比 GPT-5.5 便宜约 36 倍;缓存命中 $0.0028,便宜约 1800 倍);Qwen 把从 0.6B 到 235B-A22B 的完整尺码表公开发布;字节把火山方舟做成平台,连 DeepSeek 和 Kimi 的模型也一起挂;Kimi 主打多模态与 262,144 的精确长上下文;GLM 的对标叙事最清晰。

二、「厂商自述」和「第三方评测」必须分开。智谱官方那句「on par with Claude Sonnet 4/4.6 on several leaderboards, ... the top model developed in China」是厂商官方自述:其中「several leaderboards」没有列榜单名、没有分数、没有日期,实际无法核实;「中国最顶尖」属排名式断言,本章不采用为事实。处理办法是照抄原文 + 明确标注性质,不删除也不升级。

三、本节不给市场份额、用户量、排名。因为没有在任何厂商财报或官方公告里找到这类数据。三条原因:口径不统一、第三方多为推算、这几家大多无公开财报义务。替代做法:看价格(官方公布可查)、看谁被摆进了别人的货架(可核实的集成关系)、看官方措辞的变化。

四、几条容易算错的账。上下文 ≠ 最大输入(豆包 256k 上下文只允许 224k 输入,因为要留 32k 给输出);「extensible to 1M」不等于「支持 1M」;缓存命中价有严格前提(重复的长前缀),不是常态价。

五、官方文档的新鲜度问题是常态,不是例外。DeepSeek 那条 2026 年 7 月 24 日的弃用公告在查询当天已过期却仍挂着;Qwen 文档页未标更新日期;豆包清单自标 2025.12.10,滞后大半年;Kimi 官方直接写「This documentation is outdated」。五家里四家有新鲜度线索,所以「先看日期」是必要动作。

六、本节的留白清单(诚实交代):豆包每百万 token 价格未取得(官方页价格未在 HTML 中渲染);GLM 的 API 定价未取得;Qwen、GLM、DeepSeek 三家的开源权重许可原文均未取得(故不宣称 Qwen3 是 Apache 2.0 这类说法);任何市场份额、用户量、排名数据未取得,一律不给;任何权威第三方横向评测未取得,故不做效果优劣判断。所有数字的查询日期均为截至 2026 年 8 月 8 日

☰ 主页
学海无涯 · 智能篇 · § 12.3