§ 12.4 · Section

开源生态

「开放权重」为什么不等于「开源」

这一节要纠正一个几乎所有人都在用错的说法。当媒体说「某某发布了开源大模型」时,绝大多数情况下他们描述的其实是「开放权重」,而按开放源代码促进会(OSI)的正式定义,只发布权重根本不构成开源。这不是文字游戏——两者的差别,决定了你能不能真正理解这个模型、能不能复现它、能不能对它负责。本节前半部分把 OSI 那份定义逐条拆开讲,并用 Meta Llama 许可里那条「7 亿月活门槛」做实例;后半部分讲一套真正能上手的东西:llama.cpp、GGUF 格式、Ollama——也就是「怎么在自己的电脑上跑一个模型」。这后半部分是全章唯一能让你今晚就动手试一试的内容。所有内容截至 2026 年 8 月 8 日。

生活场景
🥣 一罐给你的秘制辣酱

你邻居做的辣酱特别香,你夸了半天,她很大方地说「送你一罐」。

情况一:她给了你一罐酱。你拿回家,想吃就舀一勺,好吃得停不下来。但吃完就没了,你也做不出第二罐。你甚至说不清里面到底放了什么——闻着像有豆瓣,但不确定;辣度很特别,但不知道是哪种辣椒。

情况二:她给了你配方。「三种辣椒各多少克、豆瓣哪个牌子、油温几度下锅、炒几分钟、放凉多久装瓶。」这时候你就能自己做了,而且能改——嫌太辣就少放一种辣椒,想更香就多加点花椒。

情况三:她还告诉你辣椒是从哪个市场哪个摊买的、哪一季的、为什么选这一季。这时候你才算真正掌握了这罐酱——你能判断为什么某次做出来味道不一样,能在换了产地之后知道该怎么调整。

说白了,「开放权重」是情况一:东西给你了,你能用,但你不知道它怎么来的,也没法真正复现。而 OSI 定义的「开源 AI」要求做到情况三:不但给你成品,还要给你配方(训练代码)和原料来源信息(数据信息)。

先把「权重」这个词彻底说清楚

要理解后面所有内容,得先把这个最基础的词讲透。

权重(weights)说白了就是:模型内部那几千亿个数字。就这么简单,它不神秘。

用调收音机打比方(§5.1 用过这个比方,这里再用一次):一台老式收音机有几个旋钮,你转动它们直到声音最清楚。那几个旋钮此刻停在的位置,就是「权重」。而神经网络相当于一台有几千亿个旋钮的收音机,训练过程就是有人花几个月时间,把这几千亿个旋钮一个个转到最合适的位置。

所以「发布权重」这件事的实质是:把那几千亿个旋钮的最终位置抄下来,做成一个文件给你。你拿到这个文件,就能造出一台旋钮位置完全一样的收音机,听到一样清楚的声音。

但你不知道这些位置是怎么找到的。你不知道调试者试过多少个组合、听的是哪个电台、用什么标准判断「清楚」。换成大白话:你拿到了答案,但没拿到解题过程。

OSI 的定义原文对这几个概念做了非常精确的区分,值得逐字看:

"An AI model consists of the model architecture, model parameters
(including weights) and inference code for running the model.
AI weights are the set of learned parameters that overlay the model
architecture to produce an output from a given input."

翻译:「一个 AI 模型由模型架构模型参数(含权重)用于运行模型的推理代码组成。AI 权重是那组学到的参数,它们叠加在模型架构上,从而对给定输入产出输出。」

把这句话拆成三样东西,对应到收音机:

OSI 的用词是什么收音机类比厨房类比
模型架构
model architecture
网络有几层、每层怎么连这台收音机的电路设计图:有几个旋钮、各控制什么厨房的格局:几个灶、水槽在哪
参数 / 权重
parameters / weights
那几千亿个具体数字每个旋钮当前转到的刻度这道菜每样调料放了多少克
推理代码
inference code
让模型跑起来的那段程序收音机的开关和使用方法照着做的操作步骤

注意这三样里没有「训练代码」和「训练数据」。这就是关键——上面这三样加起来只够让模型「跑起来」,不够让人「重做一个」。而 OSI 定义要的恰恰是后者。

OSI 与 OSAID:开源这个词是有主人的

在讲定义之前,先说清楚凭什么是 OSI 说了算

OSI(Open Source Initiative,开放源代码促进会)是 1998 年成立的非营利组织。「开源」(open source)这个词的定义、以及「哪些许可证算开源许可证」这件事,几十年来就是由它维护的。

用一个生活里的对应关系来理解它的地位:「有机蔬菜」这四个字不是谁想印在包装上就能印的,得符合一套认证标准。相当于菜市场里有个专门的机构管着「什么才算有机」,你的菜再干净、再没打农药,没过认证也不能标「有机」。OSI 在软件世界扮演的就是这个角色。

2024 年 10 月,OSI 发布了 Open Source AI Definition(OSAID,开源 AI 定义)v1.0,专门回答「一个 AI 系统怎样才算开源」。这就是本节的核心依据,出处 opensource.org/ai/open-source-ai-definition,可靠度:高。

它先给出四项自由,原文:

"An Open Source AI is an AI system made available under terms and
in a way that grant the freedoms to:
  Use the system for any purpose and without having to ask for
    permission.
  Study how the system works and inspect its components.
  Modify the system for any purpose, including to change its output.
  Share the system for others to use with or without modifications,
    for any purpose."

翻译成四条大白话,并配上生活类比:

四项自由原文关键词大白话辣酱类比
使用(Use)for any purpose and without having to ask for permission想用来干什么都行,而且不用申请许可这罐酱你想蘸饺子、拌面、送人,都不用问我
研究(Study)Study how the system works and inspect its components能搞清它怎么工作、能逐个检查它的零件你能知道里面放了哪几种辣椒、各多少克
修改(Modify)for any purpose, including to change its output想怎么改就怎么改,包括改变它输出的内容嫌太辣就减辣椒,想更麻就加花椒
分享(Share)with or without modifications, for any purpose改过的、没改过的,都能给别人你改良的版本可以随便送给朋友

请特别注意「使用」那一条里的 without having to ask for permission(不必征得许可)。Meta Llama 那条「月活超 7 亿必须向 Meta 申请,Meta 可自行酌情决定」的条款,恰好就撞在这七个字上。这个对撞我们下面单独讲。

再注意「研究」那一条里的 inspect its components(检查它的组件)。光有权重你没法「检查组件」——说白了:你能听到收音机响,但你不知道那几千亿个旋钮为什么停在那个位置。这条自由要求的是能看进去,不只是能用起来

三要素:Data Information + Code + Parameters

四项自由是目标,那怎么才算达成?OSI 给出了一个非常具体的判据,叫「优先修改形式」(preferred form to make modifications)。这是全节最重要的一段,它把「算不算开源」变成了一道可以打勾的清单。

它要求三样东西,缺一样都不行。逐条看原文。

第一样:Data Information(数据信息)。原文:

"Data Information: Sufficiently detailed information about the data
used to train the system so that a skilled person can build a
substantially equivalent system. Data Information shall be made
available under OSI-approved terms."

翻译:「关于训练该系统所用数据的足够详细的信息,使得一个熟练的人能够构建出一个实质等效的系统。数据信息须以 OSI 认可的条款提供。」

这一条有两个非常聪明的设计,值得单独说:

第二样:Code(代码)。原文:

"Code: The complete source code used to train and run the system.
... Code shall be made available under OSI-approved licenses."

翻译:「用于训练和运行该系统的完整源代码。……代码须以 OSI 认可的许可证提供。」

注意这里是「train and run」(训练和运行),不是只有运行。这一点极为关键,因为绝大多数「开源模型」发布的只有运行所需的推理代码,训练代码根本不给。相当于邻居告诉你「这罐酱怎么开盖、怎么保存、怎么蘸着吃」,但不告诉你「怎么炒出来的」。

第三样:Parameters(参数)。原文:

"Parameters: The model parameters, such as weights or other
configuration settings. Parameters shall be made available under
OSI-approved terms."

翻译:「模型参数,例如权重或其他配置设置。参数须以 OSI 认可的条款提供。」

把三样合起来,就是那句最关键的结论。OSI 原文:

"'Open Source models' and 'Open Source weights' must include the
data information and code used to derive those parameters."

翻译:「『开源模型』和『开源权重』必须包含用于导出这些参数的数据信息与代码。」

所以答案很明确:仅发布权重、不提供 Data Information 与训练 Code,按 OSAID 不构成 Open Source。

把这个判据做成一张能打勾的表,你以后看任何「开源模型」发布公告都能自己判断:

要素大部分「开源模型」给了吗辣酱类比缺了会怎样
Parameters(权重)✅ 基本都给那罐酱缺了压根不能用
推理代码✅ 大多给了怎么开盖、怎么吃缺了不知道怎么用
训练 Code❌ 大多不给炒制的完整步骤缺了你没法从头做一个
Data Information❌ 极少给辣椒的品种、产地、比例缺了你连「为什么会这样」都不知道

看这张表最下面两行——那正是「开放权重」和「开源」的分界线。

Analogy · 免费开放的小区花园

「开放权重」被叫成「开源」这件事,用一个小区花园的比方能讲得最清楚,而且能同时讲清 Llama 那条 7 亿门槛为什么是个问题。

假设小区门口挂着一块牌子:「本小区花园免费向公众开放。」听起来很大方。但你走近细看,牌子下面还有几行小字:

小字一:「如果你所在的公司在本告示发布当日员工超过一万人,须先向物业申请,批不批我们说了算。

小字二:「入园后,你在任何社交媒体提到本花园时,须显著标注『游于××花园』。」

小字三:「如果你受本花园启发自己造了一个花园,那个花园的名字开头必须带『××』。」

这三行小字,就是 §12.2 讲过的 Llama 4 Community License 里的三条真实义务。而 OSI 四项自由里的第一条要的是 without having to ask for permission(不必征得许可)——小字一直接撞上了它。

但这还不是最要紧的地方。最要紧的是另一件事:这个花园你可以进去逛,可以拍照,可以坐在长椅上晒太阳。但没人告诉你这些树是什么品种、从哪买的苗、怎么养到这么大的。你想在自己家院子里照着造一个,做不到。

这就是 OSAID 三要素的真正意义所在。它管的不只是「你能不能进」这个权限问题(那是许可条款的事),更是「你能不能自己也造一个」这个能力问题(那是 Data Information + Code 的事)。本质上就是:许可宽松只解决了「让不让你用」,开源要解决的是「你能不能独立重来一遍」。

拿 Llama 4 当尺子量一遍

光讲定义容易空。现在把 §12.2 引用过的 Llama 4 Community License 拿出来,逐条对着 OSAID 量一遍。这是本节最实用的一段,因为它给了你一套可以套用到任何模型上的检查动作。

先重申一次那条最关键的原文(Section 2 Additional Commercial Terms,生效日 2025 年 4 月 5 日):

"If, on the Llama 4 version release date, the monthly active users
of the products or services made available by or for Licensee, or
Licensee's affiliates, is greater than 700 million monthly active
users in the preceding calendar month, you must request a license
from Meta, which Meta may grant to you in its sole discretion..."

现在逐条对照:

OSAID 要求Llama 4 的情况判定
自由一 · Use
「for any purpose and without having to ask for permission
月活超 7 亿必须向 Meta 申请,且 Meta「可自行酌情决定冲突——对一部分主体而言,恰恰必须征得许可
自由二 · Study
「inspect its components」
能拿到权重,但训练数据信息未提供不满足——能用不等于能看进去
自由三 · Modify可以微调、可以改,但派生模型名字开头必须带「Llama」附带条件
自由四 · Share可以分发,但须附协议副本、须显著标注「Built with Llama」附带条件
要素 · Parameters✅ 提供满足
要素 · Code(train and run)推理侧有,完整训练代码未提供不满足
要素 · Data Information未提供到「熟练者可构建实质等效系统」的详细程度不满足
许可类型Meta 自定义 Community License非 OSI 认可的开源许可

所以结论是什么?按 OSAID 这把尺子,Llama 4 属于「开放权重」(open weights),不属于「开源 AI」(Open Source AI)。

但请务必把这个结论理解对,它非常容易被读成一句攻击的话。这里说三点:

那正确的说法是什么?给你三组用词对照,以后写东西可以直接用:

不严谨的说法严谨的说法为什么
「Meta 开源了 Llama 4」「Meta 公开发布了 Llama 4 的权重准确描述了做了什么,不做资格认定
「Llama 4 是开源模型」「Llama 4 是开放权重模型,采用 Meta 自定义的社区许可」用了业界通行且准确的术语 open weights
「Llama 4 可以免费商用」「Llama 4 在满足社区许可条件的前提下可商用,其中含 7 亿月活门槛与署名、命名义务」把前提条件说出来,这是对读者负责

「开放权重」(open weights)这个词是有的,而且越来越多人在用。它准确、诚实、不需要争论。用超市标签打比方:「本地种植」和「有机认证」是两个不同的标签,前者也是好东西,但它就是不叫后者。用对标签,比争论哪个更高级有意义得多。

llama.cpp:让普通电脑也能跑模型的那个项目

讲完定义,现在讲能上手的东西。这一小节和后面两小节,是全章唯一你今晚就能动手试的部分。

llama.cpp 是一个开源推理项目,官方仓库 github.com/ggml-org/llama.cpp许可是 MIT license(GitHub 仓库侧栏明确标注,可靠度:高)。

这里请注意一个容易搞混的地方:llama.cpp 的许可是 MIT(一个标准的 OSI 认可开源许可),但它跑的那些模型的许可各不相同。相当于你家的微波炉是你自己的,但你放进去加热的那盒便当归谁、能不能转卖,是另一回事。

官方 README 里对项目目标的表述:

"The main goal of `llama.cpp` is to enable LLM (and VLM) inference
with minimal setup and state-of-the-art performance on a wide range
of hardware - locally and in the cloud."

翻译:「llama.cpp 的主要目标是:以最少的配置、在各种硬件上(本地或云端)实现大语言模型(以及视觉语言模型)的推理,并达到一流的性能。」

「minimal setup」(最少的配置)这四个字是这个项目的灵魂。为什么这件事重要?因为传统的模型推理需要装 Python、装 PyTorch、装 CUDA、配环境变量,一整套下来对普通人是灾难。相当于你想在家煮碗面,结果得先装修厨房、通煤气、买抽油烟机。

官方列出的特性里,有四条特别值得逐条翻译:

官方原文特性大白话为什么重要
「Plain C/C++ implementation without any dependencies纯 C/C++ 写的,不依赖任何外部库这是「minimal setup」的根本原因——不用装 Python 环境,编译出来就是一个能跑的程序。相当于一把不用充电、不用配件的手动工具
「Apple silicon is a first-class citizen - optimized via ARM NEON, Accelerate and Metal frameworks」苹果自研芯片是一等公民,通过三套苹果框架专门优化意味着 Mac 上跑得特别顺。说白了:M 系列芯片的 Mac 是这个项目最舒服的平台之一
1.5-bit, 2-bit, 3-bit, 4-bit, 5-bit, 6-bit, and 8-bit integer quantization for faster inference and reduced memory use」支持从 1.5 位到 8 位的整数量化,加快推理、减少内存占用这就是 §12.1 讲过的「精度换资源」,这里给了七个可选档位,让你在效果和资源之间自己挑
CPU+GPU hybrid inference to partially accelerate models larger than the total VRAM capacity」CPU 与 GPU 混合推理,能部分加速那些大于显存总容量的模型这一条是普通人的救命稻草——显存装不下的模型,也能靠内存兜一部分,慢但能跑

最后那条「CPU+GPU 混合推理」值得用生活场景说透,因为它解决的是最常见的痛点。

回忆 §12.1 那个饺子车间的比方:显存是案板。你的案板(显存)只有 8 GB,但要摊的菜谱(模型)有 20 GB。纯 GPU 方案会直接告诉你「放不下,干不了」。

而混合推理相当于说:案板上先放最常用的那部分,剩下的暂时摊在旁边的餐桌上(也就是普通内存里),需要时再端过来。结果是慢一些,但活儿能干成。说白了:从「不能做」变成「做得慢」,这个改变对个人用户是决定性的。

官方 Quick start 给的命令长这样,简洁程度值得一看:

llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

两条命令的区别:cli 是在命令行里直接跟模型聊天serve 是起一个服务,让别的程序能通过接口来调它相当于前者是你自己走到窗口去问,后者是开一个窗口让所有人来排队问。安装入口官方给的是 llama.app

后端支持列表也值得抄一遍,因为它是一张「谁的硬件被认真支持」的清单:CUDA、HIP、Metal、Vulkan、SYCL、CANN(Ascend NPU)、MUSA(Moore Threads)、OpenCL(Adreno)、WebGPU、ZenDNN。

§12.1 里关于华为昇腾唯一那条有据可查的事实,就在这份列表里:CANN | Ascend NPU。而 MUSA 对应的摩尔线程也是一家中国厂商。这份列表能说明的事情很朴素但很硬:这些硬件在最主流的开源推理项目里被官方支持。它不说明任何性能数字,但它说明了生态适配的存在。

项目规模数据(截至 2026 年 8 月 8 日查询该仓库当日显示):1,873 位贡献者,最新发布标签 b10313

这两个数字换算一下会更有感觉:1873 个人给同一个项目提交过代码——这个规模相当于一个中型软件公司的全部工程师。而 b10313 这个标签说明它已经发过一万多个版本,相当于如果每天发一个版本,也要发二十八年。说白了:这不是一个业余项目,是一个高强度持续迭代的工程。

GGUF:模型的「统一集装箱」

上面那条命令里出现了 Qwen3.5-0.8B-GGUF。这个后缀是什么?这一小节讲一个只有五个字母、但极大简化了本地跑模型这件事的东西。

GGUF 是一种模型文件格式。官方规范(github.com/ggml-org/ggml/blob/master/docs/gguf.md)原文:

"GGUF is a file format for storing models for inference with GGML
and executors based on GGML. GGUF is a binary format that is
designed for fast loading and saving of models, and for ease of
reading. Models are traditionally developed using PyTorch or
another framework, and then converted to GGUF for use in GGML."

翻译:「GGUF 是一种文件格式,用于存放供 GGML 及基于 GGML 的执行器做推理的模型。它是一种二进制格式,设计目标是快速加载和保存模型、以及便于读取。模型通常先用 PyTorch 或其他框架开发,然后转换成 GGUF 以便在 GGML 中使用。」

用快递的比方讲这件事,一句就懂:不同工厂生产的商品,包装规格五花八门——有的用泡沫箱、有的用麻袋、有的散装。而集装箱标准化之后,所有东西都装进统一尺寸的箱子,任何一台起重机、任何一条船都能处理。GGUF 就是模型世界的集装箱标准。

注意原文里那句「converted to GGUF」(转换成 GGUF)。这说明 GGUF 不是模型训练时的原生格式——模型先在 PyTorch 那边训好,再打包成 GGUF 拿出来用相当于工厂里生产完的货,装进集装箱才上船;集装箱不是生产用的容器,是运输用的容器。

官方还说明了它的来历:

"It is a successor file format to GGML, GGMF and GGJT, and is
designed to be unambiguous by containing all the information needed
to load a model."

翻译:「它是 GGML、GGMF 和 GGJT 的后继格式,通过包含加载模型所需的全部信息来做到无歧义。」

「包含全部所需信息」这一点,比听起来重要得多。它解决的是一个非常具体的痛苦:以前拿到一个模型文件,你还得另外知道一堆配置——多少层、词表在哪、用什么分词器。少一样就跑不起来。相当于你收到一个包裹,箱子里有零件但说明书丢了,你得自己猜怎么装。

而 GGUF 与前一代 GGJT 的关键差别,官方点得很准:

"The key difference between GGJT and GGUF is the use of a key-value
structure for the hyperparameters (now referred to as metadata),
rather than a list of untyped values."

翻译:「GGJT 与 GGUF 的关键差别在于:超参数(现在改称元数据)采用键值结构,而不是一串无类型的值。」

这个改动值得用一个生活场景讲透,因为它是所有「配置文件设计」共通的道理。

旧办法(一串无类型的值)相当于:你去药店取药,药师递给你一张纸条,上面只写着「3 2 7 1」。你得自己知道第一个数是每天几次、第二个是几片、第三个是几天、第四个是饭前还是饭后。顺序一错就全错,而且中间加一项会把后面全部错位。

新办法(键值结构)相当于:纸条上写「每天次数=3;每次片数=2;服用天数=7;饭前饭后=饭后」。顺序可以任意打乱,加新项也不影响老项,而且看一眼就知道每个数是什么意思。

再看两个规范细节,它们能教你「文件格式」是怎么设计的:

官方还给了一套文件命名规范,看着复杂但拆开就明白:

[<Sidecar>]<BaseName><SizeLabel><FineTune><Version><Encoding><Type><Shard>.gguf

翻译成大白话,这就是一张商品标签的字段清单:基础模型名、尺寸标签(多少 B)、微调版本、版本号、编码方式(量化档位)、类型、分片编号。说白了:看文件名就能知道这是「哪个模型、多大、什么量化、第几片」,不用打开就知道箱子里装的是什么。这跟超市商品标签上「品牌+规格+口味+生产批次」的排法是同一个思路。

Ollama:把这一切包成一句话

llama.cpp 已经很省事了,但仍然要碰命令行、要理解量化档位、要自己找模型文件。Ollama 做的是再往上包一层,让整件事变成一句话。

官方文档(docs.ollama.com/quickstart)原文:「Ollama runs on macOS, Windows, and Linux.」——三大桌面系统都能跑。

官方给的用法极其简单,运行 ollama 就打开一个交互菜单,里面能:

最基本的用法就一行,官方示例:

ollama run gemma4

就这样。没有配环境、没有装 Python、没有选量化档位、没有下载文件。它会自动帮你把模型拉下来然后开始对话。退出输入 /bye

用一个厨房的比方来对比这三层的关系,你会立刻明白它们各自的位置:

层次是什么厨房类比适合谁
模型权重(GGUF 文件)那几千亿个数字打包成的文件生食材:一块肉、一把菜需要自己完全掌控的人
llama.cpp推理引擎,能把权重跑起来灶台和锅:能做菜,但火候、调料都要你自己来愿意折腾、要精细调优的人
Ollama在上面再包一层,一句命令搞定一台预设好程序的电饭煲:放米放水,按「煮饭」只想用起来、不想调参的人

官方还提了一个很有意思的功能——云端模型:「Cloud models work the same way: ollama run gemma4:cloud」。加一个 :cloud 后缀,同一条命令就改成跑在云端了。

这个设计相当漂亮。它的意思是:你的使用方式完全不变,只是活儿从自家厨房挪到了外面的厨房。相当于同一个点菜动作,你可以选「自己做」或者「叫外卖」,而点菜的方式一模一样。对使用者来说,本地和云端的切换成本被压到了一个后缀。

模型浏览入口官方给的是 ollama.com/search

诚实声明 · 两处留白

第一,Ollama 支持的模型完整清单未取得。那个页面是动态渲染的,我们抓不到完整列表。所以本节只给官方文档里出现过的示例模型名(gemma4,不列「Ollama 支持哪些模型」的清单。

第二,Hugging Face 的平台规模数字未取得。Hugging Face 是全球最大的模型与数据集托管平台,本该在这一节占重要位置。但我们尝试的三个官方地址(huggingface.co/modelshuggingface.co/huggingface.co/docs/hub/en/index)全部抓取失败。

所以本节不给出任何 Hugging Face 的模型数、数据集数、用户数。网上「HF 上有一百多万个模型」这类说法很常见,我们没有核实到,就不写。

顺带说明另一处整条留白:Mistral AI。这是一家常被列入开源阵营的法国公司,我们尝试了 docs.mistral.ai 的 models_overview、models、weights 以及 mistral.ai/technology 四个地址,全部失败。搜索结果里只有自媒体内容,按本章原则已排除。所以本节关于 Mistral 的型号与许可,整条标「未取得」,一个字都不写。

这几处留白凑在一起有点难看,但请把它当成一个正面示范:一份研究里「我不知道的部分」被清楚标出来,比它被漂亮地填满更有价值。

自己在电脑上跑一个模型,值不值得

工具讲完了,现在回答一个很实际的问题:作为普通人,你到底该不该折腾这件事?

先把两条路的账摆平(这是按前面各节可核实的信息做的对比,不含任何厂商宣称):

用云端 API(§12.2、§12.3)本地跑(本节的工具)
启动成本注册、拿个密钥,几分钟装个 Ollama,也就几分钟;但要有一台够用的机器
每次花钱吗是,按 token 算不花,电费忽略不计
能跑多大的模型厂商最强的那个也能用受你的显存和内存限制(§12.1 的账)
数据去哪发到厂商服务器完全不出你的电脑
断网能用吗不能
厂商改型号会影响你吗会(§12.2、§12.3 有多个真实弃用与关停实例)不会,文件在你硬盘上
速度通常更快,人家的卡更强取决于你的机器,小模型很快,大模型可能很慢
生活类比点外卖:方便、选择多、每顿付钱自己做饭:省钱、可控、但要有厨房和时间

按这张表,本地跑最值的四种情况是:

而不值得折腾的情况也很明确:如果你只是偶尔用一下、任务需要最强的能力、又不在乎数据发到哪里,那云端 API 更划算——尤其是看过 §12.3 那张价格表之后,你会发现便宜档的价格低到「省这个钱不如省时间」。

给一条最省事的上手建议:装 Ollama,跑一个小模型(几 B 参数那种),聊两句,感受一下。全程不超过半小时,也不用付钱。这半小时能让你对「模型跑在什么东西上」这件事的理解,超过读十篇文章。

开源生态到底改变了什么

把这一节收一下,说三件开放权重和开源工具真正带来的改变。这三件事都是可以从前面的事实推出来的,不含任何推测性预言。

改变一:它给了「不依赖任何一家公司」这个选项。

回想 §12.2 和 §12.3 里那些真实发生的事:Gemini 3 Pro Preview 被官方标 (Shut down);deepseek-chat 于 2026 年 7 月 24 日弃用;Kimi 官方建议近期别用 web_search。这些都是你无法控制的变动,唯一的应对是改代码。

而一个下载到硬盘上的 GGUF 文件,没人能把它关掉。相当于你家冰箱里存的东西——外面的店关门、涨价、换菜单,都跟你冰箱里那份没关系。说白了:这不是性能上的优势,是「主权」上的优势。

改变二:它把「跑模型」的门槛从机房拉到了个人电脑。

这一点是 llama.cpp 那几条特性的直接结果。「不依赖任何外部库」让安装变简单;「1.5 位到 8 位的七档量化」让模型能塞进小显存;「CPU+GPU 混合推理」让显存不够时也能跑。三条加起来,把原本需要 §12.1 那种机柜才能做的事,压到了一台普通笔记本上。

用照相机打比方:过去拍好照片得有暗房、有药水、有专业设备,摄影是少数人的事;后来手机拍照普及,人人都是摄影者。这个变化不是让专业摄影师失业了,而是让「拍照」这件事从一门手艺变成了一种日常能力

改变三:它逼着所有人把术语说清楚。

这就是本节前半部分的意义。OSAID 这份定义的存在,让「开源」这个词不再是想怎么用就怎么用的营销词。有了尺子之后,讨论就从「我觉得这算开源」变成了「按三要素清单,这一项满足、那一项不满足」。能吵出结果的争论,前提是有个大家都承认的尺子。

相当于装修行业有了国标之后,「环保材料」不再是老板嘴上说说——甲醛释放量的检测数值摆在那里,谁都不用争。

常见误解澄清

误解一:「开源模型就是免费模型。」

这里混了两件事。「开源」讲的是权利与透明度,「免费」讲的是价钱。Llama 4 不收你钱,但按 OSAID 不算开源;反过来,一个完全符合 OSAID 的模型也完全可以按商业方式收费提供服务。而且「不收模型的钱」不等于「用起来免费」——你得自己付算力和电费。

误解二:「开放权重就等于可以随便商用。」

这条误解代价最大,因为可能引出法律问题。Llama 4 Community License 里的三条硬义务(7 亿月活门槛、显著标注 Built with Llama、派生模型命名带 Llama)都是真实条款。说白了:下载不要钱,不等于用起来没规矩。要商用,请自己打开模型页面读 LICENSE 原文,别信任何二手转述——包括本节的转述。

误解三:「量化会让模型变笨,所以要用原始精度。」

§12.1 那个照相馆的比方已经讲过:80 MB 的原始文件和 2 MB 的 JPG 挂在墙上看不出差别。量化确实有损失,但在很多任务上这个损失小到无感,而省下的资源是成倍的。llama.cpp 提供 1.5 位到 8 位七个档位,正是因为「该用哪一档」取决于你的任务和硬件,没有统一答案。正确做法是自己在几个档位上试一下,看哪一档开始明显变差。

误解四:「Ollama 和 llama.cpp 是竞争关系,得选一个。」

它们更像上下两层的关系,参照前面那张厨房表:llama.cpp 是灶台和锅,Ollama 是电饭煲。相当于问「你家要灶台还是电饭煲」——很多人两个都有,做不同的事用不同的。

误解五:「本地跑的模型肯定比云端的弱。」

这个说法在具体条件下才成立,不能一概而论。它成立的部分是:你的机器摊不下 §12.3 提到的 235B 那种规模,而云端能提供。它不成立的部分是:很多任务用小模型就完全够用——文本分类、格式转换、简单摘要,杀鸡不用牛刀。说白了:问题不是「谁更强」,是「你的活儿需要多强」。

误解六:「llama.cpp 是 MIT 许可,所以我用它跑的模型也能随便用。」

前面提过这一点,这里再强调一次,因为它是最容易踩的坑。工具的许可和内容的许可是两码事。相当于你买的微波炉是你的,但你热的那盒别人家的便当不是你的。llama.cpp 的 MIT 许可管的是 llama.cpp 这段代码,管不到你加载进去的那个模型文件。

Recap · 这一节收束

一、「开放权重」不等于「开源」,这是本节的核心。按 OSI 的 OSAID v1.0,开源 AI 要同时提供 Data Information(详细到熟练者能构建实质等效系统)、Code(train and run 两侧的完整源代码)、Parameters 三要素。OSI 原文:「'Open Source models' and 'Open Source weights' must include the data information and code used to derive those parameters.」只放权重、不给训练数据信息与训练代码,按这份定义不构成开源。

二、四项自由是判据的上层。Use(且 without having to ask for permission)、Study(能 inspect its components)、Modify(含改变输出)、Share。Llama 4 的 7 亿月活门槛条款直接撞在第一条上——对一部分主体而言恰恰必须征得许可,而且 Meta「可自行酌情决定」。

三、拿 Llama 4 量一遍的结论:属于开放权重,不属于开源 AI。但请把这个结论理解对:这不是说 Llama 不好,也不是说 Meta 骗人(官方给它的名字就是 Community License,从未自称 OSI 开源许可),而是一次按明确尺子做的分类。正确用词是「公开发布了权重」「开放权重模型」,而不是「开源了」。

四、本地跑模型的三层工具。GGUF 是集装箱式的模型文件格式(键值元数据、文件头 magic 为 GGUF、规范版本必须为 3);llama.cpp 是推理引擎(MIT 许可、无外部依赖、七档量化、CPU+GPU 混合推理、1873 位贡献者、发布标签 b10313);Ollama 再包一层,ollama run gemma4 一句搞定,加 :cloud 后缀即转云端。厨房类比:食材 / 灶台锅 / 电饭煲。

五、工具的许可和模型的许可是两码事。llama.cpp 是 MIT,但它加载的模型各有各的条款。微波炉是你的,便当不是。

六、本节的留白清单(诚实交代):Hugging Face 平台规模数字未取得(三个官方地址全部抓取失败,故不给模型数/数据集数/用户数);Mistral AI 的型号与许可整条未取得(四个官方地址全部失败,搜索结果仅自媒体已排除,故一字不写);Ollama 官方支持模型完整清单未取得(动态页面);Qwen、GLM、DeepSeek 三家的开源权重许可原文均未取得(见 §12.3)。所有内容的查询日期为截至 2026 年 8 月 8 日

☰ 主页
学海无涯 · 智能篇 · § 12.4