§ 13.3 · Section

隐私与版权

你输进去的东西去哪了,它吐出来的东西归谁

这一节回答两个几乎每个用 AI 干活的人都撞过的问题:我贴进对话框的公司资料,会不会被拿去训练下一代模型?以及它生成的东西,我能不能拿去商用?第一个问题有明确答案,而且答案取决于你用的是消费级产品还是 API——官方文档里写得很清楚,只是绝大多数人没去看。第二个问题目前没有全球统一答案,正在各地法院里打。本节会把五起代表性诉讼的司法辖区与当前状态逐一列清,特别澄清两处流传最广的错误:一起还在上诉中的案子被说成了「已定论」,一起和解被说成了「判决」。另外会摊开 EU AI Act 的分阶段时间表和中国两部规章的生效日期。本节涉及大量法律信息,请先读下面那条声明。

重要声明 · 请先读这一段

本文不构成法律建议。下面所有内容都只是截至 2026 年 8 月 8 日的公开司法记录与官方法律文本的转述,目的是帮你理解争议的焦点在哪里、以及案件走到了哪一步,绝不能作为任何具体行为是否合法的判断依据。

三点特别提醒:第一,法律有辖区——美国某个联邦地区法院的裁定对英国、对欧盟、对中国都没有约束力。第二,案件状态随时变化——本节给的每个状态都带核实日期,读到这段时可能已经变了。第三,地区法院的裁定不等于终局判决,上诉法院可以推翻它。真要做决定,请咨询你所在辖区的执业律师。

生活场景
🏦 一台会记住你说过什么的复印机

想象银行大厅里有一台特别的复印机。它不只是复印,还会「学习」——每份经过它的文件,它都读一遍,用来提高自己的识字能力。厂家说这样机器越用越聪明。

你拿着一份合同去复印。这时候你会自然而然地问出两个问题,而这两个问题正好就是这一节的全部内容

问题一:我这份合同的内容,会不会被它记住?更要命的是,会不会哪天别人来复印东西,机器「顺口」把我合同里的条款吐出来一段?——这就是「训练数据泄露」,而且它确实被实验证明过。

问题二:这台机器读了几百万份别人的文件才变得这么聪明,那些文件的主人同意了吗?它现在写出来的东西,算它的、算厂家的、还是算那些原作者的?——这就是版权争议的全部内核。

还有一个容易被忽略的第三层:这台机器可能有好几个型号。大厅里给公众用的那台默认会学习,而银行内部业务柜台那台,合同上写明了不学习。说白了就是:同一个厂家、同一项技术,不同产品线的规则可能完全不同——而这正是「我的数据会不会被拿去训练」这个问题的真实答案形状。

先讲最硬的技术事实:训练数据真的能被「掏」出来

「模型会不会记住训练数据」这个问题不需要靠猜,有实验做过,而且是很硬的实验。

第一项工作:Carlini 等,标题 Extracting Training Data from Large Language Models(从大语言模型中提取训练数据),arXiv 2012.07805,首版 2020-12-14,第二版 2021-06-15。状态:已发表于 USENIX Security 2021,经同行评议。USENIX Security 是计算机安全领域顶级会议之一,这一点让这项结论的分量很不一样。

它证明了什么:可以从 GPT-2 这类模型中把训练数据提取出来,包括个人身份信息。机制是——模型会记住那些「罕见的」或者「重复出现过多次的」序列,而这些序列可以被有效地引导出来。

这两个条件值得分开体会,因为它们对应两种完全不同的现实风险:

第二项工作把这件事推到了生产级模型上:Nasr 等,标题 Scalable Extraction of Training Data from (Production) Language Models(对(生产级)语言模型的可扩展训练数据提取),arXiv 2311.17035,发布 2023-11-28。状态:arXiv 预印本,本文未取得其同行评议记录。

它的贡献是把提取攻击的方法扩展到了实际部署的产品(论文中包括 ChatGPT)上,说明这不只是实验室里小模型的现象。但状态要如实标注:预印本。

第三个必须知道的概念是成员推断攻击(Membership Inference Attack,简称 MIA)。说白了就是:攻击者不试图把整段内容掏出来,只想判断「某一条特定的数据,有没有被用来训练过这个模型」

经典出处:Shokri 等,标题 Membership Inference Attacks Against Machine Learning ModelsarXiv 1610.05820,首版 2016-10-18,已发表于 IEEE S&P 2017(另一个安全顶会),经同行评议

为什么「只判断有没有用过」也算严重的隐私问题?因为在很多场合,「你在这份名单里」本身就是敏感信息打个比方:某医院用某种罕见病患者的病历训练了一个模型。如果攻击者能判断出「张三的病历在训练集里」,那他实际上就推出了「张三患这个病」——哪怕他一个字的病历内容都没拿到。这就是成员推断的危害所在。

攻击类型出处与状态攻击者想得到什么生活类比
训练数据提取arXiv 2012.07805 · USENIX Security 2021,同行评议原文内容本身——把训练数据里的段落、密钥、个人信息掏出来把复印机内部残留的旧文件影像找出来看
生产级模型提取arXiv 2311.17035 · arXiv 预印本同上,但目标是实际上线的产品不只是实验室样机,商场里那台也能被掏
成员推断(MIA)arXiv 1610.05820 · IEEE S&P 2017,同行评议只要一个是非判断:这条数据在训练集里吗不看病历内容,只确认「这个人是不是那家专科医院的病人」

那么普通用户该记住什么?一条就够:凡是你不愿意被任何第三方看到的内容,就不要贴进任何默认会用于训练的产品里。这包括身份证号、密钥、未公开的合同条款、患者信息、客户名单。本质上就是:一份文件一旦进了那台会学习的复印机,你就失去了对它的完全控制——所以关键在于先搞清哪台机器会学习,这正是下一节的内容。

你的输入会被拿去训练吗?看官方文档,分产品线

这是本节最实用、也最容易被误传的一块。中文互联网上流传的说法通常是一句笼统的「AI 公司都在用你的数据训练」,但官方文档里的答案是分产品线的,而且差别很大。

先说 OpenAI,按产品线分开列:

再说 Anthropic,同样分两条:

这两家的政策放在一起,能看出一条很清晰的产业规律:面向企业和开发者的产品线普遍承诺默认不训练,因为企业客户会把这一条写进采购合同;而免费或个人订阅的消费级产品,策略各家不同,必须逐个去看条款。

相当于银行办业务:柜台给你签的合同里保密条款写得密密麻麻,而大厅里那台自助机的使用须知你从来没点开看过。不是银行故意骗你,是这两个场景的商业约束强度不同。

所以一条最实用的操作建议:在把公司或客户资料贴进任何 AI 产品之前,先去它的官方隐私页面搜三个关键词:train(训练)、retention(保留)、opt-in / opt-out(选择加入 / 退出)。这三个词能带你找到 90% 需要知道的信息。而且要注意看你用的是哪个产品线——同一家公司的答案可能完全相反。

Analogy · 一间会把学生作业收进教材的学校

版权这件事之所以吵得这么厉害,可以用一个校园里的场景一次讲透。

假设有一所学校要编一本作文教材。老师做了这么一件事:把过去十年所有学生的作文都读了一遍,然后写出一本《怎么写好作文》。书里没有原文照搬任何一篇学生作文,但它总结出的所有技巧、句式、结构,全都来自读那些作文的过程。

现在请你判断三个问题,你会发现每一个问题都能argue出两种都不荒谬的答案——这正是版权诉讼的真实处境:

问题一:老师「读」这些作文,需要事先取得授权吗?支持方说:读书学习本来就不需要授权,人类作家也是读了几百本书才会写的。反对方说:这不是「读」,这是系统性地复制了全部内容进机器,而且是为了做一个商业产品。

问题二:如果这本教材出版后卖得很好,抢了原来那些学生自己出书的市场,算不算损害?这一问在法律上有个专门的位置——「合理使用」判断里通常要看「对原作品市场的影响」。如果新东西替代了原作品的市场,天平就会倾斜。

问题三:如果这本教材写出来的一段话,几乎和某个学生的原文一模一样,那这段算侵权吗?——注意,这一问和前两问性质完全不同。前两问吵的是「学习过程本身合不合法」,这一问吵的是「输出结果是否复制了原文」。这两条线在真实诉讼里经常被混着谈,但它们是两个独立的争点。

本质上就是:所有 AI 版权诉讼都在这三个问题上打转——输入端的复制市场替代输出端的相似度。你记住这三条线,看任何一起案件的报道都不会看晕。

先学四个词:审理中、部分简易判决、上诉中、和解结案

在看具体案件之前,必须先把四个状态词分清。中文报道里的绝大多数错误,都出在混用这四个词上。而它们的分量差得非常远。

状态英文大白话能不能当结论用生活类比
审理中pending案子还在打,没出结果完全不能。只能说「有人在争这件事」病人刚挂号进了诊室,还没出诊断
部分简易判决partial summary judgment法院就某几个争点先作出裁定,不需要等完整审判。但案子整体可能还没完要极其小心。它是真实的司法裁定,但只覆盖它明确处理的那几个争点体检报告先出了几项结果,其他项还在化验
上诉中on appeal一方不服,把案子交给上级法院重新审。上级法院可以维持、也可以推翻不能当定论。下级法院的裁定在上诉期间不构成有约束力的终局先例对第一家医院的诊断不服,去医院会诊或换院复查——结论可能被改
和解结案settlement / settled双方自己谈妥,法院不再作出「谁对谁错」的判断特别不能。和解通常不确立法律先例,也不代表任何一方承认自己错了两家因漏水吵起来,最后私下谈妥赔一笔钱了事——没有任何人被判定有责

「和解」这一行最容易被误读,值得再强调一次。很多报道会写成「某公司败诉赔了多少钱」,但和解和败诉在法律上是两件截然不同的事。打个比方停车场里两台车轻微擦碰,一方为了省事直接给对方几百块修车费——这不代表他承认自己全责,更不代表以后所有类似擦碰都要这么赔。说白了就是:和解是两个当事人之间的私了,不是给全社会定规矩。

「上诉中」这一行同样关键。下级法院的裁定在上诉期间是存在的、真实的,但它不是终局。把它当作「法律已经这么定了」来引用,是本节要澄清的最大误区之一。

五起代表性诉讼的真实状态(截至 2026-08-08)

下面逐一列。每一起都写清司法辖区、案号、当前状态。再次提醒:本文不构成法律建议。

第一起 · NYT v. OpenAI(纽约时报诉 OpenAI)

先解释一个术语:MDL(Multidistrict Litigation,「多地区诉讼合并」)说白了就是很多起原因相似的案子分散在各地法院,为了不重复劳动、不出互相矛盾的裁定,被集中到一个法院统一处理前期程序。相当于医院把同一种病的病人集中到一个专科病房——不是因为病更重,是为了统一诊疗流程。所以「合并成 MDL」不等于「案情严重程度升级」,它是一种程序安排。

第二起 · Authors Guild v. OpenAI(美国作家协会诉 OpenAI)

第三起 · Andersen v. Stability AI(艺术家诉 Stability AI 等)

「驳回动议」(motion to dismiss,MTD)也需要翻译一下其实就是被告在案子刚开始时说「原告这个诉讼连立起来的资格都没有,请法院直接扔掉」。法院驳回这个动议,意思只是「这个案子可以继续往下审」,绝不意味着「原告赢了」。相当于去医院挂号时医生说「你这个症状确实需要检查,去做个片子」——这不等于确诊。这一点非常容易被报道成「法院支持了艺术家」,但两者完全不是一回事。

第四起 ★ Thomson Reuters v. Ross Intelligence——本节最需要小心的一起

这一起被误传得最厉害。中文互联网上流传的说法是「法院已判决 AI 训练不构成合理使用,成为先例」。这个说法在两个关键点上错了。先把事实摆全:

那么错在哪里?两处:

流传的说法为什么错准确表述
「已判决 AI 训练不构成合理使用」状态错。那是地区法院的部分简易判决,而且该案目前在第三巡回上诉法院上诉中,尚未判决——上诉法院可以维持也可以推翻「地区法院于 2025-02-11 就合理使用作出了对原告有利的部分简易判决;该案现在第三巡回上诉法院上诉中,2026-06-11 已口头辩论,尚未判决
「已成为具有约束力的法律先例」效力错。正在上诉中的地区法院裁定不构成终局先例「该裁定尚未成为终局判决,不构成具有约束力的法律先例
「所以 AI 训练在美国是违法的」范围错。该案争的是 Ross 复制 Thomson Reuters 的判例摘要(headnotes)这一具体行为,不是对所有 AI 训练行为的一般性宣告「该案涉及的是特定内容(2243 条判例摘要)与特定使用方式的争议」

为什么这处澄清如此重要?因为它牵涉到一个关于法律的基本常识:一审结果和终审结果可以完全相反。打个比方:一场考试成绩公布后你申请复核,复核前那个分数当然是真实存在的,但它不是最终成绩。拿复核前的分数去印毕业证,就是搞错了阶段。

第五起 ★ Bartz v. Anthropic——这是和解,不是判决

请注意「和解」这个结案方式带来的三个后果:

所以看到「Anthropic 因版权案赔钱」这类表述时,准确的说法应该是:「该案以和解方式结案(2026-07-20 终止),法院未就实体争议作出判决,和解通常不确立法律先例。」

另外两起:本文未取得可靠状态 ★

为什么要专门写「未取得」?因为在法律话题上,一个凭记忆写出的案件状态,可能比不写更有害——读者会拿它当依据。本质上就是:宁可承认自己不知道,也不能给一个可能已经过期或压根错误的状态。这也是本站的一贯做法。

EU AI Act:一张必须看时间表的法规

欧盟那部人工智能法案(EU AI Act)在中文报道里被误传的方式非常典型:「已于 2024 年 8 月全面生效」。这句话错在「全面」两个字。

先把基本信息列全:

「生效」和「适用」这两个词的区别,是理解整件事的钥匙。打个比方:一栋新小区竣工验收通过(生效),但住户是分批交房的——一期先住,二期明年,三期后年(分阶段适用)。你不能因为看到「竣工验收通过」就说「所有人都已经搬进去了」。

完整的分阶段时间表如下(以 EUR-Lex 及欧盟委员会官方页面为准):

日期这一批开始适用什么大白话
2025-02-02被禁止的 AI 实践(prohibited AI practices,第 1–8 项)及 AI 素养义务先把「绝对不许干」的那几件事管起来
2025-08-02治理规则与通用目的 AI(GPAI)模型义务开始管那些「什么都能干」的大模型本身
2026-08-02透明度规则(含深度伪造标识义务);AI Office 与成员国执法机构开始运作这一条就在本文核实日的前几天——AI 生成内容的标识义务从这天起适用,执法机构也开始运转
2026 年 12 月第 9 项禁止实践:生成非自愿性色情 / 亲密内容或儿童性虐待材料的 AI 系统(如所谓「脱衣」类应用)AI Omnibus 修正案新增的一条
2027-12-02高风险 AI 系统(Annex III:生物识别、关键基础设施、教育、就业、移民等敏感领域)门槛最高的一批,给了最长的准备期
2028-08-02嵌入受监管产品里的高风险 AI 系统(Annex I,如电梯、玩具)需要与原有产品安全法规衔接,所以最晚

另外几条与版本相关的事实,值得记下来,因为它们能帮你判断你看到的资料新不新:

所以那个流传的说法该怎么改?准确表述是:「EU AI Act 于 2024-08-01 生效,采用分阶段适用方案:禁止性规则 2025-02-02、GPAI 规则 2025-08-02、透明度规则 2026-08-02、高风险 Annex III 延至 2027-12-02、高风险 Annex I 延至 2028-08-02。」

中国的两部规章:日期与要求

中文读者最该关心的其实是这两部,因为它们直接管到你在国内用的产品。

第一部 ·《生成式人工智能服务管理暂行办法》

第二部 ·《人工智能生成合成内容标识办法》

「显式标识」和「隐式标识」这对概念很值得掰开讲,因为它是理解 §13.4 深度伪造那一节的基础。

标识类型是什么谁能看到生活类比弱点
显式标识人眼能直接看到 / 人耳能直接听到的标记:画面角落的文字、开头的语音提示所有人,不需要任何工具包装盒外面印的「食品」字样与生产日期容易被裁掉、遮住、抹掉。一张图截个边就没了
隐式标识写在文件的元数据里,肉眼看不见,需要工具才能读出来需要软件读取面单背后的条码——你看不懂,但扫码枪能读转存、截图、重新编码时容易丢失。而且需要生态里的软件都支持读取

「元数据」(metadata)也顺手翻译一下:说白了就是「关于这个文件本身的信息」,比如拍摄时间、相机型号、软件版本——它跟着文件走,但不显示在画面上。相当于一本书的版权页:内容不在那一页上,但那一页告诉你这本书是谁出的、哪一年印的。

这里有一个非常实际的提醒:为什么规章要求同时做显式和隐式两种标识?因为这两种标识的弱点刚好互补——显式标识怕被裁被遮,隐式标识怕被转存丢掉。两个都做,才有可能在其中一种失效时另一种还在。本质上就是双重保险,跟快递单既印字又贴条码是同一个道理。

那么实操上该怎么办:一份可落地的清单

法律层面的不确定不代表你什么都做不了。下面这些做法在当前不确定性之下都是稳的。(再次提醒:以下为一般性的风险降低做法,不构成法律建议。)

三条容易搞混的线:输入端、输出端、和「生成物归谁」

看完前面这些案件,可能会有一个混乱感:大家到底在吵什么?其实所有争论都可以归到三条互相独立的线上,把它们分开就清楚了。

争论线问的是什么典型代表生活类比
输入端训练时复制他人作品,本身需不需要授权?这里争的是「学习这个动作」的合法性NYT v. OpenAI、Andersen v. Stability AI、Thomson Reuters v. Ross老师读了全校学生的作文才写出教材——「读」这一步要不要经过学生同意
输出端生成的东西如果跟某个原作高度相似,这一份算不算侵权?争的是结果,跟怎么训练无关各案中都可能涉及,但它是一个独立争点教材里有一段几乎照抄了某个学生的原文
归属线AI 生成的东西,著作权归谁?作者是人还是机器?能不能登记?这条线在各辖区的规则差异最大那本教材的署名该写老师、写学校、还是写「参考了三千篇作文」

这三条线在报道里经常被混着谈,于是造出很多似是而非的结论。比如「某案判了 AI 训练侵权,所以我用 AI 画的图不能商用」——这句话跨了两条线:前半句是输入端的争议(模型厂商与权利人之间的事),后半句是归属线(你和你的生成物之间的事)。说白了就是:楼上漏水的责任判定,跟你家门锁能不能换,压根是两件事。

关于归属线,本文必须诚实留白:「AI 生成内容的著作权归属」在不同辖区规则不同、且仍在演进,本次核实未取得一份可作为跨辖区结论的权威文本,因此本节不给任何一般性答案。能给的只有可操作的做法:看你实际使用的那个服务的条款(很多服务会在条款里明确写生成物的使用权归属),并保留创作过程记录。

顺带说一件有实践价值的事:「服务条款给你的使用权」和「著作权归属」也是两件不同的事。打个比方:你租的房子,房东给了你使用权(可以住、可以放家具),但产权证上不是你的名字。很多 AI 服务的条款给的是前者——「你可以把生成物用于商业用途」——这跟「你拥有这份内容的著作权」不是同一句话。看条款时要留意它到底说的是哪一个。

一个具体的隐患:把密钥和代码贴进对话框

这一节最后讲一个非常具体、发生频率却极高的风险,因为它把前面所有内容串起来了。

场景是这样的:程序员调试代码,随手把一整段配置文件贴进 AI 对话框问「这段哪里错了」。而那段配置里,常常带着数据库密码、云服务的访问密钥、第三方接口的令牌。

为什么这件事特别危险?把前面几块知识连起来看就明白了:

正确的做法非常简单,而且不牺牲任何便利:

这一小节想传达的其实是本节的整个态度:隐私风险不是通过「不用 AI」来规避的,是通过知道哪台机器会学习、以及贴进去之前先脱敏来管理的。说白了就是:菜刀不用扔,但递刀时要递刀柄。

容易被忽略的第四类输入:公司的内部资料

前面讲的密钥和代码是个人层面的风险,还有一类更高频、却更少被当回事的输入,叫组织内部资料——采购合同、产品路线图、未公开的财报数据、客户名单、内部演示稿。

很多人默认"反正我一个人用、也不会泄露",但问题不在"会不会被偷",而在它走了哪条管道把一份未公开的产品计划贴进一个数据可能用于训练、可能留存三十天的对话框,等于把战略决策的资料交到了你不了解其存储与使用规则的第三方手里。翻译成人话:你托一位聪明的朋友代打一份文件,你已经默许他把内容记得一清二楚,还不一定记得替你保密。

这里有一条相当清晰的判断线:如果这份资料泄露给竞争对手会带来实质伤害,那就不该进任何"可能训练"的产品线;要做到既能用又不掉链子,就走企业版/私有部署+脱敏。好比银行柜员接待大客户时:谈业务可以,但绝不把保险库的钥匙押在柜台上。

最后补一句免责与务实:本节的意图不是制造焦虑,而是帮你看清"我到底在用哪条管道、我贴进去的东西会走多远"这两件事。把管道选对、把敏感内容掐头去尾,绝大多数日常使用并不需要因此牺牲便利。

Recap · 这一节的收束

再声明一次:本文不构成法律建议。以下所有状态以 2026-08-08 为准,法律有辖区、案件状态会变。

技术事实先站住:训练数据真的能被掏出来。Carlini 等(arXiv 2012.07805,USENIX Security 2021,同行评议)证明可从 GPT-2 类模型提取训练数据含个人信息,机制是模型会记住罕见的重复多次的序列;Nasr 等(arXiv 2311.17035,预印本)把这套方法推到了生产级模型;成员推断攻击(arXiv 1610.05820,IEEE S&P 2017,同行评议)只需判断「这条数据在训练集里吗」,而在很多场合「你在这份名单里」本身就是敏感信息。

「我的输入会被拿去训练吗」的答案分产品线。OpenAI:消费级(ChatGPT Free/Plus/Team,ROW Terms 生效 2026-01-01)可能被用于训练;API 与企业产品(Enterprise Privacy 页面更新 2026-01-08)写明 We do not train our models on your data by default,API 数据自 2023-03-01 起默认不训练、保留最多 30 天、有零数据保留选项。Anthropic:商业产品默认不训练;消费级也不训练,但有两个例外——你主动举报材料、或明确选择加入。实操:在官方隐私页面搜 train / retention / opt-in 三个词。

四个法律状态词必须分清:审理中 / 部分简易判决 / 上诉中 / 和解结案。五起案件的真实状态:NYT v. OpenAI(S.D.N.Y.,合并入 In re OpenAI MDL No. 1:25-md-03143,2025-04-11 成立)——审理中Authors Guild v. OpenAI——已并入同一 MDL,审理中Andersen v. Stability AI(N.D. Cal., No. 3:23-cv-00201-WHO)——审理中,已有的 2023 与 2024 两项裁定均属程序阶段;Thomson Reuters v. Ross——地区法院 2025-02-11 部分简易判决(认定侵犯 2243 条判例摘要),但现在第三巡回上诉法院上诉中(No. 25-2153),2026-06-11 已辩论、尚未判决,不构成终局先例Bartz v. Anthropic(N.D. Cal., No. 3:24-cv-05417-AMO)——和解结案(2026-07-20 终止),不是判决,通常不确立先例Getty v. Stability AI 的美国与英国两案,本文均未取得最新状态,故不给状态描述。

EU AI Act(Regulation (EU) 2024/1689)分阶段适用:2024-08-01 生效 → 禁止性规则 2025-02-02 → GPAI 规则 2025-08-02 → 透明度规则(含深伪标识)2026-08-02 → 第 9 项禁止实践 2026 年 12 月 → 高风险 Annex III 2027-12-02 → 高风险 Annex I 2028-08-02。AI Omnibus 修正案 2026-07-27 生效,当前合并版本日期为 2026-07-27。「已于 2024 年 8 月全面生效」是错的,错在「全面」。

中国两部规章:《生成式人工智能服务管理暂行办法》(七部门,网信办令第 15 号)2023-08-15 生效;《人工智能生成合成内容标识办法》(国信办通字〔2025〕2 号,2025-03-07 发布)2025-09-01 生效,要求显式标识 + 隐式标识(元数据)并行——两者弱点互补:显式怕被裁被遮,隐式怕转存丢失。

能做的事:先分清产品线;写一张「绝对不贴」的清单;先脱敏再提问(人名公司名换占位符);商用前看清你实际使用的那个服务的条款并留截图与日期;保留创作过程记录(提示词、时间、版本、你改了什么);别照搬别国判例判断自己的行为;标识义务已经在生效,不是未来的事;高价值场景咨询你所在辖区的执业律师。

☰ 主页
学海无涯 · 智能篇 · § 13.3