隐私与版权
这一节回答两个几乎每个用 AI 干活的人都撞过的问题:我贴进对话框的公司资料,会不会被拿去训练下一代模型?以及它生成的东西,我能不能拿去商用?第一个问题有明确答案,而且答案取决于你用的是消费级产品还是 API——官方文档里写得很清楚,只是绝大多数人没去看。第二个问题目前没有全球统一答案,正在各地法院里打。本节会把五起代表性诉讼的司法辖区与当前状态逐一列清,特别澄清两处流传最广的错误:一起还在上诉中的案子被说成了「已定论」,一起和解被说成了「判决」。另外会摊开 EU AI Act 的分阶段时间表和中国两部规章的生效日期。本节涉及大量法律信息,请先读下面那条声明。
本文不构成法律建议。下面所有内容都只是截至 2026 年 8 月 8 日的公开司法记录与官方法律文本的转述,目的是帮你理解争议的焦点在哪里、以及案件走到了哪一步,绝不能作为任何具体行为是否合法的判断依据。
三点特别提醒:第一,法律有辖区——美国某个联邦地区法院的裁定对英国、对欧盟、对中国都没有约束力。第二,案件状态随时变化——本节给的每个状态都带核实日期,读到这段时可能已经变了。第三,地区法院的裁定不等于终局判决,上诉法院可以推翻它。真要做决定,请咨询你所在辖区的执业律师。
想象银行大厅里有一台特别的复印机。它不只是复印,还会「学习」——每份经过它的文件,它都读一遍,用来提高自己的识字能力。厂家说这样机器越用越聪明。
你拿着一份合同去复印。这时候你会自然而然地问出两个问题,而这两个问题正好就是这一节的全部内容:
问题一:我这份合同的内容,会不会被它记住?更要命的是,会不会哪天别人来复印东西,机器「顺口」把我合同里的条款吐出来一段?——这就是「训练数据泄露」,而且它确实被实验证明过。
问题二:这台机器读了几百万份别人的文件才变得这么聪明,那些文件的主人同意了吗?它现在写出来的东西,算它的、算厂家的、还是算那些原作者的?——这就是版权争议的全部内核。
还有一个容易被忽略的第三层:这台机器可能有好几个型号。大厅里给公众用的那台默认会学习,而银行内部业务柜台那台,合同上写明了不学习。说白了就是:同一个厂家、同一项技术,不同产品线的规则可能完全不同——而这正是「我的数据会不会被拿去训练」这个问题的真实答案形状。
先讲最硬的技术事实:训练数据真的能被「掏」出来
「模型会不会记住训练数据」这个问题不需要靠猜,有实验做过,而且是很硬的实验。
第一项工作:Carlini 等,标题 Extracting Training Data from Large Language Models(从大语言模型中提取训练数据),arXiv 2012.07805,首版 2020-12-14,第二版 2021-06-15。状态:已发表于 USENIX Security 2021,经同行评议。USENIX Security 是计算机安全领域顶级会议之一,这一点让这项结论的分量很不一样。
它证明了什么:可以从 GPT-2 这类模型中把训练数据提取出来,包括个人身份信息。机制是——模型会记住那些「罕见的」或者「重复出现过多次的」序列,而这些序列可以被有效地引导出来。
这两个条件值得分开体会,因为它们对应两种完全不同的现实风险:
- 「罕见」为什么会被记住因为独特的东西没法靠规律推出来,只能死记。打个比方:你能记住「一年有十二个月」是因为它是规律,你记住某个朋友的手机号则纯靠硬记。一串随机的身份证号、私钥、API 密钥,对模型来说恰恰属于「必须死记」那一类——这就是为什么把密钥误提交到公开代码仓库特别危险。
- 「重复多次」为什么会被记住相当于一首你听过几百遍的歌,前两个字一出来后面就自动跟上了。数据里出现过很多次的段落,模型会形成非常强的接续倾向,给个开头就能把整段带出来。
第二项工作把这件事推到了生产级模型上:Nasr 等,标题 Scalable Extraction of Training Data from (Production) Language Models(对(生产级)语言模型的可扩展训练数据提取),arXiv 2311.17035,发布 2023-11-28。状态:arXiv 预印本,本文未取得其同行评议记录。
它的贡献是把提取攻击的方法扩展到了实际部署的产品(论文中包括 ChatGPT)上,说明这不只是实验室里小模型的现象。但状态要如实标注:预印本。
第三个必须知道的概念是成员推断攻击(Membership Inference Attack,简称 MIA)。说白了就是:攻击者不试图把整段内容掏出来,只想判断「某一条特定的数据,有没有被用来训练过这个模型」。
经典出处:Shokri 等,标题 Membership Inference Attacks Against Machine Learning Models,arXiv 1610.05820,首版 2016-10-18,已发表于 IEEE S&P 2017(另一个安全顶会),经同行评议。
为什么「只判断有没有用过」也算严重的隐私问题?因为在很多场合,「你在这份名单里」本身就是敏感信息。打个比方:某医院用某种罕见病患者的病历训练了一个模型。如果攻击者能判断出「张三的病历在训练集里」,那他实际上就推出了「张三患这个病」——哪怕他一个字的病历内容都没拿到。这就是成员推断的危害所在。
| 攻击类型 | 出处与状态 | 攻击者想得到什么 | 生活类比 |
|---|---|---|---|
| 训练数据提取 | arXiv 2012.07805 · USENIX Security 2021,同行评议 | 原文内容本身——把训练数据里的段落、密钥、个人信息掏出来 | 把复印机内部残留的旧文件影像找出来看 |
| 生产级模型提取 | arXiv 2311.17035 · arXiv 预印本 | 同上,但目标是实际上线的产品 | 不只是实验室样机,商场里那台也能被掏 |
| 成员推断(MIA) | arXiv 1610.05820 · IEEE S&P 2017,同行评议 | 只要一个是非判断:这条数据在训练集里吗 | 不看病历内容,只确认「这个人是不是那家专科医院的病人」 |
那么普通用户该记住什么?一条就够:凡是你不愿意被任何第三方看到的内容,就不要贴进任何默认会用于训练的产品里。这包括身份证号、密钥、未公开的合同条款、患者信息、客户名单。本质上就是:一份文件一旦进了那台会学习的复印机,你就失去了对它的完全控制——所以关键在于先搞清哪台机器会学习,这正是下一节的内容。
你的输入会被拿去训练吗?看官方文档,分产品线
这是本节最实用、也最容易被误传的一块。中文互联网上流传的说法通常是一句笼统的「AI 公司都在用你的数据训练」,但官方文档里的答案是分产品线的,而且差别很大。
先说 OpenAI,按产品线分开列:
- 消费级产品(ChatGPT Free / Plus / Team)按 OpenAI 的 ROW Terms of Use(生效日 2026-01-01),用户输入可能被用于模型训练。说白了就是:大厅里那台公用复印机,默认是会学习的。
- API 及企业产品(API / Business / Enterprise / Edu / Healthcare)OpenAI 的 Enterprise Privacy 页面(更新日 2026 年 1 月 8 日)明确写着:We do not train our models on your data by default.(我们默认不用你的数据训练模型。)另外几个具体条款:API 数据自 2023-03-01 起默认不用于训练;API 数据保留最多 30 天;提供零数据保留(ZDR,Zero Data Retention)选项。
再说 Anthropic,同样分两条:
- 商业产品(Commercial)其隐私说明文章(编号 7996868)原文:By default, we will not use your inputs or outputs from our commercial products to train our models.(默认情况下,我们不会用你在我们商业产品中的输入或输出来训练模型。)
- 消费级产品(Consumer)其隐私说明文章(编号 10023580)原文:We will not use your Inputs or Outputs to train our generative models (i.e. Claude), unless you've explicitly reported the materials to us... or you've explicitly opted in to training.(我们不会用你的输入或输出训练我们的生成模型即 Claude,除非你明确向我们举报了相关材料……或者你明确选择加入训练。)注意这里的两个例外条件——「你主动举报了内容」和「你主动勾选了同意」。
这两家的政策放在一起,能看出一条很清晰的产业规律:面向企业和开发者的产品线普遍承诺默认不训练,因为企业客户会把这一条写进采购合同;而免费或个人订阅的消费级产品,策略各家不同,必须逐个去看条款。
相当于去银行办业务:柜台给你签的合同里保密条款写得密密麻麻,而大厅里那台自助机的使用须知你从来没点开看过。不是银行故意骗你,是这两个场景的商业约束强度不同。
所以一条最实用的操作建议:在把公司或客户资料贴进任何 AI 产品之前,先去它的官方隐私页面搜三个关键词:train(训练)、retention(保留)、opt-in / opt-out(选择加入 / 退出)。这三个词能带你找到 90% 需要知道的信息。而且要注意看你用的是哪个产品线——同一家公司的答案可能完全相反。
版权这件事之所以吵得这么厉害,可以用一个校园里的场景一次讲透。
假设有一所学校要编一本作文教材。老师做了这么一件事:把过去十年所有学生的作文都读了一遍,然后写出一本《怎么写好作文》。书里没有原文照搬任何一篇学生作文,但它总结出的所有技巧、句式、结构,全都来自读那些作文的过程。
现在请你判断三个问题,你会发现每一个问题都能argue出两种都不荒谬的答案——这正是版权诉讼的真实处境:
问题一:老师「读」这些作文,需要事先取得授权吗?支持方说:读书学习本来就不需要授权,人类作家也是读了几百本书才会写的。反对方说:这不是「读」,这是系统性地复制了全部内容进机器,而且是为了做一个商业产品。
问题二:如果这本教材出版后卖得很好,抢了原来那些学生自己出书的市场,算不算损害?这一问在法律上有个专门的位置——「合理使用」判断里通常要看「对原作品市场的影响」。如果新东西替代了原作品的市场,天平就会倾斜。
问题三:如果这本教材写出来的一段话,几乎和某个学生的原文一模一样,那这段算侵权吗?——注意,这一问和前两问性质完全不同。前两问吵的是「学习过程本身合不合法」,这一问吵的是「输出结果是否复制了原文」。这两条线在真实诉讼里经常被混着谈,但它们是两个独立的争点。
本质上就是:所有 AI 版权诉讼都在这三个问题上打转——输入端的复制、市场替代、输出端的相似度。你记住这三条线,看任何一起案件的报道都不会看晕。
先学四个词:审理中、部分简易判决、上诉中、和解结案
在看具体案件之前,必须先把四个状态词分清。中文报道里的绝大多数错误,都出在混用这四个词上。而它们的分量差得非常远。
| 状态 | 英文 | 大白话 | 能不能当结论用 | 生活类比 |
|---|---|---|---|---|
| 审理中 | pending | 案子还在打,没出结果 | 完全不能。只能说「有人在争这件事」 | 病人刚挂号进了诊室,还没出诊断 |
| 部分简易判决 | partial summary judgment | 法院就某几个争点先作出裁定,不需要等完整审判。但案子整体可能还没完 | 要极其小心。它是真实的司法裁定,但只覆盖它明确处理的那几个争点 | 体检报告先出了几项结果,其他项还在化验 |
| 上诉中 | on appeal | 一方不服,把案子交给上级法院重新审。上级法院可以维持、也可以推翻 | 不能当定论。下级法院的裁定在上诉期间不构成有约束力的终局先例 | 对第一家医院的诊断不服,去医院会诊或换院复查——结论可能被改 |
| 和解结案 | settlement / settled | 双方自己谈妥,法院不再作出「谁对谁错」的判断 | 特别不能。和解通常不确立法律先例,也不代表任何一方承认自己错了 | 两家因漏水吵起来,最后私下谈妥赔一笔钱了事——没有任何人被判定有责 |
「和解」这一行最容易被误读,值得再强调一次。很多报道会写成「某公司败诉赔了多少钱」,但和解和败诉在法律上是两件截然不同的事。打个比方:停车场里两台车轻微擦碰,一方为了省事直接给对方几百块修车费——这不代表他承认自己全责,更不代表以后所有类似擦碰都要这么赔。说白了就是:和解是两个当事人之间的私了,不是给全社会定规矩。
「上诉中」这一行同样关键。下级法院的裁定在上诉期间是存在的、真实的,但它不是终局。把它当作「法律已经这么定了」来引用,是本节要澄清的最大误区之一。
五起代表性诉讼的真实状态(截至 2026-08-08)
下面逐一列。每一起都写清司法辖区、案号、当前状态。再次提醒:本文不构成法律建议。
第一起 · NYT v. OpenAI(纽约时报诉 OpenAI)
- 司法辖区美国纽约南区联邦地区法院(S.D.N.Y.)
- 案件编号已合并入 In re OpenAI, Inc. Copyright Infringement Litigation,编号 No. 1:25-md-03143
- 当前状态审理中(pending)。该 MDL 于 2025-04-11 成立,主审法官 Sidney H. Stein,治安法官 Ona T. Wang 辅助。合并了纽约时报、Microsoft、Authors Guild、Ziff Davis、The Intercept、Raw Story、Center for Investigative Reporting 等多家原告的诉讼。
先解释一个术语:MDL(Multidistrict Litigation,「多地区诉讼合并」)说白了就是:很多起原因相似的案子分散在各地法院,为了不重复劳动、不出互相矛盾的裁定,被集中到一个法院统一处理前期程序。相当于医院把同一种病的病人集中到一个专科病房——不是因为病更重,是为了统一诊疗流程。所以「合并成 MDL」不等于「案情严重程度升级」,它是一种程序安排。
第二起 · Authors Guild v. OpenAI(美国作家协会诉 OpenAI)
- 司法辖区美国纽约南区联邦地区法院(S.D.N.Y.)
- 当前状态已合并入上面那个 In re OpenAI MDL(1:25-md-03143),审理中(pending)。
第三起 · Andersen v. Stability AI(艺术家诉 Stability AI 等)
- 司法辖区美国加州北区联邦地区法院(N.D. Cal.)
- 案件编号No. 3:23-cv-00201-WHO,主审法官 William H. Orrick
- 当前状态审理中(pending)。2026 年仍有与证据发现程序(discovery)相关的裁决(2026 WL 1257935, at *3 (N.D. Cal.))。
- 已作出的裁决700 F. Supp. 3d 853 (N.D. Cal. 2023)——对驳回动议(MTD)的裁定;744 F. Supp. 3d 956 (N.D. Cal. 2024)——对修改后诉状的裁定。这两项都是程序性阶段的裁定,不是对「AI 训练是否构成侵权」的终局实体判决。
「驳回动议」(motion to dismiss,MTD)也需要翻译一下:其实就是被告在案子刚开始时说「原告这个诉讼连立起来的资格都没有,请法院直接扔掉」。法院驳回这个动议,意思只是「这个案子可以继续往下审」,绝不意味着「原告赢了」。相当于去医院挂号时医生说「你这个症状确实需要检查,去做个片子」——这不等于确诊。这一点非常容易被报道成「法院支持了艺术家」,但两者完全不是一回事。
第四起 ★ Thomson Reuters v. Ross Intelligence——本节最需要小心的一起
这一起被误传得最厉害。中文互联网上流传的说法是「法院已判决 AI 训练不构成合理使用,成为先例」。这个说法在两个关键点上错了。先把事实摆全:
- 司法辖区一审在美国特拉华联邦地区法院(D. Del.),案号 No. 1:20-cv-613-SB;现已上诉至美国第三巡回上诉法院(3rd Cir.)
- 法官Stephanos Bibas——他本人是第三巡回上诉法院法官,被指定审理这起地区法院案件
- 2025 年那份裁定的内容2025-02-11,Bibas 法官签署备忘录意见(Document 770),修订了他 2023 年的意见。裁定原文:I now (1) grant most of Thomson Reuters's motion for partial summary judgment on direct copyright infringement and related defenses...; (2) grant Thomson Reuters's motion for partial summary judgment on fair use...; (3) deny Ross's motion for summary judgment on fair use...; and (4) deny Ross's motion for summary judgment on Thomson Reuters's copyright claims.另有认定:Ross infringed 2,243 headnotes.(Ross 侵犯了 2243 条判例摘要。)以及 Ross's innocent infringement, copyright misuse, merger, and scenes a faire defenses all fail.(Ross 的善意侵权、版权滥用、合并原则与必要场景等抗辩全部不成立。)
- 当前状态 ★★上诉中(on appeal),尚未判决。第三巡回上诉法院案号 No. 25-2153,2026-06-11 已进行口头辩论,至本文核实日(2026-08-08)尚未作出判决。另外,依 §1292(b) 提出的中间上诉许可已于 2025-05-23 获批(3rd Cir. No. 25-8018)。
- 参与规模大量「法庭之友」(amicus curiae,指非当事方向法院提交意见的第三方)参与,包括 EFF、Public Knowledge、Copyright Alliance、RIAA、MPA、Disney、Warner Bros、Sony Pictures、Paramount、Universal City Studios、News Media Alliance、AAP、Authors Alliance、Internet Archive、Public.Resource.Org 等。这个名单本身就说明了各方对结果的重视程度。
那么错在哪里?两处:
| 流传的说法 | 为什么错 | 准确表述 |
|---|---|---|
| 「已判决 AI 训练不构成合理使用」 | 状态错。那是地区法院的部分简易判决,而且该案目前在第三巡回上诉法院上诉中,尚未判决——上诉法院可以维持也可以推翻 | 「地区法院于 2025-02-11 就合理使用作出了对原告有利的部分简易判决;该案现在第三巡回上诉法院上诉中,2026-06-11 已口头辩论,尚未判决」 |
| 「已成为具有约束力的法律先例」 | 效力错。正在上诉中的地区法院裁定不构成终局先例 | 「该裁定尚未成为终局判决,不构成具有约束力的法律先例」 |
| 「所以 AI 训练在美国是违法的」 | 范围错。该案争的是 Ross 复制 Thomson Reuters 的判例摘要(headnotes)这一具体行为,不是对所有 AI 训练行为的一般性宣告 | 「该案涉及的是特定内容(2243 条判例摘要)与特定使用方式的争议」 |
为什么这处澄清如此重要?因为它牵涉到一个关于法律的基本常识:一审结果和终审结果可以完全相反。打个比方:一场考试成绩公布后你申请复核,复核前那个分数当然是真实存在的,但它不是最终成绩。拿复核前的分数去印毕业证,就是搞错了阶段。
第五起 ★ Bartz v. Anthropic——这是和解,不是判决
- 司法辖区美国加州北区联邦地区法院(N.D. Cal.)
- 案件编号No. 3:24-cv-05417-AMO(原编号 No. 4:24-cv-05417)
- 当前状态 ★已结案(terminated),终止日期 2026-07-20。结案方式是「和解」,不是判决。案件于 2024-08-19 提起,最初由 William Alsup 法官主审,后转至 Araceli Martinez-Olguin 法官。
- 和解信息官方和解网站
anthropiccopyrightsettlement.com,由 JND Legal Administration 管理。初步和解(preliminarily approved settlement)已获法院批准。三个关键期限均已过期:索赔截止 2026-03-30、选择退出 / 反对截止 2026-02-09、重新纳入截止 2026-03-09。
请注意「和解」这个结案方式带来的三个后果:
- 一 · 法院没有对「谁对谁错」下判断和解的本质是双方自己谈妥。说白了就是:法官没有说「AI 训练侵权」,也没有说「不侵权」。这个案子在实体法律问题上没有留下答案。
- 二 · 通常不确立先例和解协议约束的是当事双方,不给其他人定规矩。所以不能说「因为这起和解,以后类似情况都得这么办」。
- 三 · 不构成任何一方的责任承认和解可以出于纯商业考虑——比如诉讼成本太高、不确定性太大、想尽快结束。相当于两家小区邻居为漏水扯了半年,最后一方说「我出钱修,咱别耗了」,这跟他承认自己有责是两件事。
所以看到「Anthropic 因版权案赔钱」这类表述时,准确的说法应该是:「该案以和解方式结案(2026-07-20 终止),法院未就实体争议作出判决,和解通常不确立法律先例。」
另外两起:本文未取得可靠状态 ★
- Getty v. Stability AI(美国)司法辖区为美国特拉华联邦地区法院(D. Del.)。★ 本文未取得该案完整独立 docket(法院案卷)记录的最新状态,因此不给任何状态描述。
- Getty v. Stability AI(英国)司法辖区为英格兰及威尔士高等法院(High Court of England and Wales)。★ 本文未取得英国法院的最新状态,因此不给任何状态描述。顺带一说:这两起虽然原告与被告名字相同,但辖区不同、适用法律不同,结论不能互相搬用。英国版权法与美国版权法在「合理使用 / 合理处理」上的框架本身就不一样。
为什么要专门写「未取得」?因为在法律话题上,一个凭记忆写出的案件状态,可能比不写更有害——读者会拿它当依据。本质上就是:宁可承认自己不知道,也不能给一个可能已经过期或压根错误的状态。这也是本站的一贯做法。
EU AI Act:一张必须看时间表的法规
欧盟那部人工智能法案(EU AI Act)在中文报道里被误传的方式非常典型:「已于 2024 年 8 月全面生效」。这句话错在「全面」两个字。
先把基本信息列全:
- 法规编号Regulation (EU) 2024/1689(出处:EUR-Lex,CELEX 号 32024R1689;以及欧盟委员会
digital-strategy.ec.europa.eu) - 通过日期2024-06-13
- 官方公报发布2024-07-12
- 生效日期(entered into force)2024-08-01
- 全面适用日期(became applicable)2026-08-02
「生效」和「适用」这两个词的区别,是理解整件事的钥匙。打个比方:一栋新小区竣工验收通过(生效),但住户是分批交房的——一期先住,二期明年,三期后年(分阶段适用)。你不能因为看到「竣工验收通过」就说「所有人都已经搬进去了」。
完整的分阶段时间表如下(以 EUR-Lex 及欧盟委员会官方页面为准):
| 日期 | 这一批开始适用什么 | 大白话 |
|---|---|---|
| 2025-02-02 | 被禁止的 AI 实践(prohibited AI practices,第 1–8 项)及 AI 素养义务 | 先把「绝对不许干」的那几件事管起来 |
| 2025-08-02 | 治理规则与通用目的 AI(GPAI)模型义务 | 开始管那些「什么都能干」的大模型本身 |
| 2026-08-02 | 透明度规则(含深度伪造标识义务);AI Office 与成员国执法机构开始运作 | 这一条就在本文核实日的前几天——AI 生成内容的标识义务从这天起适用,执法机构也开始运转 |
| 2026 年 12 月 | 第 9 项禁止实践:生成非自愿性色情 / 亲密内容或儿童性虐待材料的 AI 系统(如所谓「脱衣」类应用) | 由 AI Omnibus 修正案新增的一条 |
| 2027-12-02 | 高风险 AI 系统(Annex III:生物识别、关键基础设施、教育、就业、移民等敏感领域) | 门槛最高的一批,给了最长的准备期 |
| 2028-08-02 | 嵌入受监管产品里的高风险 AI 系统(Annex I,如电梯、玩具) | 需要与原有产品安全法规衔接,所以最晚 |
另外几条与版本相关的事实,值得记下来,因为它们能帮你判断你看到的资料新不新:
- AI Omnibus 修正案2025-11-19 通过,2026-05-07 达成政治协议,2026-07-27 生效(官方公报 OJ:L_202601744)。
- 当前合并版本日期EUR-Lex 显示 Current consolidated version: 27/07/2026。「合并版本」(consolidated version)说白了就是把原文和后来所有修正整合成的一份现行完整文本——相当于一本教材的最新修订版,而不是初版加一堆勘误表。
- 官方配套指南透明度义务指南于 2026-07-20 发布;AI 生成内容标识的行为准则(自愿性)与 EU 图标集也已发布。注意「自愿性」这个词——行为准则和法律义务的强制力不同。
所以那个流传的说法该怎么改?准确表述是:「EU AI Act 于 2024-08-01 生效,采用分阶段适用方案:禁止性规则 2025-02-02、GPAI 规则 2025-08-02、透明度规则 2026-08-02、高风险 Annex III 延至 2027-12-02、高风险 Annex I 延至 2028-08-02。」
中国的两部规章:日期与要求
中文读者最该关心的其实是这两部,因为它们直接管到你在国内用的产品。
第一部 ·《生成式人工智能服务管理暂行办法》
- 发布机关国家互联网信息办公室等七部门
- 官方编号国家互联网信息办公室令第 15 号
- 生效日期2023-08-15
第二部 ·《人工智能生成合成内容标识办法》
- 发布机关国家互联网信息办公室
- 发布日期与文号2025-03-07,国信办通字〔2025〕2 号
- 生效日期2025-09-01
- 核心要求AI 生成合成内容应当进行显式标识(如文字标注、语音提示、显著标识等)和隐式标识(通过元数据等方式)。服务提供者应在生成内容的文件元数据中添加隐式标识。
「显式标识」和「隐式标识」这对概念很值得掰开讲,因为它是理解 §13.4 深度伪造那一节的基础。
| 标识类型 | 是什么 | 谁能看到 | 生活类比 | 弱点 |
|---|---|---|---|---|
| 显式标识 | 人眼能直接看到 / 人耳能直接听到的标记:画面角落的文字、开头的语音提示 | 所有人,不需要任何工具 | 包装盒外面印的「食品」字样与生产日期 | 容易被裁掉、遮住、抹掉。一张图截个边就没了 |
| 隐式标识 | 写在文件的元数据里,肉眼看不见,需要工具才能读出来 | 需要软件读取 | 快递面单背后的条码——你看不懂,但扫码枪能读 | 转存、截图、重新编码时容易丢失。而且需要生态里的软件都支持读取 |
「元数据」(metadata)也顺手翻译一下:说白了就是「关于这个文件本身的信息」,比如拍摄时间、相机型号、软件版本——它跟着文件走,但不显示在画面上。相当于一本书的版权页:内容不在那一页上,但那一页告诉你这本书是谁出的、哪一年印的。
这里有一个非常实际的提醒:为什么规章要求同时做显式和隐式两种标识?因为这两种标识的弱点刚好互补——显式标识怕被裁被遮,隐式标识怕被转存丢掉。两个都做,才有可能在其中一种失效时另一种还在。本质上就是双重保险,跟快递单既印字又贴条码是同一个道理。
那么实操上该怎么办:一份可落地的清单
法律层面的不确定不代表你什么都做不了。下面这些做法在当前不确定性之下都是稳的。(再次提醒:以下为一般性的风险降低做法,不构成法律建议。)
- 一 · 先分清你用的是哪条产品线这是本节最实用的一条。企业版 / API 与消费级产品的默认数据策略可能完全相反。把敏感资料贴进去之前,去官方隐私页面搜 train / retention / opt-in 三个词。五分钟的功夫,能省掉一场事故。
- 二 · 建立「什么绝对不贴」的清单身份证号与护照号、银行卡与账户信息、密钥与密码、患者与客户的可识别信息、未公开的合同条款、未公开的财务数据。相当于厨房里那张「这几样东西不能进洗碗机」的清单——事先写下来,就不用每次临时判断。
- 三 · 先脱敏再提问很多时候你需要的只是「帮我改这段合同的措辞」,不需要模型知道甲方是谁。把人名、公司名、金额换成占位符(甲方、A 公司、X 元),处理完再替换回来。说白了就是:去医院挂号问一个病症的处理办法,不必把全家人的身份证都递过去。
- 四 · 商业用途的生成物,看清你用的那个服务的条款「AI 生成的东西能不能商用」这个问题在不同产品、不同订阅档位、不同辖区下答案可能不同,而且法律层面仍在演进。唯一稳的做法是去看你实际使用的那个服务的使用条款,并保留截图与日期。
- 五 · 保留创作过程记录留下提示词、生成时间、所用服务与版本、以及你自己后续做了哪些修改。相当于装修留下施工记录和材料清单——真出纠纷时,能证明「哪部分是我做的」比事后回忆强得多。
- 六 · 别照搬别国判例来判断自己的行为美国某地区法院的一个裁定,对你所在辖区没有约束力。而且那个裁定本身可能还在上诉中(Thomson Reuters v. Ross 就是活生生的例子)。本质上就是:隔壁小区的物业规定管不到你家。
- 七 · 关注标识义务,因为它已经在生效中国《人工智能生成合成内容标识办法》2025-09-01 已生效,EU AI Act 的透明度规则2026-08-02 已适用。这两条已经不是「未来的规定」,而是当下的义务。如果你在做产品或者发布内容,这是最需要立刻核对的一条。
- 八 · 高价值场景请咨询执业律师如果一件事的金额或后果足够大,那么咨询你所在辖区的执业律师的成本,一定远低于判断失误的成本。这一节能给你的最大帮助是「让你知道该问什么问题」,而不是替你回答。
三条容易搞混的线:输入端、输出端、和「生成物归谁」
看完前面这些案件,可能会有一个混乱感:大家到底在吵什么?其实所有争论都可以归到三条互相独立的线上,把它们分开就清楚了。
| 争论线 | 问的是什么 | 典型代表 | 生活类比 |
|---|---|---|---|
| 输入端 | 训练时复制他人作品,本身需不需要授权?这里争的是「学习这个动作」的合法性 | NYT v. OpenAI、Andersen v. Stability AI、Thomson Reuters v. Ross | 老师读了全校学生的作文才写出教材——「读」这一步要不要经过学生同意 |
| 输出端 | 生成的东西如果跟某个原作高度相似,这一份算不算侵权?争的是结果,跟怎么训练无关 | 各案中都可能涉及,但它是一个独立争点 | 教材里有一段几乎照抄了某个学生的原文 |
| 归属线 | AI 生成的东西,著作权归谁?作者是人还是机器?能不能登记? | 这条线在各辖区的规则差异最大 | 那本教材的署名该写老师、写学校、还是写「参考了三千篇作文」 |
这三条线在报道里经常被混着谈,于是造出很多似是而非的结论。比如「某案判了 AI 训练侵权,所以我用 AI 画的图不能商用」——这句话跨了两条线:前半句是输入端的争议(模型厂商与权利人之间的事),后半句是归属线(你和你的生成物之间的事)。说白了就是:楼上漏水的责任判定,跟你家门锁能不能换,压根是两件事。
关于归属线,本文必须诚实留白:「AI 生成内容的著作权归属」在不同辖区规则不同、且仍在演进,本次核实未取得一份可作为跨辖区结论的权威文本,因此本节不给任何一般性答案。能给的只有可操作的做法:看你实际使用的那个服务的条款(很多服务会在条款里明确写生成物的使用权归属),并保留创作过程记录。
顺带说一件有实践价值的事:「服务条款给你的使用权」和「著作权归属」也是两件不同的事。打个比方:你租的房子,房东给了你使用权(可以住、可以放家具),但产权证上不是你的名字。很多 AI 服务的条款给的是前者——「你可以把生成物用于商业用途」——这跟「你拥有这份内容的著作权」不是同一句话。看条款时要留意它到底说的是哪一个。
一个具体的隐患:把密钥和代码贴进对话框
这一节最后讲一个非常具体、发生频率却极高的风险,因为它把前面所有内容串起来了。
场景是这样的:程序员调试代码,随手把一整段配置文件贴进 AI 对话框问「这段哪里错了」。而那段配置里,常常带着数据库密码、云服务的访问密钥、第三方接口的令牌。
为什么这件事特别危险?把前面几块知识连起来看就明白了:
- 第一层 · 密钥恰好属于「最容易被记住」的那一类回想 arXiv 2012.07805 的结论:模型会记住罕见的序列。而一串随机密钥恰恰是「没有任何规律、只能死记」的典型。它不像一句常见的话可以靠语法推出来,它必须被硬记,所以它更可能被记住。
- 第二层 · 你可能用的正是那条会训练的产品线如果你用的是消费级订阅而不是企业版或 API,那按官方条款,你的输入可能进入训练流程。说白了就是:你以为在跟一个私人助理说话,实际上可能是在往一个公共教材里投稿。
- 第三层 · 泄露的后果不可撤回密码可以改,但「这段密钥曾经出现在哪里」这件事没法撤回。相当于把家门钥匙的照片发到群里——你可以立刻换锁,但那张照片已经存在于别人的手机里了。
正确的做法非常简单,而且不牺牲任何便利:
- 贴代码前先把密钥换成占位符改成
YOUR_API_KEY、<DB_PASSWORD>这类明显的假值。模型帮你排查语法和逻辑压根不需要真实的密钥值。 - 贴数据前先把可识别信息换掉真实姓名换成「用户 A」,手机号换成
13800000000,身份证号换成同长度的占位串。相当于医院做教学病例讨论时会把患者姓名遮掉——诊断照样能讨论,隐私保住了。 - 团队要有明文规定,别靠个人自觉写进开发规范里:哪些内容不得贴入外部 AI 工具。本质上就是厨房贴一张「生熟分开」的告示——靠制度比靠每次都想起来可靠得多。
- 如果确实需要处理真实敏感数据,走企业版或私有部署这就回到本节第二块内容了:不同产品线的默认策略不同。企业版通常提供「默认不训练」「限定数据保留期」「零数据保留选项」这些合同层面的保障。选对产品线,比事后补救有效得多。
这一小节想传达的其实是本节的整个态度:隐私风险不是通过「不用 AI」来规避的,是通过知道哪台机器会学习、以及贴进去之前先脱敏来管理的。说白了就是:菜刀不用扔,但递刀时要递刀柄。
容易被忽略的第四类输入:公司的内部资料
前面讲的密钥和代码是个人层面的风险,还有一类更高频、却更少被当回事的输入,叫组织内部资料——采购合同、产品路线图、未公开的财报数据、客户名单、内部演示稿。
很多人默认"反正我一个人用、也不会泄露",但问题不在"会不会被偷",而在它走了哪条管道。把一份未公开的产品计划贴进一个数据可能用于训练、可能留存三十天的对话框,等于把战略决策的资料交到了你不了解其存储与使用规则的第三方手里。翻译成人话:你托一位聪明的朋友代打一份文件,你已经默许他把内容记得一清二楚,还不一定记得替你保密。
这里有一条相当清晰的判断线:如果这份资料泄露给竞争对手会带来实质伤害,那就不该进任何"可能训练"的产品线;要做到既能用又不掉链子,就走企业版/私有部署+脱敏。好比银行柜员接待大客户时:谈业务可以,但绝不把保险库的钥匙押在柜台上。
最后补一句免责与务实:本节的意图不是制造焦虑,而是帮你看清"我到底在用哪条管道、我贴进去的东西会走多远"这两件事。把管道选对、把敏感内容掐头去尾,绝大多数日常使用并不需要因此牺牲便利。
再声明一次:本文不构成法律建议。以下所有状态以 2026-08-08 为准,法律有辖区、案件状态会变。
技术事实先站住:训练数据真的能被掏出来。Carlini 等(arXiv 2012.07805,USENIX Security 2021,同行评议)证明可从 GPT-2 类模型提取训练数据含个人信息,机制是模型会记住罕见的或重复多次的序列;Nasr 等(arXiv 2311.17035,预印本)把这套方法推到了生产级模型;成员推断攻击(arXiv 1610.05820,IEEE S&P 2017,同行评议)只需判断「这条数据在训练集里吗」,而在很多场合「你在这份名单里」本身就是敏感信息。
「我的输入会被拿去训练吗」的答案分产品线。OpenAI:消费级(ChatGPT Free/Plus/Team,ROW Terms 生效 2026-01-01)可能被用于训练;API 与企业产品(Enterprise Privacy 页面更新 2026-01-08)写明 We do not train our models on your data by default,API 数据自 2023-03-01 起默认不训练、保留最多 30 天、有零数据保留选项。Anthropic:商业产品默认不训练;消费级也不训练,但有两个例外——你主动举报材料、或明确选择加入。实操:在官方隐私页面搜 train / retention / opt-in 三个词。
四个法律状态词必须分清:审理中 / 部分简易判决 / 上诉中 / 和解结案。五起案件的真实状态:NYT v. OpenAI(S.D.N.Y.,合并入 In re OpenAI MDL No. 1:25-md-03143,2025-04-11 成立)——审理中;Authors Guild v. OpenAI——已并入同一 MDL,审理中;Andersen v. Stability AI(N.D. Cal., No. 3:23-cv-00201-WHO)——审理中,已有的 2023 与 2024 两项裁定均属程序阶段;Thomson Reuters v. Ross——地区法院 2025-02-11 部分简易判决(认定侵犯 2243 条判例摘要),但现在第三巡回上诉法院上诉中(No. 25-2153),2026-06-11 已辩论、尚未判决,不构成终局先例;Bartz v. Anthropic(N.D. Cal., No. 3:24-cv-05417-AMO)——和解结案(2026-07-20 终止),不是判决,通常不确立先例。Getty v. Stability AI 的美国与英国两案,本文均未取得最新状态,故不给状态描述。
EU AI Act(Regulation (EU) 2024/1689)分阶段适用:2024-08-01 生效 → 禁止性规则 2025-02-02 → GPAI 规则 2025-08-02 → 透明度规则(含深伪标识)2026-08-02 → 第 9 项禁止实践 2026 年 12 月 → 高风险 Annex III 2027-12-02 → 高风险 Annex I 2028-08-02。AI Omnibus 修正案 2026-07-27 生效,当前合并版本日期为 2026-07-27。「已于 2024 年 8 月全面生效」是错的,错在「全面」。
中国两部规章:《生成式人工智能服务管理暂行办法》(七部门,网信办令第 15 号)2023-08-15 生效;《人工智能生成合成内容标识办法》(国信办通字〔2025〕2 号,2025-03-07 发布)2025-09-01 生效,要求显式标识 + 隐式标识(元数据)并行——两者弱点互补:显式怕被裁被遮,隐式怕转存丢失。
能做的事:先分清产品线;写一张「绝对不贴」的清单;先脱敏再提问(人名公司名换占位符);商用前看清你实际使用的那个服务的条款并留截图与日期;保留创作过程记录(提示词、时间、版本、你改了什么);别照搬别国判例判断自己的行为;标识义务已经在生效,不是未来的事;高价值场景咨询你所在辖区的执业律师。