§ 13.4 · Section

深度伪造

为什么「检测假的」这条路天生吃亏

换脸的视频、拟声的电话、以假乱真的照片——这一节讲深度伪造(deepfake)。但本节最想给你的不是「怎么用肉眼看出假视频」这类很快就会过时的技巧,而是一个结构性的洞察:「事后检测假的」这条路在原理上就是吃亏的,所以业界的重心正在转向「事前给真的盖章」。这个转向背后是两套具体的技术:C2PA / Content Credentials(给内容记录来龙去脉)与 SynthID(在生成物里埋不可感知的水印)。本节还会讲清一件与你直接相关的事:中国的标识办法已于 2025-09-01 生效,EU AI Act 的透明度规则已于 2026-08-02 适用——这些不是未来的规定。同时本节有多处明确留白:几个被广泛引用的「检测准确率下降多少」的数字,本文未取得原始论文中的准确值,所以一个都不给。

生活场景
💰 验钞机与钞票上的水印

想想银行是怎么对付假钞的。历史上有两条完全不同的思路,而它们的成败对比,几乎就是深度伪造这件事的全部答案。

第一条思路:培训柜员认假钞。编一本《假钞特征手册》——纸张手感偏滑、油墨颜色偏暗、某个图案的线条模糊。这套办法有效,但有个致命弱点:手册永远追在造假者后面跑。造假者只要改进一个特征,手册就得重印,而所有柜员都得重新培训一遍。

第二条思路:在真钞上做防伪。加水印、加安全线、加光变油墨、加凹版触感。这套办法的逻辑完全反过来了——不再问「这张是不是假的」,而是问「这张有没有真钞该有的那些特征」。

两条路的差别在哪?第一条路你要防住所有已知和未知的造假手法(无穷多种),第二条路你只要证明自己的那一套防伪特征难以复制(一种)。说白了就是:一条是围追堵截,一条是发身份证。现代货币防伪的重心,早就压在第二条上了。

深度伪造这件事,正在走同一条路。「检测 AI 生成」相当于第一条思路,「给真实内容记录来源与凭证」相当于第二条。这一节的核心就是讲清这个转向为什么会发生。

先把「深度伪造」这个词说清楚

深度伪造(deepfake)这个词是「deep learning(深度学习)」加「fake(伪造)」拼出来的。说白了就是用深度学习技术做出的、让某人看起来说了或做了他实际没说没做的事的假内容。

它不是一种技术,是一类目标。学术界最早把不同的伪造手法系统整理出来的,是一份很重要的数据集工作。

出处:Rossler 等,标题 FaceForensics++: Learning to Detect Manipulated Facial Images(学习检测被篡改的人脸图像),arXiv 1901.08971,发布 2019-01-25。状态:已发表于 ICCV 2019,经同行评议(ICCV 是计算机视觉三大顶会之一)。

这份工作的贡献是建立了一个包含多种人脸伪造方法的数据集,并给出了基准检测结果。它收录的四种手法,恰好对应了四种不同的「造假路数」,值得逐一翻译成大白话:

手法名它做的是什么大白话生活类比
Deepfakes把 A 的脸换到 B 的身体上换头——身体和动作是别人的,脸是目标人物的照片里的人头剪下来贴到另一张照片上,只不过做得极其自然
Face2Face把 A 的表情实时驱动到 B 的脸上提线木偶——脸还是原来那张,但表情听我指挥皮影戏:影子的形状是固定的,动作由后面操作的人决定
FaceSwap另一种换脸路线(图形学方法)同样是换脸,但技术手段不同同一件事有两种做法:雕刻与浇模,结果像但工艺不同
NeuralTextures用神经网络重建面部纹理重新上皮肤——不换整张脸,只改动局部的纹理与细节修墙面:结构没动,把表面重新刮了一层腻子

这张表最重要的启示不是记住四个名字,而是「伪造」是很多条互相独立的技术路线,而不是一条。这一点直接决定了下一节要讲的那个不对称。

另一份被反复引用的数据集是 DFDC(Deepfake Detection Challenge,深度伪造检测挑战赛)。出处:Dolhansky 等,标题 The Deepfake Detection Challenge (DFDC) DatasetarXiv 2006.07397,发布 2020-06-12。状态:arXiv 预印本,本文未取得其同行评议记录。它的贡献是建立了一个大规模的深度伪造检测数据集,并组织了公开竞赛。

核心洞察:造假与检测的成本结构是不对称的

这是本节最值得带走的一条,因为它解释了几乎所有后续的技术选择。

先把这个不对称摆出来:

对比项造假的一方检测的一方
成功的条件只要在某一个检测器上过关就行必须拦住所有造法,包括还没出现的那些
可以试多少次无限次。造出来发现被识破,改一改再试,成本近乎为零一次就得对。放过去一个就是失败
信息优势在谁手上造假者可以研究公开的检测器,专门针对它优化检测方不知道下一种造法长什么样
生活类比小偷只要找到一扇没锁的门保安要看住所有的门窗,还包括墙上可能被打洞的地方

这个不对称有个更严峻的版本。检测器本身通常也是机器学习模型,而它一旦公开,造假者就可以拿它当「陪练」——反复生成、被拒、调整,直到能骗过它。相当于考试的题库如果公开了,考生就能针对题库刷题,而不是真的掌握了知识。

这里必须给一个明确的留白声明,而且这一处很关键:

★ 本节的留白声明

中文资料里经常出现这样的说法:「某检测竞赛冠军的准确率在真实世界数据上从百分之九十几掉到百分之几十」。这类断言的方向可能是对的(泛化能力下降是公认现象),但本文未取得原始论文中的准确数字,因此一个数字都不给。

具体未取得的有两处:FaceForensics++(arXiv 1901.08971)冠军方案在真实世界数据上的准确率下降幅度——需要查阅原始论文的泛化实验部分;② DFDC(arXiv 2006.07397)冠军方案在真实世界条件下的下降幅度——需要查阅原始论文及后续分析报告。

能站得住的表述只有定性的这一句:这两份工作的相关分析都指向「在竞赛设定的受限条件下表现较好,但在真实世界条件下泛化性能显著下降」这个方向。说白了就是:在自己家考场上考得不错,换个考场就掉下来。但「掉了多少」这个数字,请自己去查原始论文,别信任何没给出处的百分数——包括本文。

为什么会掉?原因很朴素,值得用生活类比讲一遍:检测器是在特定数据集上训练的,那些视频用的压缩方式、分辨率、光照条件、伪造工具都是那一批而真实世界的视频经过了社交平台的多次压缩转码、有各种奇怪的画质、用的可能是完全不同的伪造工具。

打个比方:一个只在自家厨房练过的厨师,突然被派到一个灶头火力不同、锅不一样、食材产地也不一样的地方——同一道菜就是做不出原来的味道。本质上就是:模型学的是「这一批数据里的伪造痕迹」,不是「伪造的本质」。

Analogy · 一封挂号信与一封普通信

既然「检测假的」这条路这么吃亏,那正确的路是什么?答案可以用邮局寄信讲清楚。

你收到一封信,怎么判断它真的是某个人寄来的?

方案一(检测思路):研究笔迹、看纸张、闻墨水味,判断有没有伪造痕迹。这套办法能用,但你永远无法确定自己漏掉了什么——一个高手仿的笔迹你可能压根看不出来。

方案二(溯源思路):改用挂号信。寄件人在邮局窗口出示身份、盖上邮戳、留下寄件记录,你收到时凭编号就能查到「这封信 X 月 X 日由谁在哪个邮局寄出、经过哪几个中转站」。你不再判断信本身像不像真的,你查的是它的来龙去脉。

两种方案的根本差别在于:方案一要求你识破所有伪造技巧(无穷多),方案二只要求邮局的记录系统难以造假(一个)。说白了就是:把「无穷多的攻击面」换成「一个需要守住的信任根」。

但方案二也有它的代价,必须诚实说出来:

第一,它只覆盖走了挂号的那些信。一封普通信没有邮戳记录,但「没有记录」不等于「是假的」——它只是「无法验证」。这是溯源方案最容易被误用的地方:看到内容没有凭证就断定它是 AI 生成的,是一个逻辑错误。

第二,它依赖整个链条上的人都配合。如果中转站不盖章、或者收件人手上没有查询工具,这套体系就转不起来。相当于快递单上的条码,得沿途每个网点都扫、且你手机上有能查的 App,才有意义。

第三,剪一刀就可能断链。信封被撕开重新装进另一个信封,原来的邮戳就没了。这对应下面要讲的一个技术细节:内容凭证在被截图、转码、重新编码后可能丢失。

C2PA / Content Credentials:给内容配一份「履历」

这是「溯源思路」目前最主要的一套标准,值得认真讲。

先解释名字。C2PA 是 Coalition for Content Provenance and Authenticity 的缩写,中文可译作「内容来源与真实性联盟」。provenance(来源 / 出处)这个词是关键——说白了就是「这东西从哪来、中间经过了谁的手」。它在艺术品和古董行业是个老概念:一幅画值多少钱,很大程度上取决于它的传承记录清不清楚。

组织性质:C2PA 是一个联合开发基金会(Joint Development Foundation)项目。规范版本(截至 2026-08-08):2.4。官方规范页面是 spec.c2pa.org

这里要专门澄清一处广泛流传的过期信息:中文资料里常见「C2PA 最新版本是 2.3」这种说法。截至 2026-08-08,最新是 2.4。各组件的版本号如下(这份清单也顺便告诉你这套标准包含哪些部分):

组件版本这个组件管什么(大白话)
Content Credentials2.4核心规范:一份内容凭证该包含什么、怎么绑到文件上
Content Credentials JSON(crJSON)2.4凭证的数据格式,相当于规定这张「履历表」上每一栏怎么填
Attestations1.4证明性声明——谁来为这份凭证背书
Soft Binding API2.4软绑定的接口(下面解释「软绑定」是什么)
Human and Organizational Identity Recommendation2.4人与机构身份怎么表达——说白了就是「签名的人是谁」这件事怎么写
Security Considerations2.4安全考量:这套体系已知的弱点与注意事项
Harms Modelling2.4危害建模——系统性地想清楚「这套东西可能被怎么滥用」
Guidance for AI/ML2.3针对 AI / 机器学习场景的专门指引。注意这一份还是 2.3,与其他组件版本不同步

技术原理讲三个点就够了:

第一,它用 X.509 证书信任模型。这套东西你天天在用而不知道——浏览器地址栏那把小锁,背后就是 X.509 证书。说白了就是:有一批被公认可信的机构(证书颁发机构)来为其他人的身份背书,形成一条信任链。相当于银行开户要出示身份证,而身份证之所以可信是因为它由公安机关签发——信任是一层一层传下来的,最后落在一个大家都认的根上。

第二,凭证以「manifest」的形式绑定到数字资产上,记录创建与修改历史。manifest 直译是「清单」,其实就是那份履历表:这张图什么时候、由什么设备或软件生成、之后被谁用什么工具改过。相当于一辆二手车的保养记录——不只告诉你它是哪年出厂的,还告诉你中间修过几次、换过什么件。

第三,它支持两种绑定方式,这一对概念很重要:

绑定方式技术手段大白话生活类比特点
硬绑定
(hard binding)
密码学签名用数学方法把凭证与文件内容锁死。文件被改一个字节,签名就验不过合同上的骑缝章——撕开重装就对不上了严格,但也脆。文件一经重新编码(比如平台压缩),签名就失效
软绑定
(soft binding)
感知哈希(perceptual hash)提取内容「看起来像什么」的指纹,不要求逐字节一致,所以能挺过一定程度的压缩与裁剪认人靠长相而不是靠身份证号——换了件衣服还认得出更耐折腾,但也更模糊,存在误匹配的可能

为什么要两种都有?因为它们的弱点互补,跟 §13.3 里讲的「显式标识 + 隐式标识」是同一个思路。硬绑定精确但一压缩就断,软绑定耐用但不够精确。本质上就是:既贴骑缝章,又记下这份合同大概长什么样——一种失效时另一种还能派上用场。

SynthID:把水印埋进生成的过程里

另一条路线是水印。代表性的是 Google DeepMind 的 SynthID(官方页面 deepmind.google/science/synthid/)。

它的思路和 C2PA 不同:C2PA 是在文件外面挂一份履历,SynthID 是在内容内部埋一个记号。打个比方:一个是给包裹贴单据,一个是在织物的纤维里织进暗纹。

最有意思的是它在文本上的做法,值得完整引一下官方说明:Large language models generate text one word (token) at a time. Each word is assigned a probability score... SynthID adjusts these probability scores to generate a watermark.(大语言模型一次生成一个词(token)。每个词都会被赋予一个概率分数……SynthID 调整这些概率分数来生成水印。)

这句话需要翻译。回想 §8.2 讲过的自回归生成:模型每写一个词,都是从一堆候选词里按概率挑一个。SynthID 的做法是:在挑词的那一刻,按一套只有自己知道的规则,稍微调一下各个候选词的分数。

相当于这样一件事:你让一个人写一篇文章,并偷偷跟他约定「凡是能用『因此』的地方尽量用『所以』」。文章读起来完全正常,谁也看不出异样,但如果你统计全文用词的分布,会发现一个不该出现的规律性偏移——那就是水印。说白了就是:不改变内容的意思,只在无关紧要的选择上留下一串可统计的痕迹。

图像、视频与音频那边,官方给的是抗干扰能力的描述:

★ 关于 SynthID 局限性的留白声明

Google DeepMind 的官方页面未明确说明该水印的移除难度或在什么条件下会失效。本文未取得官方对其局限性的充分披露,因此不给任何关于「能不能被去掉」的结论

但有一条通用原则可以站得住,而且很重要:任何水印技术在理论上都可能被针对性攻击移除或削弱。说白了就是:只要攻击者知道你在埋记号,他就有动机去研究怎么擦掉它。相当于衣服上的防盗磁扣——它能拦住顺手拿走的人,但拦不住带专业工具来的人。

所以正确的期待是:水印是提高门槛的手段,不是绝对可靠的证明。「检出水印」是较强的证据(说明这东西大概率是那个系统生成的),但「没检出水印」几乎什么都不能说明——可能是没埋、可能是被处理掉了、也可能压根不是那家的产品。

把 C2PA 和 SynthID 放一起对照,能看出两条路线的分工:

对比项C2PA / Content CredentialsSynthID
思路在文件外面附一份可验证的履历在内容内部埋一个不可感知的记号
类比快递面单与物流记录钞票纸浆里的水印
它回答的问题「这东西的来龙去脉是什么」「这东西是不是我们家生成的」
谁来推动开放标准,多方参与(联合开发基金会项目)单一厂商的技术(Google DeepMind)
主要弱点只覆盖参与这套体系的内容;重新编码可能断链局限性官方披露不充分(本文未取得);跨厂商通用性受限
共同的根本弱点两者都只能证明「有」,不能证明「没有」。「没凭证 / 没水印」不等于「是伪造的」,只等于「无法验证」。

最后那一行是本节最需要记住的逻辑要点,因为它是最容易被误用的地方。打个比方:一件商品有超市的价签说明它是超市在卖的;但一件商品没有价签,可能是掉了、可能是刚上架还没贴——你不能因此断定它是偷来的。

法规这边:标识义务已经在生效,不是未来的事

这一节的法律部分与 §13.3 有重叠,这里按「深度伪造」这个角度重讲一遍。再次提醒:本文不构成法律建议。以下为截至 2026-08-08 的官方文本转述。

中国 ·《人工智能生成合成内容标识办法》

欧盟 · EU AI Act 的透明度义务

注意欧盟这段原文里有一个两级结构,很容易被忽略:第一级是「可被识别」(identifiable,可以靠机器读取的方式实现),第二级是对深度伪造涉及公共利益的告知性文本额外要求「清晰且可见地标注」(clearly and visibly labelled)。也就是说,深度伪造被单独拎出来,要求的是人眼能看见的那种标注,而不只是埋在元数据里。

这和中国办法里「显式 + 隐式」的双重要求思路是一致的——两个辖区各自的措辞不同,但都指向同一个判断:光靠机器可读的标记不够,涉及可能误导人的内容,得让人直接看见。

★ 关于美国 TAKE IT DOWN Act 的留白

本文未取得该法案是否已生效的可靠官方信息,因此不对其状态作任何描述。

为什么要专门写这一条?因为在法律话题上,「某法案已通过 / 已生效」这类断言一旦说错,读者可能据此做出真实的判断。本站的做法是:宁可留白,绝不凭记忆补。如果你需要这条信息,请查该辖区的官方立法数据库。

普通人能做什么:一份务实的应对清单

技术和法规讲完了,落到你自己身上。先说一句最重要的:不要指望靠肉眼练成「AI 鉴别专家」。那类「看手指数量」「看眨眼频率」的技巧过期得极快,靠它们建立的信心是危险的。

真正稳的做法全部不依赖你的眼力,而依赖流程。

这八条里最该记住的是第一条和第四条。第一条防的是最常见的真实损失,第四条防的是最常见的逻辑错误。

肉眼线索还剩哪些可信:一份不吹不黑的清单

前面反复强调「别指望靠肉眼鉴别」,但更准确的表述是「别把肉眼当唯一判据」,而不是「肉眼一点用没有」。这里给一份诚实的边界:什么线索依然有点价值,什么早就被 Medium 甩在后面。

结论一句话:肉眼线索适合当「怀疑的起点」,绝不适合当「结论的依据」。看到可疑就启动流程(换渠道回拨、查来源、固定证据),而不是停在「我瞅着它哪儿不对劲」这一步。

最被低估的一种:声音,而不是视频

公众讨论深度伪造,注意力几乎全在换脸视频上。但从实际造成损失的角度看,声音是更值得警惕的一条通道,原因有三个,而且每一个都很朴素。

第一,做假声需要的素材远少于做假视频。视频要有多角度的面部、要有一致的光照、要处理头发和边缘——这些都是难点。而声音只需要一段清晰的说话录音。说白了就是:造一张假脸要考虑几十个细节,造一段假声音要考虑的维度少得多。

第二,我们对声音的鉴别能力天生就比对图像弱。你能一眼看出照片修得过分,但很难听出一段电话录音里有合成痕迹——尤其是在电话本身就有压缩、有杂音、听着本来就不清楚的情况下。打个比方:一张模糊的照片你会觉得可疑,但一通听着有点闷的电话你只会觉得「信号不好」。本质上就是:电话通话的质量本来就差,这正好给合成留出了藏身的空间。

第三,也是最要紧的:声音场景通常伴随着「必须马上决定」的压力。视频是你事后看的,可以暂停、可以回放、可以找人一起看。而电话是实时的——对方在催你,你在紧张,你没有时间冷静核实。

这就是为什么前面那份清单的第一条是「一律挂掉换渠道回拨」。它对付的不是技术,是「紧迫感」这个真正的攻击面相当于各种诈骗的共同套路都是「现在、立刻、马上」——因为一旦你有时间想,套路就破了。

一条不看真假也能照做的底线原则

所以有一条极简的原则值得刻在脑子里:凡是催你「马上」做不可逆的事(转账、给验证码、改密码、点某个链接),无论声音多熟悉,都先中断,再用你自己掌握的渠道核实。这条原则的好处是它完全不需要你判断真假——你只需要判断「这件事急不急」,而这个判断你一定做得出来。

关于拟声技术能做到什么程度,本文的态度是不给数字。因为「需要多少秒素材就能克隆一个人的声音」这类断言在营销材料里满天飞,而本次核实未取得绑定具体系统与评测方法的权威数据,所以一个数字都不给。但你不需要那个数字——上面那条原则在任何技术水平下都成立。

一个反向的危害:「说谎者的红利」

深度伪造造成的危害,通常被理解为「假的被当成真的」。但还有一个方向相反、同样严重的后果,很少被提到。

当所有人都知道「视频可以造假」之后,真实的证据也开始失去说服力。

逻辑是这样的:过去有一段录像,就算是铁证。现在有了一段录像,被拍到的人可以说「这是 AI 做的」。而由于「检测」这条路本来就吃亏(前面讲过),你往往无法在短时间内证明它是真的。结果是——造假技术的存在,本身就给所有想否认的人提供了一个现成的挡箭牌。

打个比方:如果市场上开始流传大量假发票,那么诚实的商家拿出真发票时,也会被多问几句。假货泛滥损害的不只是买家,还有真货的可信度。

这个后果对你意味着什么?两点很实在:

所以这一节的立场很明确:深度伪造确实是一个真实的问题,但正确的反应不是「以后什么都不能信了」这种虚无感。正确的反应是把判断的依据,从「内容看起来像不像真的」换成「它从哪来、有没有可交叉验证的痕迹」。前者靠眼力,会越来越不可靠;后者靠流程,会越来越可靠。

Recap · 这一节的收束

深度伪造不是一种技术,是一类目标。FaceForensics++(arXiv 1901.08971,ICCV 2019,同行评议)把四种不同路数的人脸伪造整理进同一个数据集:Deepfakes(换头)、Face2Face(提线木偶式表情驱动)、FaceSwap(另一种换脸路线)、NeuralTextures(重建面部纹理)。DFDC(arXiv 2006.07397,arXiv 预印本)建立了大规模检测数据集并组织了公开竞赛。记住「伪造是多条独立技术路线」这一点,才能理解下面那个不对称。

核心洞察是成本结构的不对称:造假者只要在某一个检测器上过关,可以无限次试错,还能把公开的检测器当陪练针对性优化;检测方必须拦住所有造法,包括还没出现的那些,而且一次就得对。相当于小偷只要找到一扇没锁的门,保安却要看住所有门窗。

★ 本节的关键留白:中文资料常见「检测冠军方案在真实世界数据上准确率从九十几掉到几十」这类断言。本文未取得 FaceForensics++ 与 DFDC 冠军方案在真实世界数据上准确率下降幅度的准确数字,因此一个百分数都不给。能站住的只有定性方向:在竞赛设定的受限条件下表现较好,在真实世界条件下泛化性能显著下降。原因是训练数据的压缩方式、分辨率、光照、伪造工具都是那一批,换个环境就失灵。

所以重心转向溯源。C2PA / Content Credentials(联合开发基金会项目,规范截至 2026-08-08 为 2.4 版;「最新是 2.3」的说法已过期;注意 Guidance for AI/ML 一项仍为 2.3,与其他组件不同步)。技术上:用 X.509 证书信任模型(就是浏览器地址栏那把小锁背后的东西)、以 manifest 记录创建与修改历史、支持硬绑定(密码学签名,精确但一重新编码就断)与软绑定(感知哈希,耐折腾但较模糊)——两者弱点互补。

SynthID(Google DeepMind)走的是水印路线。文本上的做法很巧:官方原文说 SynthID adjusts these probability scores to generate a watermark——在挑词那一刻按只有自己知道的规则微调候选词分数,内容读起来正常,但用词分布里留下可统计的痕迹。图像视频官方写 designed to stand up to 裁剪、滤镜、改帧率、有损压缩(注意这是设计目标的表述,不是实测保证)。★ 官方页面未充分披露其局限性与移除条件,本文未取得,故不给「能不能被去掉」的结论。通用原则:水印是提高门槛,不是绝对证明。

两条路线共同的根本弱点,也是最容易被误用的一点:它们只能证明「有」,不能证明「没有」。「没凭证 / 没水印」不等于「是伪造的」,只等于「无法验证」。反过来也一样:有凭证只证明文件的来龙去脉,不证明画面里发生的事是真的——真实拍摄且凭证完整的视频,照样能靠剪辑误导人。

法规已经在生效,不是未来的事。中国《人工智能生成合成内容标识办法》(国信办通字〔2025〕2 号)2025-09-01 生效,要求显式 + 隐式(元数据)双标识。EU AI Act(Regulation (EU) 2024/1689)透明度规则 2026-08-02 起适用,官方原文是两级要求:先要 identifiable(可被识别),再对深度伪造与涉及公共利益的告知性文本额外要求 clearly and visibly labelled(清晰且可见地标注)。★ 美国 TAKE IT DOWN Act 是否已生效,本文未取得可靠官方信息,故不作任何状态描述。本文不构成法律建议。

能做的事(全部不依赖眼力,只依赖流程):要求转账或验证码的音视频一律挂掉换渠道回拨;和家人团队约一个不会出现在网上的口令;判断真伪先看来源渠道而不是内容像不像;牢记「没凭证 ≠ 假」「有凭证 ≠ 内容为真」;减少公开的清晰正脸与长段语音;做产品发内容的现在就核对标识义务;遇到涉及自己的伪造先固定证据(保原始文件不只截图);别把检测工具的输出当判决书,它自身的误报也是真问题

☰ 主页
学海无涯 · 智能篇 · § 13.4