§ 2.4 · Section

生成式 AI · GenAI

Generative AI

过去十年 AI 大多在做"识别"——认出这是猫、那是垃圾邮件。生成式 AI(GenAI)让 AI 第一次跨过"识别"这条线,进入"创作"——写文章、画海报、生成视频、作曲。这就是 2022 年之后全社会集体震惊的那件事。它的震撼不只在效果,更在成本结构的改变:过去要产出一张商业级插画需要一名画师工作一整天,现在需要三十秒和几分钱。这一节要把这件事讲透:判别与生成在数学上到底差在哪、四条主要技术路线各自怎么工作、各个模态今天分别停在什么水平、这些能力靠什么商业模式变现、以及为什么版权和真实性成了它最难拆的两颗雷。

生活场景
🎨 从"考官"到"创作者"

过去 AI 是"考官"——你写作文交给它,它打分、纠错、判断优劣。
生成式 AI 是"创作者"——你告诉它一个主题,它自己写出一篇作文,甚至比大多数人写得更好。
这不是一次量变,是一次身份转变:AI 不再只在幕后判断,它开始站到了台前生产。

先把术语翻译成人话

这一节的名词有一半是数学符号、一半是英文缩写,听着玄得厉害。先一次性摊平——换成大白话,再各配一个生活里的对应物:

术语换成大白话生活里对应什么
GenAI(Generative AI,生成式人工智能——不做判断,直接造出新内容的程序)它不当考官,它当写手厨师从"尝一口说这菜合不合格",变成"自己炒一盘出来"
判别式(Discriminative——只学"怎么把几类东西分开")只需要知道差在哪,不必知道全貌门口保安只认工牌真假,他不需要会做工牌
P(y|x)(在看到 x 的条件下 y 的概率)"给定这张片子,这是不是肺炎"医院分诊窗口只需判断你该去哪个科室
P(x)(数据本身的分布)"什么样的东西才算一张合理的照片"不只是会挑菜,而是把整个菜市场什么菜长什么样全摸清了
自回归(Autoregressive——一个接一个往后猜)写一个字,把它当条件,再猜下一个字流水线上前一道不出件,后一道就只能干等
扩散(Diffusion——先学会去噪,再从纯噪声里雕出图)从一屏雪花开始,一遍遍擦,图慢慢浮出来擦一块蒙满灰的玻璃,擦几十遍,外面的景色一点点显出来
GAN(Generative Adversarial Network,生成对抗网络——造假的和验假的互相较劲)一个人造假币,一个人验假币,两个人一起变强银行柜台的验钞机和造假团伙的军备竞赛
VAE(Variational AutoEncoder,变分自编码器——先压缩成一个小向量再解压回来)先打包再拆包,包裹小了但东西还在快递前把羽绒服抽成真空袋,到了再拆开抖开
潜空间(Latent Space——压缩之后那个小得多的表示空间)不在原尺寸上折腾,先缩小再干活装修先在一张缩小的平面图上排家具,而不是搬着真沙发来回试
CLIP(Contrastive Language-Image Pre-training——让图片和文字落到同一套坐标里)让"戴帽子的猫"这句话和那张图在数学上挨得很近图书馆把中文书和外文书按同一套主题编号上架,找起来不分语言
Temperature(温度——控制它"多敢乱猜"的旋钮)调低它就规规矩矩,调高它就天马行空厨师手里那把调料勺:抖一点是家常味,抖狠了就成实验菜
Top-p(核采样——只在概率累加到 p 的那一撮候选里挑)只在最靠前的那几个选项里选,长尾的荒唐选项直接砍掉超市货架只摆最好卖的前二十款,冷门的不上架
幻觉(Hallucination——一本正经地编造)它追求的是"听起来像",不是"确实是"一个记忆模糊的人复述开会内容,逻辑通顺,细节全是自己补的
模型自噬(Model Collapse——用 AI 生成的数据训 AI,多样性逐轮衰减)自己抄自己,越抄越窄复印件再去复印,印到第十代已经看不清字了

这张表的关键一行是 P(y|x) 和 P(x) 那一对。判别式只要知道"差在哪",生成式必须知道"整个长什么样"——说白了:前者是保安认工牌,后者是自己有本事把工牌从零做出来。这一条难度落差,解释了生成模型为什么比判别模型晚成熟十年、参数还大一两个数量级。

"识别式" vs "生成式":一次数学目标的转向

识别式 AI · Discriminative生成式 AI · Generative
核心任务给定输入,判断类别 / 数值给定条件,生成新样本
输出标签、分数、概率一段文字、一张图、一段音频
数学上学 P(y|x)学 P(x|条件) 或 P(x)
典型例子人脸识别、情感分类ChatGPT、Midjourney、Sora

那两行数学符号是这一节最值得花时间理解的东西。P(y|x) 读作"在看到 x 的条件下,y 的概率"——它只需要学会把不同类别分开的那条边界。要区分猫和狗,模型不需要知道猫长什么样,只需要知道"猫和狗在哪儿不一样"。这大大降低了难度:也许只要抓住"耳朵形状"这一个维度就够了,其他信息全可以扔掉。

P(x) 完全不同,它要学的是数据本身的整个分布——什么样的像素组合"是一张合理的照片"。这难得多,因为你不能扔掉任何信息:生成一只猫,你得知道猫有几条腿、毛怎么长、光照怎么打在皮毛上、猫爪和地面怎么接触。判别式只需要知道差异,生成式必须知道全貌。这也是为什么生成模型比判别模型晚成熟十年,也是为什么生成模型的参数量普遍大一两个数量级。

物理学家费曼有句常被引用的话:"What I cannot create, I do not understand."(造不出来的东西,我就没真懂。)这句话正好解释了为什么很多研究者认为生成式路线更接近"理解":一个能画出符合透视和光影关系的房间的模型,某种程度上必须"掌握"了三维空间的规律;一个能续写一段严密论证的模型,某种程度上必须"掌握"了推理的形式。这是不是真理解仍有争论,但它至少比"能分类"多了一层要求。

判别式:只学一条分界线                生成式:学整片"合理数据"的分布
    猫 · · | · · 狗                      ░░▓▓▓▓▓░░   ← 学会这片山的形状
      · ·  |  · ·                        ░▓▓▓▓▓▓▓░     然后从山上随机采一个点
        ·  |  ·                          ▓▓▓▓▓▓▓▓▓     → 就是一个"新生成的样本"
    ↑ 只要边界画对,其他信息全可以扔掉    ↑ 任何一处的高低都不能错

再补一个容易忽略的点:二者并非对立,而是可以互相转化。有了 P(x) 和贝叶斯定理,理论上就能推出 P(y|x)——这就是"生成式分类器"(比如朴素贝叶斯)。反过来,今天最强的生成模型内部也大量使用判别式组件(比如扩散模型里那个预测噪声的网络,本质是个回归器)。它们是同一枚硬币的两面,区别只在你把学习目标对准了哪一边。

四条技术路线:它们各自怎么"造"出东西

生成不是一种算法,而是四条思路完全不同的路线。理解它们的机制差异,你就能明白"为什么写文章是一个词一个词吐出来的,而画图是整张一起慢慢变清晰的"。

路线提出年份生成速度质量 / 多样性今天主要用在
自回归2015 起 / GPT 2018慢(逐 token)文本上最强所有 LLM、部分图像与音乐
扩散2015 提出 / 2020 起爆发较慢(多步迭代)图像视频上最强图像、视频、3D、分子生成
GAN2014(单次前向)清晰但多样性差超分、实时风格化、声码器
VAE2013偏模糊作为扩散模型的压缩组件
流匹配 Flow Matching2022 起比扩散快接近扩散新一代图像/视频模型的底座

还有一个跨路线的关键拼图不能漏:怎么让"文字"控制"图像"。答案是 2021 年 OpenAI 的 CLIP——它用四亿组网络上的"图片 + 配文"训练,把图片和文字映射到同一个语义空间,让"一只戴帽子的猫"这句话和对应的图片在向量空间里靠得很近。有了这座桥,扩散模型才能被文字牵着走。可以说没有 CLIP,就没有今天的文生图。

四条路线,用一家餐厅的四种出菜法来分辨

四条路线的原理描述都很技术,但它们的差别用厨房里的四种做法一比就极清楚。打个比方,同样是"端出一盘菜",这四位厨师的干法完全不同:

路线它像哪种厨师为什么快 / 为什么慢典型毛病长什么样
自回归包饺子的师傅:擀一张皮、包一个、再擀下一张,严格一个接一个慢,因为前一个不落地,后一个的形状就定不了第三个包歪了,后面全跟着歪——错误一旦进了链条就顺着错下去
扩散雕萝卜花的师傅:先拿一整块粗料,一刀一刀往下修,几十刀后花才出来慢,因为要迭代几十步;但每一步都能中途调方向刀数不够就还是一团粗坯;刀数够了但手一抖,细节(手指、文字)就崩
GAN两位师傅打赌:一个负责冒充招牌菜,另一个负责挑毛病,互相较劲,出锅只需一次动作冒充的那位发现"只做同一道菜就能骗过对方",于是整个菜单只剩一道菜——这就是模式崩塌
VAE打包师傅:把整锅菜抽真空压成一小包,需要时再拆开复原快,压缩和解压都是一次性动作复原出来的总是有点软塌、边缘发虚——所以它今天主要当别人的案板,不单独出菜

这张表能顺手解答一个很常见的困惑:为什么写文章是一个字一个字往外蹦,画图却是整张一起慢慢变清晰其实就是包饺子和雕萝卜花的区别——前者的每一件成品都必须等前一件落地,后者是从一开始就有一整块料在手上,只是越修越细。

还有一条实操上的推论。既然扩散是"一刀一刀修",那么你在中途插一句要求它是听得进去的——这就是为什么图像生成能做局部重绘、能中途换引导词、能在第 20 步开始才加上"要暖色调"。而自回归是"包完一个就定型",它没有回头改上一个饺子的机制,所以纠错只能靠让它把整段重写。简单说:一个能返工,一个只能重做。

Analogy · 一家二十四小时不打烊的印刷厂

要理解生成式 AI 到底改变了什么,最贴身的类比是你家楼下突然开了一家二十四小时不打烊、随叫随到、几乎不要钱的印刷厂。
你半夜想到要一张海报,走过去说一句,三十秒后拿到手。想改配色,再说一句,又是三十秒。想要二十个版本一起看,它一次全给你。这家厂的产量是没有上限的,成本低到可以忽略。
但它有三条你必须记住的性格。第一,它从不核实内容。你说"印上《民法典》第几条",它会印得排版精美、字体庄重,而那条条文可能根本不存在——它保证的是"看起来像一张正规文件",不是"内容是真的"。第二,它不为印出来的东西负责。海报贴出去出了事,被追责的是你,不是这家厂。第三,它印得越快,你的活儿就越往"审校"那一头挪。以前你的时间花在画,现在花在挑错。
这个类比最有价值的一层在于它解释了整个行业的成本结构变化:相当于过去"生产"是瓶颈、"审校"是零头,现在完全对调了。当产出变得几乎免费,稀缺的东西就变成了"判断哪一份能用"所以这一波技术真正抬高的岗位不是会画的人,而是能一眼看出哪张不能用的人。

怎么写提示词:四个几乎万能的抓手

这一节讲了一堆原理,但你真正每天要用的只有一件事——怎么把话说清楚。下面四个抓手不依赖任何具体工具,套在文字、图像、视频上都成立。

这四条背后是同一条道理:它不会读心,它只会补全你写下的那部分翻译成人话——你给的条件越具体,它需要自己瞎猜的部分就越少,而它瞎猜的那部分正好就是所有翻车的来源。

GenAI 的四种主要类型

01

文字生成 · Text

ChatGPT、Claude、DeepSeek、通义千问。基座是大语言模型(LLM),Transformer 架构。

02

图像生成 · Image

Midjourney、Stable Diffusion、Flux、可灵图片。核心技术:扩散模型(Diffusion)。

03

视频生成 · Video

Sora、可灵、Runway、即梦、Veo。原理是"图像扩散 + 时间维度"。

04

音频生成 · Audio

Suno(歌曲)、ElevenLabs(配音)、GPT-4o Voice(对话)。

四种模态的难度不是并列的,它们有明确的阶梯,而这个阶梯由数据的维度和内在约束的严格程度决定。

文本最先被攻克,因为它维度最低(一个 token 就是词表里的一个整数)、互联网上现成语料最多、而且人类阅读时的容错度相当高——一句话稍微别扭你也能读懂。图像次之:维度高得多(一张 1024×1024 的图有三百多万个数值),但一张静态图的内在约束相对松,多一根手指人类要看两眼才发现。视频难得多:它在图像之上加了时间维度,而时间维度带来了最难的约束——一致性。人物走过一根柱子后,衣服颜色不能变;杯子被打翻后,水不能自己回到杯里。这要求模型具备某种朴素的物理直觉,这也是为什么视频生成的可用时长长期卡在几秒到十几秒。3D 和交互式内容最难:不但要保证从任意角度看都自洽,还得符合可制造、可装配、可交互的工程约束。

此外还有几个常被漏掉但很重要的模态:代码生成(它有一个别的模态没有的巨大优势——输出可以被自动验证,编译报错、单元测试不过就是明确的反馈信号,这让代码成了 GenAI 落地最快、经济价值最直接的领域);3D 资产生成(Meshy、Tripo,服务游戏和影视);科学生成(AlphaFold 预测蛋白质结构、分子生成设计新药——这里"生成"的对象不是内容而是结构,可能是这条技术路线社会价值最高的分支)。

三个背后的核心思想

把这三个旋钮说具体,你用任何生成工具都会立刻受益。Temperature(温度)控制概率分布的"陡峭程度":温度趋近 0 时,模型每次都选概率最高的那个选项,输出稳定但呆板重复;温度调到 1 以上,低概率选项也有机会被选中,输出更有想象力也更容易跑偏。经验规律是——要事实、要代码、要格式严格的输出,把温度压低;要创意、要头脑风暴、要多样文案,把温度调高

Top-p(核采样)是另一种约束方式:先把候选词按概率从高到低排,累加到 p(比如 0.9)为止,只在这个"核"里面采样,把长尾的荒谬选项直接砍掉。它和温度常常配合使用。随机种子(Seed)则相反,它是为了消除随机性——同样的提示词加同样的种子,能复现出一模一样的结果,这在需要微调迭代时非常关键。

图像生成里还有一个专属旋钮:CFG Scale(提示词引导强度)。它控制模型"多听你的话":调低了它会自由发挥、画面自然但可能忽略你的要求;调太高它会死抠字面、画面容易变得生硬失真。这套旋钮共同揭示了生成式 AI 的一条根本张力:忠实度和创造性此消彼长,没有免费的两全。

Analogy · 从翻译机到写作机

识别式 像一台翻译机:你给它中文,它给你英文——输入输出一一对应。
生成式 像一台写作机:你给它"写一篇春天的散文",它可能写出一万种春天,每种都不一样——输出是一个巨大的"可能集合"。

这个差别直接决定了两种 AI 的验收方式完全不同。翻译机可以打分:标准答案摆在那儿,对了就是对了。写作机没法打分:你怎么证明这一万种春天里哪一种"最正确"?这就是生成式 AI 最棘手的工程难题——评测。判别模型有准确率、召回率、AUC 这些客观指标;生成模型只能依赖有争议的自动指标(图像用 FID,文本用困惑度或 BLEU),或者最终回到让人来投票——这也是为什么大模型排行榜大多采用人类盲测两两对比的形式。没有客观评价标准,是这个领域至今争论不休的根源。

GenAI 目前能做什么

用途推荐工具能力位置
写作 · 邮件 / 文案 / 论文ChatGPT、Claude、DeepSeek已达可用水平
写代码 · 修 bugCursor、TRAE、Copilot已达可用水平
画海报 / 插画Midjourney、Flux已达可用水平
做短视频Sora、可灵、Runway10 秒内可用
作曲写歌Suno、Udio接近专业
3D 建模Meshy、Tripo仍在发展
合成人声ElevenLabs接近真人

读这张表要配一条判据,否则容易高估或低估:GenAI 目前的能力位置,取决于"错误的代价"和"验证的成本"。它在初稿类工作上已经全面可用——写文案、出草图、搭代码骨架、做会议纪要,因为这类工作本来就要人改,AI 出的稿子把起点从零抬到了六十分。它在终稿类工作上仍不可信——法律意见、财务报表、医疗结论,这些错一次就要出事,必须有人负责。

还有一条常被忽视的价值:它降的不只是成本,还有"起步门槛"。一个不会画画的产品经理现在能自己出示意图,一个不懂前端的设计师现在能做出可点击的原型。这带来的不只是效率提升,而是分工边界的重划——原本必须协作的两个人,现在一个人就能走完全程。历史上摄影术、桌面排版软件、非线性剪辑软件都引发过同样的重划,每次都是从业者恐慌、产量暴涨、审美标准随之升高。

商业化路径:这些能力靠什么赚钱

技术再炫,最终要回答"钱从哪来"。生成式 AI 目前形成了五种相对清晰的变现层次,从底到顶:

层次卖什么代表玩家护城河 / 风险
算力层芯片、云端 GPU 集群英伟达、各家云厂商目前最稳定赚钱的一层;风险是需求周期波动
模型层 · API按 token / 按张计费的调用OpenAI、Anthropic、各家大厂规模效应强;但价格战激烈,单价一路下滑
模型层 · 订阅面向个人的月费(如二十美元档)ChatGPT Plus、Claude Pro、Midjourney现金流好;靠体验和品牌留人
应用层垂直场景的完整工作流Cursor(代码)、Jasper(营销)、剪辑与设计工具贴近具体行业,但容易被基座模型的新功能吞掉
企业层私有化部署 + 数据定制 + 合规各家企业版、系统集成商单价最高、最难被替换;但销售周期长

这一层结构里有两个值得记住的规律。第一是推理成本决定商业模式:文本生成一次调用的成本已经低到可以免费送,所以文本产品普遍走"免费+订阅";视频生成一段十秒片子的算力成本还很高,所以视频产品普遍走"按次计费/积分制"。看一个 AI 产品怎么收费,基本能反推出它的单次成本有多高。

第二是那句被反复讨论的话——"套壳"的危险。如果你的产品只是给某个大模型 API 加了一个输入框,那么基座模型下一次更新就可能把你的全部功能变成它的内置菜单。能站住的应用层玩家通常至少握有一样东西:专有数据(别人拿不到的行业语料)、工作流深度(嵌进了用户每天必用的流程里,切换成本高)、结果可验证的闭环(比如代码工具能自动跑测试,让 AI 的输出被机器检验而不是被人肉眼审)。

还有一条正在快速变化的成本曲线:同等能力模型的 API 单价在过去两年里下降了一到两个数量级,而开源模型(Llama、Qwen、DeepSeek 系列)把"能力下限"整个抬高了。这意味着"能做出来"越来越不值钱,"做得比别人更贴合具体场景"才值钱

GenAI 独有的三个坑

关于版权,争议其实分成三个独立的问题,混在一起谈就永远吵不清。第一是训练是否合法:用未经授权的作品训练模型,算不算合理使用?各国态度分歧巨大,围绕这一点的诉讼在 2023 年之后大量出现——《纽约时报》起诉 OpenAI、图库巨头 Getty Images 起诉 Stability AI、多位作家和艺术家发起集体诉讼,判例仍在形成中。第二是输出是否侵权:如果生成结果和某个特定作品高度相似,那显然有问题;但如果只是"风格相似",而风格在多数法域并不受版权保护,这就成了灰区。第三是生成物归谁:美国版权局的立场是纯 AI 生成的内容缺乏人类作者身份,不予登记;中国有法院在具体案件中认定,当使用者在提示词设计、参数调整、多轮筛选中投入了足够的智力创造,产出可以构成作品。这三个问题的答案会共同决定这个产业未来的成本结构——如果训练必须逐一授权付费,整个行业的经济学都要重算。

关于真实性,问题比"假图片"严重得多。技术上已经出现了三类应对手段,但每一类都不牢靠:水印(在生成内容里嵌入不可见标记,如 SynthID;但截图、压缩、二次编辑都可能破坏它)、内容凭证(C2PA 标准把拍摄和编辑历史写进文件元数据形成"出处链";但元数据太容易被剥掉)、检测器(用模型识别模型;这是一场注定的军备竞赛,而且误伤率高得惊人——已有多起真人写的文章被判定为 AI 生成的事故)。

更深层的社会后果被称为"说谎者的红利":当所有人都知道视频可以伪造时,真实的证据也可以被轻易否认了。这比"有人被假视频骗到"更麻烦——它侵蚀的是"眼见为实"这个人类社会运行几千年的默认信任基础。所以真正的解法可能不在技术侧,而在制度侧:不去证明"这是假的",而是建立机制去证明"这是真的、来源可查"。中国自 2025 年起实施的 AI 生成内容标识办法、欧盟《人工智能法案》的透明度条款,走的都是这条路。

最后一个正在浮现的隐患:模型自噬(Model Collapse)。当互联网上越来越多内容由 AI 生成,下一代模型的训练数据里就会混入大量 AI 产物;用 AI 生成的数据训练 AI,多轮之后分布的尾部会被逐步削平,多样性衰减、罕见知识丢失。有研究把这个过程形容为"信息的近亲繁殖"。这意味着 2022 年之前的"纯人类语料"正在变成一种越来越珍贵的稀缺资源。

Recap · 收束

生成式 AI 让人类第一次拥有了"随时可用的创造力工厂"。但它生成的东西是"可能对",不是"一定对"——用它必备两条:会给条件,会做筛查。

七条要点收束:(1) 数学本质是从 P(y|x) 转向 P(x)——判别式只需知道差异,生成式必须知道全貌,所以它难得多也大得多;(2) 四条路线各有分工:自回归统治文本、扩散统治图像视频、GAN 退守速度敏感场景、VAE 成了扩散的基础设施;(3) CLIP 是让文字能牵着图像走的那座桥,没有它就没有文生图;(4) 模态难度由维度和一致性约束决定,文本→图像→视频→3D 依次升级,而代码因为输出可自动验证落地最快;(5) 温度、Top-p、CFG 这些旋钮的背后是同一条张力——忠实度与创造性此消彼长;(6) 商业上分算力/API/订阅/应用/企业五层,推理成本决定收费方式,纯套壳的应用最危险;(7) 三颗雷分别是幻觉、版权三问、真实性崩塌,而模型自噬正让纯人类语料变成稀缺资源。用它的正确姿势:把它当成一个产量极高但从不为结果负责的实习生。

☰ 主页
Xue Hai Wu Ya · § 2.4 · GenAI