§ 2.4 · Sub-chapter
生成式 AI · GenAI 篇
Generative AI
过去十年 AI 大多在做"识别"——认出这是猫、那是垃圾邮件。生成式 AI(GenAI)让 AI 第一次跨过"识别"这条线,进入"创作"——写文章、画海报、生成视频、作曲。这就是 2022 年之后全社会集体震惊的那件事。
生活场景
🎨 从"考官"到"创作者"
过去 AI 是"考官"——你写作文交给它,它打分、纠错、判断优劣。
生成式 AI 是"创作者"——你告诉它一个主题,它自己写出一篇作文,甚至比大多数人写得更好。
这不是一次量变,是一次身份转变:AI 不再只在幕后判断,它开始站到了台前生产。
"识别式" vs "生成式"
| 识别式 AI · Discriminative | 生成式 AI · Generative | |
|---|---|---|
| 核心任务 | 给定输入,判断类别 / 数值 | 给定条件,生成新样本 |
| 输出 | 标签、分数、概率 | 一段文字、一张图、一段音频 |
| 数学上 | 学 P(y|x) | 学 P(x|条件) 或 P(x) |
| 典型例子 | 人脸识别、情感分类 | ChatGPT、Midjourney、Sora |
GenAI 的四种主要类型
01
文字生成 · Text
ChatGPT、Claude、DeepSeek、通义千问。基座是大语言模型(LLM),Transformer 架构。
02
图像生成 · Image
Midjourney、Stable Diffusion、Flux、可灵图片。核心技术:扩散模型(Diffusion)。
03
视频生成 · Video
Sora、可灵、Runway、即梦、Veo。原理是"图像扩散 + 时间维度"。
04
音频生成 · Audio
Suno(歌曲)、ElevenLabs(配音)、GPT-4o Voice(对话)。
三个背后的核心思想
- 概率生成模型学到一个"数据分布",从中随机采样就能造出新样本——每次结果不完全一样。
- 条件生成给一个条件(比如"一只草地上的橘猫"),从"符合这个条件的分布"里采样。
- 可控采样通过 Temperature、Top-p 等旋钮控制它"多敢乱猜",创作性和稳定性的平衡由你决定。
Analogy · 从翻译机到写作机
识别式 像一台翻译机:你给它中文,它给你英文——输入输出一一对应。
生成式 像一台写作机:你给它"写一篇春天的散文",它可能写出一万种春天,每种都不一样——输出是一个巨大的"可能集合"。
GenAI 目前能做什么
| 用途 | 推荐工具 | 能力位置 |
|---|---|---|
| 写作 · 邮件 / 文案 / 论文 | ChatGPT、Claude、DeepSeek | 已达可用水平 |
| 写代码 · 修 bug | Cursor、TRAE、Copilot | 已达可用水平 |
| 画海报 / 插画 | Midjourney、Flux | 已达可用水平 |
| 做短视频 | Sora、可灵、Runway | 10 秒内可用 |
| 作曲写歌 | Suno、Udio | 接近专业 |
| 3D 建模 | Meshy、Tripo | 仍在发展 |
| 合成人声 | ElevenLabs | 接近真人 |
GenAI 独有的三个坑
- 幻觉它会一本正经地编造事实——因为它的机制就是"根据分布合理地生成",而不是"查真相"。
- 版权训练数据里可能含大量受版权保护的作品,生成结果的权属仍是灰色地带。
- 深度伪造换脸、AI 换声电话诈骗、假新闻——2024 年起已成为社会问题。
Recap · 收束
生成式 AI 让人类第一次拥有了"随时可用的创造力工厂"。但它生成的东西是"可能对",不是"一定对"——用它必备两条:会给条件,会做筛查。
Xue Hai Wu Ya · § 2.4 · GenAI