§ 2.4 · Sub-chapter

生成式 AI · GenAI 篇

Generative AI

过去十年 AI 大多在做"识别"——认出这是猫、那是垃圾邮件。生成式 AI(GenAI)让 AI 第一次跨过"识别"这条线,进入"创作"——写文章、画海报、生成视频、作曲。这就是 2022 年之后全社会集体震惊的那件事。

生活场景
🎨 从"考官"到"创作者"

过去 AI 是"考官"——你写作文交给它,它打分、纠错、判断优劣。
生成式 AI 是"创作者"——你告诉它一个主题,它自己写出一篇作文,甚至比大多数人写得更好。
这不是一次量变,是一次身份转变:AI 不再只在幕后判断,它开始站到了台前生产。

"识别式" vs "生成式"

识别式 AI · Discriminative生成式 AI · Generative
核心任务给定输入,判断类别 / 数值给定条件,生成新样本
输出标签、分数、概率一段文字、一张图、一段音频
数学上学 P(y|x)学 P(x|条件) 或 P(x)
典型例子人脸识别、情感分类ChatGPT、Midjourney、Sora

GenAI 的四种主要类型

01

文字生成 · Text

ChatGPT、Claude、DeepSeek、通义千问。基座是大语言模型(LLM),Transformer 架构。

02

图像生成 · Image

Midjourney、Stable Diffusion、Flux、可灵图片。核心技术:扩散模型(Diffusion)。

03

视频生成 · Video

Sora、可灵、Runway、即梦、Veo。原理是"图像扩散 + 时间维度"。

04

音频生成 · Audio

Suno(歌曲)、ElevenLabs(配音)、GPT-4o Voice(对话)。

三个背后的核心思想

Analogy · 从翻译机到写作机

识别式 像一台翻译机:你给它中文,它给你英文——输入输出一一对应。
生成式 像一台写作机:你给它"写一篇春天的散文",它可能写出一万种春天,每种都不一样——输出是一个巨大的"可能集合"。

GenAI 目前能做什么

用途推荐工具能力位置
写作 · 邮件 / 文案 / 论文ChatGPT、Claude、DeepSeek已达可用水平
写代码 · 修 bugCursor、TRAE、Copilot已达可用水平
画海报 / 插画Midjourney、Flux已达可用水平
做短视频Sora、可灵、Runway10 秒内可用
作曲写歌Suno、Udio接近专业
3D 建模Meshy、Tripo仍在发展
合成人声ElevenLabs接近真人

GenAI 独有的三个坑

Recap · 收束

生成式 AI 让人类第一次拥有了"随时可用的创造力工厂"。但它生成的东西是"可能对",不是"一定对"——用它必备两条:会给条件,会做筛查。

☰ 主页
Xue Hai Wu Ya · § 2.4 · GenAI