Chapter · 03

第 3 章 · 简史

A Brief History · 六十年三起三落

你今天用 ChatGPT 聊天觉得理所当然。但你知道吗?AI 已经悄悄走过了 70 年——中间被人类"抛弃"过两次,几乎快死了。这一章不讲技术,只讲故事——一个"人类和机器智能"的爱恨长跑。

生活场景
🎬 时间倒流一分钟

你手机屏幕解锁了——刷脸;你打开抖音——被推了 5 个你会喜欢的视频;你问 ChatGPT 一个问题——它秒回;你让 Siri 定个闹钟——她说好。这些"理所当然",其实每一件都是70 年血泪史里某位科学家没日没夜熬出的成果

让我们从头讲起——从 1943 年,一个心理学家和一个数学家坐在一起,试图搞明白"人的大脑到底怎么想事情"开始。

先把这一章的名词翻译成人话

这一章会出现一堆学派名字和技术名词。它们听着高深,其实本质上就是几种"让机器变聪明"的不同思路,而每一种思路都能在日常生活里找到对应的做法。先过一遍这张表,后面的故事就好懂了。

名词换成大白话生活里对应的做法
符号主义(Symbolism,认为智能就是按规则做逻辑推理)说白了就是"把该怎么办一条条写清楚,让机器照着办"新员工手里那本厚厚的操作手册——查得到的都办得漂亮,查不到的当场傻眼
专家系统(Expert System,把老师傅的经验抄成成千上万条规则)说白了就是"把老医生脑子里的判断规则挖出来抄成一本书"医院里那本《常见病诊疗指南》
统计学习(Statistical Learning,从大量数据里自己找规律)说白了就是"不给你规则,给你一万道题和答案,你自己总结"学生刷十年考试真题,自己摸出出题套路
神经网络(Neural Network,一大堆简单单元层层堆叠,靠调参数学习)说白了就是"几百万个小旋钮,靠反复挨批评慢慢拧对"一整条流水线上的几百位工人,每人只管一道小工序,靠反复返工调整手法
深度学习(Deep Learning,把神经网络堆得很深)说白了就是"把那条流水线加长到几十道工序"工序越细分,成品越精致
AI 寒冬(AI Winter,投资和研究热情大幅退潮的时期)说白了就是"钱没了、人跑了、这个词都不好意思提了"一波创业潮退去后,写在名片上都嫌丢人的那个行业标签
参数(Parameter,模型内部可以被调整的那些数字)说白了就是"那些旋钮的个数"一台洗衣机上有 5 个旋钮,一台工业设备可能有五百个
Transformer(一种让每个词都能同时看全句所有词的网络结构)说白了就是"从层层转达,改成所有人在一个群里直接说话"从"基层向上五级汇报"改成"全员开会,谁都能直接对话"

这 70 年的故事,说白了就是这两条路线的反复交替:一边是"把规则写给机器",一边是"给机器数据让它自己总结"。前者在 80 年代赢过一回,后者在 2012 年之后彻底赢了下来——而这一章要讲的,就是这场拉锯战里的每一次起落。

三次大潮 · 一张全景图

AI 历史像海浪:一波起、一波落,每一波都以为自己是最后一波。到 2026 年为止,AI 大概经历了三次这样的浪潮:

1st Wave

符号主义 · 1950s–1980s

信念:"智能 = 逻辑推理"。人写规则、机器执行。
代表:定理证明、专家系统、下棋程序。
结局:规则写不完,遇到复杂现实就傻——寒冬来临。

2nd Wave

统计学习 · 1990s–2010s

信念:"智能 = 从数据里找规律"。用数学模型学。
代表:SVM、随机森林、贝叶斯网络。
结局:能学但学不深,处理不了图像、语音那种复杂结构。

3rd Wave

深度学习 · 2012–今天

信念:"智能 = 大数据 + 深层网络 + 大算力"。
代表:CNN、Transformer、大语言模型。
结局:还在爆发中——ChatGPT、Sora、Claude 都是这一波产物。

Analogy · 三次浪潮,就是同一条街上的三波创业潮

打个比方,把这 70 年换成大白话:想象一条商业街,七十年里开过三波不同思路的店,起落的节奏出奇地一致。

第一波(1950s–1980s)· "我们请老师傅、写手册"。这波店主的信念是:把所有该怎么办的情况都写成规则,机器照着办就聪明了。他们真的赚过大钱——一家公司靠这套手册一年省下四千万美元。但手册越写越厚,直到有一天大家发现:现实里的情况根本写不完,翻到手册上没有的那一页,机器就当场傻眼。钱撤了,店关了。

第二波(1990s–2010s)· "别写手册了,给它做题"。这波换了思路:不告诉它规则,给它一万道题和答案,让它自己总结。这套办法确实能学,但学不深——好比一个学生能背下所有题型套路,可你让他看一张模糊的照片说出里面是猫还是狗,他就没辙了。于是这波也慢慢冷了。

第三波(2012–今天)· "老思路,但这次有钱有粮了"。最有意思的是这一波用的其实是第一次寒冬里被扫地出门的那个思路(神经网络)。当年它不是错,只是"吃不饱、练不动"——数据不够、算力不够。这三样凑齐的那一天,它就爆发了。

这个类比还有一层最值得记住的意思:每一波退潮之后,那个词都会变得难以启齿。80 年代末,研究者不得不把自己的论文改称"机器学习""模式识别"来蒙混过关——就像一波创业潮崩了之后,谁都不肯在名片上再印那个行业标签。但也正是每一次退潮之后的复苏,力量都比上一次大得多。

1940s–1950s · 神经元与图灵之问

故事开始于 1943 年。心理学家 McCulloch(麦卡洛克)和数学家 Pitts(皮茨)合作发了一篇论文——他们发现,大脑里的神经元可以用简单的"是 / 否"逻辑运算来模拟。这是史上第一个"人工神经元"的数学模型——一切的开端。

1950 年,英国天才数学家 Alan Turing(艾伦·图灵)——就是那个二战破译德军密码、后来被苹果 logo 纪念的人——写了一篇著名论文《Computing Machinery and Intelligence》。他没有回答"机器能不能思考"这个问题,而是狡猾地问:如果一台机器能骗过你,让你分不清对面是人还是机器,那你说它算不算有智能?

Analogy · 帘子后面的两个人

想象你坐在一间屋里,跟两个"看不见的人"用打字机聊天。左边帘子后是真人,右边帘子后是电脑。你可以问任何问题,5 分钟后猜哪个是电脑。
如果你猜错的概率超过 30%——图灵就说,这台电脑通过了"图灵测试",可以算"有智能"。
2014 年英国一个叫 Eugene Goostman 的聊天机器人(伪装成一个 13 岁乌克兰少年)勉强通过了这个测试;到了 2022 年 ChatGPT 出现,这个测试基本上"过时"了——它太容易通过。

1956 · 一个夏天,AI 有了名字

1956 年夏天,达特茅斯学院(Dartmouth College)——一所美国常春藤名校——办了一场为期两个月的研讨会。发起人是四位年轻教授:McCarthy(麦卡锡)、Minsky(明斯基)、Shannon(信息论之父香农)、Rochester(IBM 首席)。

他们在申请经费的报告里写了这么一句话:

1956 · 历史原文

"We propose that a 2-month, 10-man study of artificial intelligence be carried out during the summer of 1956..."(我们建议在 1956 年夏天,进行一项为期两个月、十人参加的关于"人工智能"的研究……)

就是这份报告——第一次把"Artificial Intelligence"这个词写在纸上。1956 年从此被公认为 AI 的诞生年,达特茅斯会议被称为 AI 的"独立宣言"。

1958 · 第一个真正会学习的机器

1958 年,Cornell 大学的心理学家 Rosenblatt(罗森布拉特)造出了历史上第一台"神经网络机器"——叫 Perceptron(感知机)。它是一台真的"能自己学"的机器——由 400 个光电管组成,能识别简单的图案(比如三角形和正方形)。

《纽约时报》1958 年头版刊登:

1958 · 《纽约时报》原文

"海军今天披露了一种电子计算机的雏形,它未来预期能行走、说话、看见、写作、自我复制,并意识到自己的存在"

—— 是不是很眼熟?换个年份、换个词,几乎和今天媒体报道 AGI 的调子一模一样。AI 的历史,很大一部分是媒体史,不是技术史。

1969–1980 · 第一次寒冬

热闹归热闹,感知机很快撞墙了。1969 年,MIT 的 Minsky(就是达特茅斯会议那位)和 Papert 合著了一本书《Perceptrons》,用严谨的数学证明——单层感知机连最简单的"XOR 异或"逻辑都学不会。

这本书像一盆冷水,浇灭了神经网络方向的所有希望。政府撤资、学界转向,接下来的十年里,"神经网络"这四个字几乎成了学术界的禁忌——谁研究这个谁申请不到经费。这就是"第一次 AI 寒冬"(约 1974–1980)。

Analogy · 一个婴儿的失踪

神经网络就像一个被寄予厚望的婴儿——生下来时全家人都觉得他会是天才,结果十年后发现他连一句完整的话都说不出来,全家失望,把他"锁"进了地下室。
直到 30 年后(2012 年)人们才发现,那婴儿其实没病——只是当时给他的"食物"(数据)和"训练环境"(算力)根本不够。

1980s · 专家系统的黄金十年

神经网络凉了,另一派 AI 却火起来——专家系统(Expert System)。思路很简单:既然让机器"自己学"不行,那我就把某个领域最有经验的专家的知识一条条抄成规则,让机器照着规则做决策。

举个例子
💊 医生怎么诊断咳嗽?

专家系统的思路:找一位老医生,把他脑子里的判断规则挖出来——

"如果咳嗽 + 发烧 + 咽痛 → 感冒;
如果咳嗽 + 咳痰黄 + 胸痛 → 肺炎;
如果咳嗽 + 咳血 + 消瘦 → 高度怀疑结核……"

然后把成百上千条这样的规则输进电脑。病人来了,机器一条条对照,给出诊断建议。
——这就是当年真实存在的一款系统 MYCIN(斯坦福大学,1970s),在细菌感染诊断上表现和资深医生差不多。

专家系统开始赚钱了——1980 年代美国 DEC 公司用一个叫 XCON 的专家系统给客户配电脑,一年省了 4000 万美元。日本政府发起"第五代计算机计划",投入 8.5 亿美元研发 AI;美国 DARPA、欧洲各国全部跟进。整个 80 年代,AI 相关公司市值一路飙升。

Analogy · 一本厚厚的操作手册

专家系统听着玄,其实就是新人上岗第一天被塞到手里的那本厚厚的操作手册手册上写满了"如果客人这么问,你就那么答;如果遇到这种情况,你就走那个流程"。写手册的人是干了二十年的老师傅,所以手册上写着的那些情况,新人办得比老师傅还快还准。

它的天花板也就藏在这里:翻到手册上没写的那一页,机器当场傻眼。而现实里"没写的那一页"多到令人绝望——老医生看病不只对照症状表,他还会看人的脸色、听咳嗽的音调、闻气味、注意病人说话时眼神躲不躲。这些东西他自己都说不清是怎么判断的,你怎么让他抄成规则?

第二个毛病是维护成本。医学在进步、新药在出,手册得不停改版。养一本手册的成本,最后比直接雇几个老师傅还贵。

第三个毛病最尴尬:手册自己会打自己。两条规则撞上了怎么办?机器不像人会"哦这两条得看情况",它只会当场卡死,或者给出一个荒唐得让人发笑的建议。好比手册第 12 页说"下雨天关窗",第 88 页说"闷热时开窗",碰上一个闷热的雨天,机器就在那儿死循环了。

1987–1993 · 第二次寒冬

好景不长。专家系统有几个致命毛病:

加上通用 PC 崛起,很多专用 AI 硬件(Lisp 机器)破产。1987 年 AI 硬件市场一夜崩盘——这就是"第二次 AI 寒冬"。日本第五代计算机计划到 1992 年宣告失败;DARPA 撤资;"AI"这个词又一次成了禁忌,很多研究者只好把自己的论文改称"机器学习""模式识别""认知计算"来蒙混过关。

1990s · 静悄悄的复苏

90 年代看似冷清,其实 AI 底子在悄悄进化——只是不叫"AI"了,叫"机器学习"。这十年出了一系列今天仍然是主力的算法:

年份成果今天在哪里用
1986反向传播(Rumelhart 等重新发现)今天所有神经网络训练的基础
1989LeCun 用 CNN 识别手写邮政编码今天所有手机的相机识别
1995SVM 支持向量机今天很多风控、生物识别
1997LSTM 长短期记忆网络2017 年前所有语音识别

1997 · 深蓝击败卡斯帕罗夫

1997 年 5 月 11 日,纽约。IBM 深蓝(Deep Blue)与国际象棋世界冠军 Garry Kasparov(加里·卡斯帕罗夫)对弈的第六局。深蓝走了一步反直觉的怪棋,卡斯帕罗夫百思不得其解——他猜想 IBM 一定作弊——但棋输了就是输了。终局 3.5 : 2.5,AI 首次击败人类棋王。

深蓝的下棋方式换成大白话它压根不"懂"棋,它干的活儿相当于一个人在超市里为了买最划算的一袋米,把货架上所有牌子的价格、重量、产地全部抄下来,一个一个算单价——只不过它每一步要算两亿种可能。它没有"棋感",只有算力。

这也决定了它的天花板在哪。好比那种"超市里所有商品一共只有一百样"的情况,你确实可以全部比一遍。可等到围棋出现——棋盘上的局面数比宇宙里的原子总数还多——这就不是"超市"了,而是"把全世界所有超市的所有商品排列组合一遍"。再快的算力,也没法把一个比宇宙原子更大的清单抄完。

Analogy · 深蓝其实很"笨"

深蓝并不"聪明"——它是靠暴力搜索赢的:每一步在 2 亿种可能棋局里遍历、评估、找最优。它没有"棋感",只有算力。
这就是符号主义 AI 的巅峰,也是它的天花板——它只能赢下"规则完全明确、状态空间可枚举"的游戏。等到围棋出现(棋盘 19×19,状态数 > 宇宙原子总数),暴力搜索就不管用了。

2006 · Hinton 复活神经网络

神经网络的地下室生涯,一躲就是 30 年。有位加拿大教授叫 Geoffrey Hinton(杰弗里·辛顿)——被称为"深度学习教父"。他从 70 年代起就死磕神经网络,学界几乎所有人都说他方向错了,他不管。

2006 年,Hinton 发了一篇论文,展示"深度置信网络"(DBN)可以有效地训练"深"的神经网络——之前深层网络训不动的问题被他找到了突破口。这一年被称为"深度学习"这个词正式登台的元年。但学界仍将信将疑。

2012 · AlexNet 一鸣惊人

2012 年 9 月,一场叫 ImageNet 的图像识别比赛结果公布——这是学界最权威的"AI 高考",任务是把 128 万张图片分成 1000 类。往年冠军的错误率都在 26% 上下。

这一年的冠军 AlexNet(Hinton 和他两个学生做的深度神经网络)——把错误率一下子干到了 15.3%。差距之大让所有人震惊。第二名(用传统方法)是 26.2%。

先把"128 万张图片、1000 类"这个规模翻译成人话相当于让一个人从早到晚不停地看照片,每张只看一秒钟,也要连着看十五天不睡觉才能过一遍。而这场比赛要求机器不只是看完,还要把每一张准确归到一千个类别里的某一个——这一千个类别细到能区分"金毛"和"拉布拉多"。

再说说"错误率从 26% 降到 15%"这十一个百分点换成大白话是什么概念。往年各家的成绩都挤在 26% 上下,一年进步一两个点就算大突破。好比一场考试全场平均分几十年来都卡在 74 分,每年最多提高一分——忽然有一年有人考了 85 分。这不叫进步,这叫换了一种解题方式。

Analogy · 一次高考成绩单

就好比某届高考,全国平均分 500,最高分往年 600 就到顶了。忽然有个学生考了 800 分——那不是"进步一点",是降维打击。整个赛道立刻明白:深度学习是玩真的。

从此,学界所有人调头奔向深度学习。谷歌、Facebook、微软疯狂高薪挖 AI 博士。Hinton 的公司被谷歌以 4400 万美元收购——三个人只有几行代码和几张 GPU。第三次 AI 浪潮正式开启。

2014 · GAN 和"造假高手"诞生

2014 年,一位叫 Ian Goodfellow(伊恩·古德费罗)的博士生在酒吧喝酒时想到一个鬼点子:让两个神经网络对抗——一个负责造假图,一个负责鉴定真假;两个不停博弈,造假的越来越像真的。这就是 GAN(生成对抗网络)。GAN 是"生成式 AI"的第一次爆发——AI 从此不只能"识别",还能"创造"。今天你看到的换脸、老照片修复、AI 换装,几乎都是 GAN 或它的后代。

2016 · AlphaGo 击败李世石

如果说深蓝赢国际象棋是"意料之中的震撼",那 2016 年 3 月,谷歌 DeepMind 的 AlphaGo 战胜韩国九段棋手 李世石,就是"完全不可能的可能"。

围棋比国际象棋复杂得多——状态数是 10 的 170 次方,比宇宙原子总数还多。暴力搜索永远搜不完。业内当时的共识是:"围棋 AI 击败人类,至少还要 20 年。"

结果 5 局比赛,AlphaGo 4:1 胜出。第二局第 37 手,AlphaGo 走出一步违反 3000 年围棋直觉的怪棋——一开始所有解说员都以为它算错了。40 步之后,才发现那是招神来之笔——事后被业界誉为"上帝之手"。

Analogy · "人类最后的堡垒"陷落

围棋一直被视为"人类最后的智力堡垒"——因为它比象棋复杂得多、更依赖直觉。AlphaGo 一赢,全世界忽然意识到:如果连围棋都能被 AI 攻下,那还有什么是 AI 攻不下的?
这一战之后,"AI"成了大众词汇。2016 年后所有创业公司都要在名字后面加个 "AI"。资本、政策、媒体全面涌入。

2017 · Transformer · 一切的开始

2017 年 6 月,谷歌 8 位研究员在 arxiv 上上传了一篇论文:《Attention Is All You Need》。这篇论文提出了一种新的神经网络结构——Transformer

论文标题里那个 "Attention"(注意力)成了今天大模型的核心机制。ChatGPT、Claude、DeepSeek、Sora——所有你听说过的当代大模型,都是 Transformer 的孩子或孙子。如果说 AI 的历史只能记住一个技术名词,那就是 Transformer。

Analogy · 那 8 个作者的命运

这 8 位作者,2024 年时几乎没有一个还在谷歌——他们分别创办了 Character.ai(AI 陪聊)、Cohere(企业级 AI)、Adept(Agent 公司)、Essential AI……每个人都成了亿万富翁或独角兽 CEO。
有人开玩笑:那篇论文是历史上最贵的一次员工流失。

2018–2020 · 大模型崛起

Transformer 一出,各家公司立刻用它训练超大模型:

下面那些"多少亿参数"的数字,换成大白话就是"这台机器上有多少个可以拧的旋钮"一台家用洗衣机上有五个旋钮;GPT-1 有 1.17 亿个;GPT-3 有 1750 亿个。1750 亿是什么感觉?假设你一秒钟拧一个旋钮,不吃不喝不睡,拧完一遍要五千五百多年——而训练一次要把每个旋钮反复调整成千上万遍。这就是为什么训练大模型必须动用整个机房的显卡。

还有一个词值得先翻译成人话few-shot 学习(Few-shot Learning,只给几个例子它就会办了)。好比你带一个新人做报表,不用给他写手册,只需在他面前做两三遍,他就能照着办剩下的三百份。GPT-3 第一次表现出这种能力,才是当年真正让业界震惊的地方——之前的模型都得为每个新任务专门再训练一轮。

2022.11.30 · ChatGPT 横空出世

OpenAI 本来只是想给 GPT-3.5 做个"对话演示",团队内部觉得"没啥新意",随手就发布了。2 个月内 1 亿用户——史上增长最快的消费级产品。

2022 年冬天的空气
🌐 一夜之间,全世界都在聊 AI

你的表哥、你的班主任、你的爷爷都开始问你:"这个 ChatGPT 是啥?"社交媒体每天几十条"我让 AI 写了个……"投资人挤破头找 AI 项目;比尔·盖茨说"这是他一生见过的两次最震撼的技术之一"(另一次是 1980 年他第一次看见图形界面);马斯克警告 AI 风险;欧盟连夜写监管草案;教育部长们急着讨论"学生用 AI 写作业怎么办"……

这一切,都发生在 2 个月里。2022 年 12 月,可能是过去 20 年科技界最疯狂的一个月。

2023 · "百模大战"

看到 ChatGPT 的惊人爆红,全世界所有大厂都在 3 个月内挤出自己的大模型。这一年被称为"百模大战":

时间发布意义
2023.2Meta Llama(开源)打开了"开源大模型"的口子,从此人人可玩
2023.3OpenAI GPT-4比 GPT-3.5 强得多,多模态雏形
2023.3百度文心一言中国第一款对标 ChatGPT 的产品
2023.7Anthropic Claude 2超长文本擅长,主打安全
2023.8阿里通义千问、字节豆包、月之暗面 Kimi 陆续发布中国百模齐发
2023.11OpenAI 内讧 · Sam Altman 被董事会解雇又回归史上最戏剧化的 5 天

2024 · 多模态与推理模型

AI 不再只是聊天工具——它开始"看"、"听"、"想":

2025 · Agent 元年 & 推理白菜价

2025 年被业内公认为"AI Agent 元年"——AI 不再只回答问题,而是自己动手完成任务:帮你订机票、写整个软件、自动做研究报告。

Agent(智能体,能自己一步步动手把事办完的 AI)这个词听着玄,其实就是从"问路的人"变成了"跑腿的人"。以前你问它"去机场怎么走",它给你讲得清清楚楚;现在你说"帮我订张明天去上海的票",它自己打开网页、比价、填信息、付款。好比你在餐厅里,服务员从"只能背菜单给你听",变成了"你说一句'随便来点清淡的',他自己进厨房安排好一整桌"。

那个"两年降了 200 倍"的推理成本也值得翻译成人话2022 年问 AI 一百万字的问题,花的钱够买两杯咖啡;到 2025 年,同样的量花的钱不够买一根牙签。为什么这件事比任何一次模型发布都重要?因为它意味着 AI 从"公司才用得起的东西"变成了"随手就能用的东西"——好比电话从按分钟计费的奢侈品,变成了包月不限量的日常。价格塌下来的那一刻,才是一项技术真正开始改变普通人生活的时刻。

2026 · 我们此刻在哪

你正在读这篇文章的 2026 年,AI 处在这么一个位置:

已经解决

语言与知识

模型的语言能力、知识广度已经全面超过普通人,接近专业人士。

正在解决

推理与长任务

o3、R1 一代模型让 AI 能做多步推理和复杂任务规划,但仍然不稳定。

远未解决

物理世界 & 持续学习

AI 仍然不能真正"操作物理世界",也不能像人一样"边工作边成长"。

历史给我们的三个启示

把这三条翻译成人话放在前面:第一,别信"再过几年就怎样"——顶尖学者预测了七十年,基本每次都错。第二,好点子光有想法不够,还得等到"粮草"和"体力"都到位。神经网络这个点子在冷板凳上坐了三十年,不是它错了,是当年既没有足够的数据喂它、也没有足够的算力练它。第三,退潮之后的复苏,力量总比上一次大。

第二条好比什么?一位天生嗓子极好的孩子被送去学声乐,可那个年代他家里既没钱请老师,也吃不上一顿饱饭。三十年后条件齐了,他才唱出名。当年说他"没天赋"的人,其实只是看错了原因。这一条对今天最有用的启示是:下次你看到某个"明显走不通"的技术方向,先问一句——它是思路错了,还是只是粮草没到?

Recap · 收束

AI 70 年,三起三落。今天我们坐在第三次浪潮的浪尖上——它可能是最后一波,也可能只是下一个寒冬前的高峰。历史上有一件事是确定的:每次以为 AI 就要成功了,它都会跌一跤;每次以为它彻底完了,它都会站起来
这条 70 年的长跑还没到终点,可能你正好赶上——最好玩的那一段。

☰ 主页
Xue Hai Wu Ya · Chapter 03 · A Brief History of AI