第 3 章 · 简史篇
你今天用 ChatGPT 聊天觉得理所当然。但你知道吗?AI 已经悄悄走过了 70 年——中间被人类"抛弃"过两次,几乎快死了。这一章不讲技术,只讲故事——一个"人类和机器智能"的爱恨长跑。
你手机屏幕解锁了——刷脸;你打开抖音——被推了 5 个你会喜欢的视频;你问 ChatGPT 一个问题——它秒回;你让 Siri 定个闹钟——她说好。这些"理所当然",其实每一件都是70 年血泪史里某位科学家没日没夜熬出的成果。
让我们从头讲起——从 1943 年,一个心理学家和一个数学家坐在一起,试图搞明白"人的大脑到底怎么想事情"开始。
三次大潮 · 一张全景图
AI 历史像海浪:一波起、一波落,每一波都以为自己是最后一波。到 2026 年为止,AI 大概经历了三次这样的浪潮:
符号主义 · 1950s–1980s
信念:"智能 = 逻辑推理"。人写规则、机器执行。
代表:定理证明、专家系统、下棋程序。
结局:规则写不完,遇到复杂现实就傻——寒冬来临。
统计学习 · 1990s–2010s
信念:"智能 = 从数据里找规律"。用数学模型学。
代表:SVM、随机森林、贝叶斯网络。
结局:能学但学不深,处理不了图像、语音那种复杂结构。
深度学习 · 2012–今天
信念:"智能 = 大数据 + 深层网络 + 大算力"。
代表:CNN、Transformer、大语言模型。
结局:还在爆发中——ChatGPT、Sora、Claude 都是这一波产物。
1940s–1950s · 神经元与图灵之问
故事开始于 1943 年。心理学家 McCulloch(麦卡洛克)和数学家 Pitts(皮茨)合作发了一篇论文——他们发现,大脑里的神经元可以用简单的"是 / 否"逻辑运算来模拟。这是史上第一个"人工神经元"的数学模型——一切的开端。
1950 年,英国天才数学家 Alan Turing(艾伦·图灵)——就是那个二战破译德军密码、后来被苹果 logo 纪念的人——写了一篇著名论文《Computing Machinery and Intelligence》。他没有回答"机器能不能思考"这个问题,而是狡猾地问:如果一台机器能骗过你,让你分不清对面是人还是机器,那你说它算不算有智能?
想象你坐在一间屋里,跟两个"看不见的人"用打字机聊天。左边帘子后是真人,右边帘子后是电脑。你可以问任何问题,5 分钟后猜哪个是电脑。
如果你猜错的概率超过 30%——图灵就说,这台电脑通过了"图灵测试",可以算"有智能"。
2014 年英国一个叫 Eugene Goostman 的聊天机器人(伪装成一个 13 岁乌克兰少年)勉强通过了这个测试;到了 2022 年 ChatGPT 出现,这个测试基本上"过时"了——它太容易通过。
1956 · 一个夏天,AI 有了名字
1956 年夏天,达特茅斯学院(Dartmouth College)——一所美国常春藤名校——办了一场为期两个月的研讨会。发起人是四位年轻教授:McCarthy(麦卡锡)、Minsky(明斯基)、Shannon(信息论之父香农)、Rochester(IBM 首席)。
他们在申请经费的报告里写了这么一句话:
"We propose that a 2-month, 10-man study of artificial intelligence be carried out during the summer of 1956..."(我们建议在 1956 年夏天,进行一项为期两个月、十人参加的关于"人工智能"的研究……)
就是这份报告——第一次把"Artificial Intelligence"这个词写在纸上。1956 年从此被公认为 AI 的诞生年,达特茅斯会议被称为 AI 的"独立宣言"。
1958 · 第一个真正会学习的机器
1958 年,Cornell 大学的心理学家 Rosenblatt(罗森布拉特)造出了历史上第一台"神经网络机器"——叫 Perceptron(感知机)。它是一台真的"能自己学"的机器——由 400 个光电管组成,能识别简单的图案(比如三角形和正方形)。
《纽约时报》1958 年头版刊登:
"海军今天披露了一种电子计算机的雏形,它未来预期能行走、说话、看见、写作、自我复制,并意识到自己的存在。"
—— 是不是很眼熟?换个年份、换个词,几乎和今天媒体报道 AGI 的调子一模一样。AI 的历史,很大一部分是媒体史,不是技术史。
1969–1980 · 第一次寒冬
热闹归热闹,感知机很快撞墙了。1969 年,MIT 的 Minsky(就是达特茅斯会议那位)和 Papert 合著了一本书《Perceptrons》,用严谨的数学证明——单层感知机连最简单的"XOR 异或"逻辑都学不会。
这本书像一盆冷水,浇灭了神经网络方向的所有希望。政府撤资、学界转向,接下来的十年里,"神经网络"这四个字几乎成了学术界的禁忌——谁研究这个谁申请不到经费。这就是"第一次 AI 寒冬"(约 1974–1980)。
神经网络就像一个被寄予厚望的婴儿——生下来时全家人都觉得他会是天才,结果十年后发现他连一句完整的话都说不出来,全家失望,把他"锁"进了地下室。
直到 30 年后(2012 年)人们才发现,那婴儿其实没病——只是当时给他的"食物"(数据)和"训练环境"(算力)根本不够。
1980s · 专家系统的黄金十年
神经网络凉了,另一派 AI 却火起来——专家系统(Expert System)。思路很简单:既然让机器"自己学"不行,那我就把某个领域最有经验的专家的知识一条条抄成规则,让机器照着规则做决策。
专家系统的思路:找一位老医生,把他脑子里的判断规则挖出来——
"如果咳嗽 + 发烧 + 咽痛 → 感冒;
如果咳嗽 + 咳痰黄 + 胸痛 → 肺炎;
如果咳嗽 + 咳血 + 消瘦 → 高度怀疑结核……"
然后把成百上千条这样的规则输进电脑。病人来了,机器一条条对照,给出诊断建议。
——这就是当年真实存在的一款系统 MYCIN(斯坦福大学,1970s),在细菌感染诊断上表现和资深医生差不多。
专家系统开始赚钱了——1980 年代美国 DEC 公司用一个叫 XCON 的专家系统给客户配电脑,一年省了 4000 万美元。日本政府发起"第五代计算机计划",投入 8.5 亿美元研发 AI;美国 DARPA、欧洲各国全部跟进。整个 80 年代,AI 相关公司市值一路飙升。
1987–1993 · 第二次寒冬
好景不长。专家系统有几个致命毛病:
- 规则写不尽一个真正老练的医生脑子里的判断远不止一千条——他会看人的脸色、听咳嗽的音调、闻气味,这些根本没法翻译成规则。
- 维护极贵医学在进步、新药出现,规则要不停更新。养一个专家系统的成本比雇几个专家还贵。
- 脆弱易崩规则冲突时机器就死机,或者给出滑稽的建议。
加上通用 PC 崛起,很多专用 AI 硬件(Lisp 机器)破产。1987 年 AI 硬件市场一夜崩盘——这就是"第二次 AI 寒冬"。日本第五代计算机计划到 1992 年宣告失败;DARPA 撤资;"AI"这个词又一次成了禁忌,很多研究者只好把自己的论文改称"机器学习""模式识别""认知计算"来蒙混过关。
1990s · 静悄悄的复苏
90 年代看似冷清,其实 AI 底子在悄悄进化——只是不叫"AI"了,叫"机器学习"。这十年出了一系列今天仍然是主力的算法:
| 年份 | 成果 | 今天在哪里用 |
|---|---|---|
| 1986 | 反向传播(Rumelhart 等重新发现) | 今天所有神经网络训练的基础 |
| 1989 | LeCun 用 CNN 识别手写邮政编码 | 今天所有手机的相机识别 |
| 1995 | SVM 支持向量机 | 今天很多风控、生物识别 |
| 1997 | LSTM 长短期记忆网络 | 2017 年前所有语音识别 |
1997 · 深蓝击败卡斯帕罗夫
1997 年 5 月 11 日,纽约。IBM 深蓝(Deep Blue)与国际象棋世界冠军 Garry Kasparov(加里·卡斯帕罗夫)对弈的第六局。深蓝走了一步反直觉的怪棋,卡斯帕罗夫百思不得其解——他猜想 IBM 一定作弊——但棋输了就是输了。终局 3.5 : 2.5,AI 首次击败人类棋王。
深蓝并不"聪明"——它是靠暴力搜索赢的:每一步在 2 亿种可能棋局里遍历、评估、找最优。它没有"棋感",只有算力。
这就是符号主义 AI 的巅峰,也是它的天花板——它只能赢下"规则完全明确、状态空间可枚举"的游戏。等到围棋出现(棋盘 19×19,状态数 > 宇宙原子总数),暴力搜索就不管用了。
2006 · Hinton 复活神经网络
神经网络的地下室生涯,一躲就是 30 年。有位加拿大教授叫 Geoffrey Hinton(杰弗里·辛顿)——被称为"深度学习教父"。他从 70 年代起就死磕神经网络,学界几乎所有人都说他方向错了,他不管。
2006 年,Hinton 发了一篇论文,展示"深度置信网络"(DBN)可以有效地训练"深"的神经网络——之前深层网络训不动的问题被他找到了突破口。这一年被称为"深度学习"这个词正式登台的元年。但学界仍将信将疑。
2012 · AlexNet 一鸣惊人
2012 年 9 月,一场叫 ImageNet 的图像识别比赛结果公布——这是学界最权威的"AI 高考",任务是把 128 万张图片分成 1000 类。往年冠军的错误率都在 26% 上下。
这一年的冠军 AlexNet(Hinton 和他两个学生做的深度神经网络)——把错误率一下子干到了 15.3%。差距之大让所有人震惊。第二名(用传统方法)是 26.2%。
就好比某届高考,全国平均分 500,最高分往年 600 就到顶了。忽然有个学生考了 800 分——那不是"进步一点",是降维打击。整个赛道立刻明白:深度学习是玩真的。
从此,学界所有人调头奔向深度学习。谷歌、Facebook、微软疯狂高薪挖 AI 博士。Hinton 的公司被谷歌以 4400 万美元收购——三个人只有几行代码和几张 GPU。第三次 AI 浪潮正式开启。
2014 · GAN 和"造假高手"诞生
2014 年,一位叫 Ian Goodfellow(伊恩·古德费罗)的博士生在酒吧喝酒时想到一个鬼点子:让两个神经网络对抗——一个负责造假图,一个负责鉴定真假;两个不停博弈,造假的越来越像真的。这就是 GAN(生成对抗网络)。GAN 是"生成式 AI"的第一次爆发——AI 从此不只能"识别",还能"创造"。今天你看到的换脸、老照片修复、AI 换装,几乎都是 GAN 或它的后代。
2016 · AlphaGo 击败李世石
如果说深蓝赢国际象棋是"意料之中的震撼",那 2016 年 3 月,谷歌 DeepMind 的 AlphaGo 战胜韩国九段棋手 李世石,就是"完全不可能的可能"。
围棋比国际象棋复杂得多——状态数是 10 的 170 次方,比宇宙原子总数还多。暴力搜索永远搜不完。业内当时的共识是:"围棋 AI 击败人类,至少还要 20 年。"
结果 5 局比赛,AlphaGo 4:1 胜出。第二局第 37 手,AlphaGo 走出一步违反 3000 年围棋直觉的怪棋——一开始所有解说员都以为它算错了。40 步之后,才发现那是招神来之笔——事后被业界誉为"上帝之手"。
围棋一直被视为"人类最后的智力堡垒"——因为它比象棋复杂得多、更依赖直觉。AlphaGo 一赢,全世界忽然意识到:如果连围棋都能被 AI 攻下,那还有什么是 AI 攻不下的?
这一战之后,"AI"成了大众词汇。2016 年后所有创业公司都要在名字后面加个 "AI"。资本、政策、媒体全面涌入。
2017 · Transformer · 一切的开始
2017 年 6 月,谷歌 8 位研究员在 arxiv 上上传了一篇论文:《Attention Is All You Need》。这篇论文提出了一种新的神经网络结构——Transformer。
论文标题里那个 "Attention"(注意力)成了今天大模型的核心机制。ChatGPT、Claude、DeepSeek、Sora——所有你听说过的当代大模型,都是 Transformer 的孩子或孙子。如果说 AI 的历史只能记住一个技术名词,那就是 Transformer。
这 8 位作者,2024 年时几乎没有一个还在谷歌——他们分别创办了 Character.ai(AI 陪聊)、Cohere(企业级 AI)、Adept(Agent 公司)、Essential AI……每个人都成了亿万富翁或独角兽 CEO。
有人开玩笑:那篇论文是历史上最贵的一次员工流失。
2018–2020 · 大模型崛起
Transformer 一出,各家公司立刻用它训练超大模型:
- 2018.6OpenAI 发布 GPT-1,1.17 亿参数——当时觉得很大。
- 2018.10谷歌发布 BERT,3.4 亿参数——用于搜索排序,一下把 Google 搜索质量提升一大截。
- 2019.2OpenAI 发布 GPT-2,15 亿参数——首次能"接着写文章",OpenAI 声称"太危险不敢发布完整版"。
- 2020.6GPT-3 发布,1750 亿参数——首次表现出"few-shot 学习"能力,业界震惊。
2022.11.30 · ChatGPT 横空出世
OpenAI 本来只是想给 GPT-3.5 做个"对话演示",团队内部觉得"没啥新意",随手就发布了。2 个月内 1 亿用户——史上增长最快的消费级产品。
你的表哥、你的班主任、你的爷爷都开始问你:"这个 ChatGPT 是啥?"社交媒体每天几十条"我让 AI 写了个……"投资人挤破头找 AI 项目;比尔·盖茨说"这是他一生见过的两次最震撼的技术之一"(另一次是 1980 年他第一次看见图形界面);马斯克警告 AI 风险;欧盟连夜写监管草案;教育部长们急着讨论"学生用 AI 写作业怎么办"……
这一切,都发生在 2 个月里。2022 年 12 月,可能是过去 20 年科技界最疯狂的一个月。
2023 · "百模大战"
看到 ChatGPT 的惊人爆红,全世界所有大厂都在 3 个月内挤出自己的大模型。这一年被称为"百模大战":
| 时间 | 发布 | 意义 |
|---|---|---|
| 2023.2 | Meta Llama(开源) | 打开了"开源大模型"的口子,从此人人可玩 |
| 2023.3 | OpenAI GPT-4 | 比 GPT-3.5 强得多,多模态雏形 |
| 2023.3 | 百度文心一言 | 中国第一款对标 ChatGPT 的产品 |
| 2023.7 | Anthropic Claude 2 | 超长文本擅长,主打安全 |
| 2023.8 | 阿里通义千问、字节豆包、月之暗面 Kimi 陆续发布 | 中国百模齐发 |
| 2023.11 | OpenAI 内讧 · Sam Altman 被董事会解雇又回归 | 史上最戏剧化的 5 天 |
2024 · 多模态与推理模型
AI 不再只是聊天工具——它开始"看"、"听"、"想":
- 2024.2 · SoraOpenAI 发布文生视频模型 Sora,一段几十秒的视频从此可以由几行文字生成。全球影视行业震动。
- 2024.5 · GPT-4oOmni(全能)版 GPT——语音、文字、图像输入输出,同一个模型。它能"听你的语气"、"看你的表情",几乎像真人对话。
- 2024.9 · o1OpenAI 首个"推理模型"——能像人一样"停下来多想几步",解奥数题、编程题的能力大幅提升。
- 2024.12 · DeepSeek-V3中国开源模型 DeepSeek-V3 性能追上顶级闭源模型,成本只有 1/10,震动硅谷。
2025 · Agent 元年 & 推理白菜价
2025 年被业内公认为"AI Agent 元年"——AI 不再只回答问题,而是自己动手完成任务:帮你订机票、写整个软件、自动做研究报告。
- 2025.1 · DeepSeek-R1中国团队用极低成本训出与 OpenAI o1 相当的推理模型,全球开源可用。美国科技股一天蒸发万亿美元——业界称为"DeepSeek 时刻"。
- 2025 全年Claude Computer Use、GPT Agent、Manus、TRAE 等"能自己动电脑"的 Agent 产品相继落地。
- 推理成本从 2022 年 ChatGPT 发布时的 $20/M tokens,到 2025 年主流模型 $0.1/M tokens——两年降了 200 倍。
2026 · 我们此刻在哪
你正在读这篇文章的 2026 年,AI 处在这么一个位置:
语言与知识
模型的语言能力、知识广度已经全面超过普通人,接近专业人士。
推理与长任务
o3、R1 一代模型让 AI 能做多步推理和复杂任务规划,但仍然不稳定。
物理世界 & 持续学习
AI 仍然不能真正"操作物理世界",也不能像人一样"边工作边成长"。
历史给我们的三个启示
- 别信"再过 X 年"每次 AI 顶尖学者预测"再过 20 年就实现 X",几乎都错了——要么低估(下棋),要么高估(AGI)。
- 数据、算力、算法缺一不可神经网络在冷板凳上坐了 30 年,不是因为思路错——是因为当时缺"食物"(数据)和"锻炼"(算力)。三者到位它就爆发。
- 寒冬后往往是最凶猛的爆发每一次寒冬后的复苏,力量都比上一次大得多。关键不是"AI 什么时候来",而是"下一次寒冬后 AI 会变成什么样"。
AI 70 年,三起三落。今天我们坐在第三次浪潮的浪尖上——它可能是最后一波,也可能只是下一个寒冬前的高峰。历史上有一件事是确定的:每次以为 AI 就要成功了,它都会跌一跤;每次以为它彻底完了,它都会站起来。
这条 70 年的长跑还没到终点,可能你正好赶上——最好玩的那一段。