通用 AI · AGI
通用 AI(AGI)是 AI 的"圣杯"——一台机器像人一样能干任何智力活:今天学下棋,明天学开车,后天学做菜。它是不是已经出现了?答案是——没有,但比过去任何时候都更近。这一节要做的是把这个被滥用到失真的词拆开:它到底怎么定义、拿什么测、难点卡在哪几处、今天的大模型算不算雏形、各家给出的时间表相差多远、以及通往它的路线为什么会分裂成互相攻击的几派。
弱 AI 像"考试型学生"——某科目考满分,其他科目一问三不知。
AGI 更像刚毕业的"实习生"——什么活都能上手、都能学、都能触类旁通。给他一份新任务,他自己规划、查资料、试错、完成。这样的 AI 至今不存在——但今天的大模型让它的轮廓越来越清晰。
这个词从哪来:一段被遗忘再复活的历史
"AGI"这个缩写并不是老词。它在 2000 年代初被 Shane Legg(后来 DeepMind 的联合创始人)和 Ben Goertzel 等人推广开来,用意很明确:当时的"人工智能"这个招牌已经被专用系统占满了,做垃圾邮件过滤的、做语音识别的都叫 AI,于是那些真正想造"像人一样的智能"的研究者不得不另起一个名字,来区分自己在干什么。
先把 AGI 这个词本身翻译成人话:上一节那位"只会做一道菜的厨师",换成一个"换个厨房、换个菜系还能重新学起来的人",就是 AGI。更贴切的比方是医院里的全科医生对专科医生——专科大夫在自己那台手术上无人能及,全科大夫的本事是"什么都能接上手,接不上的知道该查什么、该问谁"。AGI 的门槛从来不是某一项能力有多强,而是"换个领域还能自己学起来"这件事能不能成立。
那个改名的动机也很好懂:相当于一个招牌被用滥了,正经做事的人只好另挂一块。就像"手工"这个词被贴到满街的机器货上之后,真正手作的店家只能改称"全手工定制"。AGI 这个缩写的诞生,本身就是"AI"这个词贬值的证据。
但这个野心本身比这个词老得多。1956 年达特茅斯会议的那份提案里写着一句极其自信的话:一群研究者打算用一个夏天的时间,让机器"使用语言、形成抽象和概念、解决目前留给人类的各类问题"。他们低估了难度大约七十年。1965 年,Herbert Simon 预言"二十年内机器就能做人所能做的任何工作";1970 年,Marvin Minsky 说"三到八年内我们将拥有一台具备普通人一般智力的机器"。这些预言全部落空,代价是 1974 年和 1987 年两次"AI 寒冬"——资金撤离、实验室关门、连"人工智能"这个词都变得羞于提起。
这段历史给我们的不是笑料,而是一条判断纪律:每一次 AI 出现能力跃升时,人们都会低估从"看起来会了"到"真的会了"之间的距离。读后面各家时间表的时候,请把这条纪律一直挂在旁边。
这条纪律有个很日常的对应:下山比上山难。爬到半山腰能看见山顶,你会觉得"就差一点了";但真正难走的往往是最后那段碎石坡,而且从山腰看过去,那段路是被前面的山体挡住的。"看起来会了"到"真的会了"之间那段路,就是被挡住的那一截。1965 年说"二十年就够"的人,看到的是山腰上那个清晰的山顶轮廓,而不是脚下那条还没铺出来的路。
AGI 的三个判定条件
跨领域能力
同一个模型能解数学题、写小说、写代码、看病历、说 30 种语言——不需要针对每件事重训。
自主学习
遇到没见过的任务,能自己找资料、试错、总结出方法——不需要人再喂它数据。
世界建模
脑子里有一套关于物理、时间、因果、社会的"常识",做事情不会违反常识。
这三条是骨架,但真要拿来判定一个系统,还得补上三条容易被忽略、却更能分辨真假的:
- 04 · 样本效率人类小孩看两三次就知道什么是"斑马",大模型要看几十万张图。AGI 的标志不是学得多,而是学得省——用极少的例子抓住规律,这叫 few-shot 甚至 one-shot 学习能力。今天的模型在文本上勉强做到了,在其他模态上还差得远。
- 05 · 持久记忆与身份连续性你昨天答应过的事今天还记得,你三年前学的技能今天还在。大模型每次对话结束就"失忆",上下文窗口一满前面的内容就被挤掉。没有跨会话的持续记忆,就没有"经验积累"这件事,也就谈不上成长。
- 06 · 元认知(知道自己不知道)人在超出能力边界时会说"这个我不懂"。一个校准良好的 AGI 应该能准确评估自身置信度,在该求助时求助。今天的大模型在这一点上表现糟糕——它编造答案时的语气和说真话时一模一样,这就是"幻觉"问题的本质。
把六条并排看,你会发现一个规律:前三条讲"能做什么",后三条讲"怎么做到的"。业界宣传总喜欢用前三条(因为可以刷榜单),而真正的分水岭藏在后三条。
后三条用生活场景各说一遍,你会立刻感觉到它们比前三条更硬。样本效率——小孩在动物园看两三次斑马就认得了,模型要看几十万张;说白了就是"举一反三"和"题海战术"的区别,前者是理解,后者只是见过。持久记忆——你三年前学的骑车今天还在,昨天答应的事今天还记得;而大模型每次对话结束就失忆,相当于一位每天上班都要从头认同事的前台,态度再好也攒不下经验。元认知——医院里靠得住的大夫会说"这个我拿不准,请专科看看",而大模型编造答案时的语气和说真话时一模一样,这就是"幻觉"最要命的地方。前三条能刷榜,后三条决定它到底能不能被托付一件真事。
怎么测:图灵测试为什么已经不够用了
1950 年,图灵在论文《计算机器与智能》里提出了那个著名的"模仿游戏":如果一个人通过文字对话无法分辨对面是人还是机器,我们就应该承认机器会思考。这个测试的历史价值极高——它第一次把"机器能否思考"这个哲学问题,转换成了一个可以实际操作的实验。
但七十多年后,它的三处硬伤已经暴露得很彻底:
第一,它测的是"骗人的能力",而不是"智能"。1966 年 Joseph Weizenbaum 写的 ELIZA 只有几百行规则代码,靠把用户的话改成疑问句反问回去,就让不少人相信自己在和心理医生对话——这就是著名的"ELIZA 效应":人类极易把智能投射到任何会说话的东西上。1991 年之后的历届 Loebner 竞赛里,最有效的策略常常是装成一个打字慢、爱跑题、故意打错字的青少年,而不是变得更聪明。
"ELIZA 效应"这个词换成大白话就是:只要对面会搭话,人就忍不住觉得那头有个人在。好比对着一台会应答的自动电话客服,你明知道是机器,还是会不自觉地说"谢谢"。这说明图灵测试其实测的是人的心理弱点,不是机器的智能水平。而在这项"测试"里,装成一个打字慢又跑题的青少年比真的变聪明有效得多——这就等于一场考试里最优策略是模仿差生的字迹,那这场考试压根测不出学习能力。
第二,它是纯文本的。图灵时代无法想象一个能写十四行诗却不能倒一杯水的系统。一个只在文字通道上被检验的智能,可以完全绕过物理世界、感知运动、空间推理这些人类智能的根基。
第三,今天的模型某种意义上已经"通过"了,但没人认为它是 AGI。2023 年之后的顶级大模型在短时长的图灵测试式实验中已经能让相当比例的受试者判断错误。可只要你跟它多聊两轮,让它算一算"我有三个苹果,吃掉两个,又买了一打,现在几个"这类需要稳定状态跟踪的题,或者问它"你上次跟我说的那件事后来怎样了",破绽立刻出现。图灵测试的失效不是因为机器太强,而是因为它测错了东西。
于是后来的研究者陆续提出了一批替代方案,共同特点是:把"看起来像人"换成"真的能完成某类只有智能体才能完成的事"。
这个转向很值得留意,因为它相当于把面试从"聊得来不来"改成了"给你一个真活儿,你做出来我看看"。前者能靠嘴皮子过关,后者不行。下面这几项测试,本质上就是几道现实的活儿:进一间陌生的厨房煮出一杯咖啡、去学校完整读完一个学位、拿一套宜家家具照着说明书装起来。共同点是:它们都不能靠背答案通过,必须真的在一个没见过的环境里把事情做成。
| 测试 | 提出者 / 年份 | 具体内容 | 它真正在测什么 |
|---|---|---|---|
| 咖啡测试 | Steve Wozniak | 让机器进入一个从未见过的普通住宅,找到厨房,找出咖啡机、咖啡粉、水杯,煮出一杯咖啡 | 具身智能 + 常识 + 陌生环境泛化。难点全在"从未见过"四个字上 |
| 大学考试测试 | Ben Goertzel | 让机器像学生一样报名、上课、做作业、参加考试,拿到一个真实学位 | 长周期学习 + 持久记忆 + 多科目迁移。刷题不算,要走完全流程 |
| 就业测试 | Nils Nilsson | 机器能胜任人类的大部分经济岗位,从流水线到写代码到做管理 | 经济意义上的通用性。这是最实用主义的一条判据 |
| 宜家测试 | 常被并列提出 | 拿到一套平板包装家具和说明书,独立组装完成 | 看图理解 + 多步规划 + 精细操作 + 出错纠正 |
| Winograd 模式 | Hector Levesque, 2011 | "奖杯放不进箱子,因为它太大了"——"它"指谁?改一个词答案就反转 | 常识消歧,无法靠词频统计蒙对(现代大模型已基本攻克) |
| ARC-AGI | François Chollet, 2019 | 给几个彩色网格的输入输出示例,推断规则并应用到新网格。题目刻意设计成网上搜不到 | 面对全新问题的抽象与推理效率,被认为是目前最接近"测通用性"的基准 |
ARC-AGI 值得多说一句,因为它体现了测试思路的根本转向。Chollet 的核心观点是:智能不是"掌握了多少技能",而是"获取新技能的效率"。一个背下了全世界棋谱的系统不聪明,一个看三个例子就悟出规则的系统才聪明。所以 ARC 的题目对人类小学生来说大多不难,但对靠海量数据吃饭的模型来说极其别扭——因为它没法从训练数据里"回忆"答案,必须现场推理。这套基准至今仍是衡量通用性最被认真对待的标尺之一。
Chollet 那句话翻译成人话就是:聪明不是"我背过多少题",而是"给我一道没见过的题,我多快能摸出门道"。好比两个学生同时面对一道全新的应用题——一个把三年的作业本翻遍找相似题,另一个直接看出题目的结构。ARC 刻意把题目设计成网上搜不到的样子,就是为了堵掉第一条路。结果很有意思:这些题对小学生大多不难,对靠海量数据吃饭的模型却极其别扭——因为它一辈子的本事都是"从见过的东西里找最像的那个",而这道题压根没有像的。
咖啡测试也值得再点一句,因为它把"难在哪"说得极准。难点全在"从未见过"这四个字上。让机器在实验室里那间摆好位置的厨房煮咖啡,早就做到了;难的是把它扔进一间陌生人家的厨房——咖啡机在哪个柜子里、水杯放在哪一层、这台机器的开关是按的还是旋的,全得现场摸清。这正是那位"只会一道菜的厨师"和一个真正会做饭的人之间的差距。
今天到哪一步了
| 能力维度 | 2020 年 | 2026 年今天 | 离 AGI 差距 |
|---|---|---|---|
| 语言理解 | 只能做窄任务 | 接近或超过普通人 | 已很接近 |
| 知识广度 | 需要领域微调 | 通用大模型覆盖几乎所有学科 | 已很接近 |
| 数学 / 推理 | 非常差 | 推理模型能解奥数题 | 还差一大截 |
| 长期规划 | 没有 | Agent 能做几步规划 | 差很多 |
| 物理世界经验 | 没有 | 仍然没有(除了机器人) | 差最远 |
| 自我改进 | 没有 | 基本没有 | 差最远 |
这张表最值得注意的是它的形状:越靠上的能力进步越快,越靠下的几乎没动。这不是巧合,而是当前技术路线的直接结果——凡是能被写成文本、能在互联网上找到海量样本的能力,都在飞速逼近人类;凡是需要在真实世界里试错、需要跨越很长时间跨度的能力,都还停在原地。语言和知识之所以先突破,是因为人类把这两样东西以文字形式大规模留存了下来;而"如何拧开一个卡住的瓶盖"这件事从来没人写下来过。
最后那句是整张表的钥匙,值得掰开说。人类把"知识"写了几千年的书,却从来没有人写下"怎么拧开一个卡住的瓶盖"。因为这件事没法写——手上用多大劲、什么时候该换个角度、垫块布是不是有用,全靠手感。凡是被写下来的,模型都学到了;凡是只存在于手上和身体里的,模型压根拿不到样本。这也解释了一个乍看荒谬的对比:AI 能通过律师资格考试,却没有一台机器人能可靠地把一堆洗好的衣服叠整齐。考试的答案有人写过,叠衣服的手感没人写过。
另一个容易被误读的点是"数学/推理"那一格。2024 年之后的推理型模型(先输出一长串思考过程再给答案的那类)在竞赛数学上确实取得了惊人的分数。但研究者也发现:把题目里的数字或人名换掉、加一句无关的干扰信息,正确率就会明显下滑。这提示它做的可能仍是"高级的模式匹配加上足够长的搜索",而不是人类那种理解式推理。这个判断至今没有定论,也正是路线之争的火药桶。
这个现象用考试的场景一比就很刺眼:把题目里的"小明"换成"小红"、把 12 改成 13,成绩就掉——这说明学生记住的是这道题的样子,不是这类题的道理。真懂的人换个数字照样会做,甚至会觉得"这不就是刚才那道题吗"。所以看到"某模型在竞赛数学上拿了高分"这类新闻时,值得追问一句:换个数字它还行吗?
今天最强的大模型像一个拥有博士级知识、却只有 3 岁运动 / 常识能力的怪物:能给你讲量子力学,但让它用夹子夹起一颗葡萄却办不到;能写小说,却记不住半小时前你告诉它的事。要变成 AGI,需要在"具身""长记忆""因果推理"上补课。
这个错位有个正式名字,叫 莫拉维克悖论(Moravec's Paradox):1980 年代机器人学家 Hans Moravec 发现,让计算机做微积分和下棋很容易,让它像一岁小孩那样走路、认脸、躲避障碍却极其困难。原因是进化用了几亿年打磨感知与运动能力,这套本能已经深埋在神经系统里、无法用语言表述;而抽象推理是最近几万年才长出来的薄薄一层,反而容易被形式化。凡是人类"不用想就会"的事,机器最难;凡是人类觉得"很费脑子"的事,机器往往最容易。
整节 AGI 的内容,可以完整地装进"医院里两种医生"这一对形象里。把它讲透,你就有了一把判断所有"这算不算 AGI"新闻的尺子。
一、专科医生就是上一节的弱 AI。他在自己那台手术上做了两千次,无人能及;但把他调到另一个科室,他得从头学起。更关键的是:他的本事是照着那台手术的流程长出来的,换个手术台,那套肌肉记忆帮不上忙。
二、全科医生就是 AGI 想要的样子。他不是每一项都比专科强——恰恰相反,他哪一项都不如专科。他的本事在别处:什么病都能先接上手,接不上的知道该查什么书、该转给谁;换个科室轮转三个月就能上岗;今天学的东西不会把去年学的挤掉;而且遇到没见过的情况,他会说"这个我拿不准"。注意这四样恰好就是本节讲的样本效率、迁移、持久记忆、元认知——AGI 的门槛从来不是某项能力多强,而是这四样能不能同时成立。
三、为什么"一万个专科医生"凑不出一个全科医生?因为他们之间没有一张共通的底图。你把一万位专科大夫塞进一间办公室,得到的是一万位专科大夫,不是一位全科——谁也调不动谁的经验,遇到一个跨科的病人,没人知道该从哪儿下手。这正是"堆多了会不会自动变通用"这场争论的核心。而人身上那张底图,是"病人是个整体、身体各处会互相影响"这种说不清但确实存在的常识。
四、今天的大模型像什么?像一个读完了全部医学教科书、能背出每一条指南,但从没碰过病人的实习生。你问他任何理论问题他都答得漂亮;但让他给一个躺在床上的人量血压、扶起来、判断脸色对不对,他全不行。这就是莫拉维克悖论:书上写过的它都会,只存在于手上和身体里的它全不会。
五、连"该怎么考他"这件事本身都还没定。图灵测试相当于面试时"聊得来不来"——嘴皮子好就能过。后来的咖啡测试、大学考试测试、宜家测试、ARC 全都换成了"给你一个真活儿":进一间陌生人家的厨房煮出一杯咖啡、去学校完整读完一个学位、照着说明书把一套家具装起来。共同点是这些活儿都不能靠背答案通过,必须真的在没见过的环境里把事做成。
六、最后一层最容易被忽略:这位"全科医生"至今连体检标准都没统一。不同公司对"什么算 AGI"的定义都不一样,时间预测从"三年"到"永远做不到",跨度大到本身就是最诚实的答案。所以更实用的姿态不是追问它哪天来,而是盯住那张能力表:每半年出的新模型,正在填补哪一格。
通用性为什么这么难:四道硬坎
把"离 AGI 有多远"这个模糊问题落到具体障碍上,主要就是下面四道坎。它们不是工程量的问题,而是目前还没有公认解法的问题。
四道坎先用一句大白话过一遍:知识搬不动(迁移)、说不清的那部分学不到(常识)、只会看谁跟谁一起出现而不知道谁导致谁(因果)、没有身体所以有些事压根摸不到(具身)。四条都不是"再花点钱就能解决"的工程量问题,而是"目前没人知道该怎么办"的问题。
坎一 · 迁移学习:知识为什么搬不动。人类学会开手动挡后再学自动挡几乎不用重新学,因为我们迁移的是"驾驶"这个抽象结构,而不是具体的肌肉动作。神经网络迁移的却是权重——为任务 A 优化过的权重对任务 B 通常不是最优,硬要继续训练又会撞上灾难性遗忘(学新的会毁掉旧的)。所以真正的难点不是"能不能学会第二件事",而是"学会第二件事时不忘第一件,并且第三件学得更快"。人类具备这种正向累积效应,模型至今没有稳定实现。
坎二 · 常识:无法被写下来的那部分知识。1984 年,Douglas Lenat 启动了 Cyc 项目,目标是把人类常识一条一条手工录成逻辑规则:"水是湿的""人死了不会复活""绳子能拉不能推"。这个项目做了三十多年,录入了千万条断言,投入了近两千人年的工作量,最终结论近乎悲观:常识的量级远超任何手工录入的可能,而且大量常识根本无法被明确表述。这就是 AI 领域著名的"常识知识瓶颈"。大模型从海量文本里学到了常识的影子——它知道"下雨要带伞"这句话经常出现,但它没有"淋湿很不舒服"这个体验作为支撑,所以在边缘情况下会说出诸如"用叉子喝汤"式的荒谬建议。
坎三 · 因果推理:相关性不等于因果。图灵奖得主 Judea Pearl 把推理分成三层阶梯:第一层是关联(观察到 X 时 Y 也常出现),第二层是干预(如果我主动去做 X,Y 会怎样),第三层是反事实(如果当时我没做 X,Y 还会发生吗)。今天的模型主要活在第一层。Pearl 的批评相当尖锐:一个只有关联能力的系统永远不可能真正理解世界,因为它无法区分"公鸡打鸣导致天亮"和"天亮导致公鸡打鸣"。而人类的一切规划、归因、后悔、学习,都建立在第二、三层上。
Cyc 项目那个结论值得再翻译一遍,因为它是整个 AI 史上最重要的一次"失败得很有价值"。他们花了三十多年、近两千人年,想把常识一条一条写下来,最后发现两件事:一是常识多得写不完,二是大部分常识压根写不出来。你能写下"水是湿的",但你写不下"看到有人端着一碗汤走过来,你会本能地让开半步"——这件事你天天在做,从没有人教过你,你也说不清是怎么会的。而恰恰是这类说不清的东西,占了人类常识的大头。
因果那三层阶梯,用一个厨房里的例子一次说清。第一层:我注意到每次开抽油烟机,锅里的油烟就少了(看到两件事一起出现)。第二层:如果我现在主动把烟机关掉,油烟会怎样(我动手干预,看结果)。第三层:刚才要是我没开烟机,现在厨房会不会已经一片白雾(回头设想一个没发生的情形)。今天的模型基本只活在第一层——它知道这两件事经常一起出现,但分不清是烟机在吸油烟,还是油烟在召唤烟机。而人类所有的规划、归因、后悔和学习,全建立在第二、三层上。
坎四 · 具身智能:没有身体,很多东西学不到。这一坎有个哲学名字叫"符号接地问题"(Symbol Grounding):符号 "红色" 如果从来没有对应过任何视觉体验,它对系统来说只是一个和别的符号有统计关系的记号。1990 年 Stevan Harnad 提出这个问题后,它一直是"纯文本训练能否达到真正理解"这场争论的核心。具身派认为智能是身体与环境交互长出来的,没有摔倒过就学不会平衡;语言派认为足够多的文本已经隐含了世界结构。现实困难还叠加了一层工程账:文本可以无限复制,而机器人试错必须在物理时间里一次一次做,一台机器人一天只能试几千次,而模拟训练又面临"仿真和现实不一样"的鸿沟。
"符号接地"这个说法太学术,翻译成人话就是:"词得挂在真东西上,不能只挂在别的词上。"一个从没见过红色的系统,它对"红"这个字的全部理解就是"这个字常跟血、苹果、消防栓一起出现"——它认识的是这个字的社交圈,不是这个颜色本身。好比一个人背下了整本菜谱却从没进过厨房:他能说出"油温八成热",但你让他站在灶前判断,他不知道那是什么样子。这就是"读过"和"做过"之间那道至今没人跨过去的坎。
那笔工程账也值得算清楚:文本可以无限复制,机器人试错只能一次一次真的做。一台机器人一天试几千次,一年也就一两百万次;而一个语言模型一天能"读"完人类几百年的文字产出。这就好比学开车——教材可以一晚看完十本,但方向盘只能一次一次真握。更麻烦的是模拟训练那条捷径也有代价:在仿真环境里练得再好,一到真实路面就会发现"仿真里的地面没有这么滑"。
四道坎对照:人类怎么做 vs 模型怎么做
人类 当前模型
迁移 抽象结构复用,越学越快 权重微调,学新忘旧
常识 身体经验 + 社会浸泡 文本统计里的影子
因果 会做实验、会设想"要是没…" 只有相关性,第一层阶梯
具身 符号锚定在感觉运动经验上 符号只锚定在别的符号上
────────────────────────────────────────────────
共同后果:在训练分布内表现惊艳,出了边界不知道自己不知道
大模型算不算 AGI 的雏形
这是当下最有争议的问题,值得把双方的证据都摆出来,而不是站队。
支持"是雏形"的一方会举出几条相当有力的证据。第一是意外的通用性:训练目标只有"预测下一个词"这一个,但模型学会了翻译、写代码、解题、角色扮演,这些能力没有一个是被单独设计进去的。第二是涌现现象:某些能力(如多步算术、指令跟随)在模型小的时候完全不存在,规模跨过某个门槛后突然出现。第三是 2023 年微软研究院那篇引起轰动的论文《Sparks of AGI》,作者用一系列非常规任务(比如"用 TikZ 画一只独角兽")论证 GPT-4 展现出了跨领域的通用推理迹象。第四是缩放定律:模型性能与算力、数据、参数量之间存在稳定的幂律关系,这意味着"继续加大"是一条可预测的、还没走到尽头的路。
反对的一方同样证据充足。第一,幻觉是结构性的:一个以"生成流畅文本"为目标的系统,天然没有区分"真"和"像真的"的机制。第二,没有持久记忆:每次对话都是一次性的,模型不会因为和你聊过而真正改变自己。第三,规划能力薄弱:让它执行一个需要二十步、中途要根据结果调整的任务,成功率会随步数快速衰减。第四,涌现可能是测量的假象——有研究指出,若换用连续型评分指标而不是"全对才算对"的离散指标,很多所谓的"突然涌现"会变成平滑上升的曲线。第五,数据墙:高质量人类文本是有限资源,靠模型自己生成的数据反复训练又有退化风险。
比较务实的中间立场是:今天的大模型不是 AGI,但它第一次给出了"通用性可能是可以被训练出来的"这个经验证据。在此之前,主流看法是通用智能必须靠架构设计;而现在至少证明了,一个足够简单的目标加上足够大的规模,能覆盖到出乎所有人预料的宽度。这个发现本身就是七十年来最重要的进展,无论它最终是不是通往 AGI 的那条路。
业内的三派看法
- 乐观派Sam Altman、Dario Amodei 等认为 AGI 就在 2027-2030 年,只是算力和数据问题。
- 谨慎派Yann LeCun 等认为大模型永远不会通向 AGI,需要新的"世界模型"范式。
- 怀疑派部分学者认为 AGI 或许永远做不到,"智能"本身可能有生物学不可复制的部分。
三派背后其实是三种技术路线的赌注,把赌注说清楚比记住立场更有用:
| 路线 | 核心主张 | 代表人物 / 阵营 | 如果它对,接下来会发生 |
|---|---|---|---|
| 缩放派 | 现有架构不用大改,继续加算力、加数据、加训练时的思考长度,通用性会自然长出来 | OpenAI、Anthropic 主流观点 | 竞争变成纯粹的资本与电力竞赛,算力集中的一方胜出 |
| 世界模型派 | 语言只是智能的输出层,真正的智能要靠预测"世界接下来会怎样"来训练,重点是从视频和交互中学习 | Yann LeCun 的 JEPA 路线 | 需要新架构,大模型可能成为一段昂贵的弯路 |
| 具身派 | 没有身体就没有真正的理解,必须让智能体在真实或高保真仿真环境里行动、试错 | 机器人学界、强化学习一支 | 进展受物理世界速度制约,会比纸面推演慢很多 |
| 神经符号派 | 把神经网络的感知能力和符号系统的严格推理能力缝起来,各补各的短板 | Gary Marcus 等长期倡导者 | 可靠性大幅提升,但"怎么缝"至今没有优雅方案 |
| 怀疑派 | 智能可能依赖生物基质、意识或某种目前完全未知的机制,工程复制未必可行 | 部分认知科学与哲学界 | AGI 成为一个长期无法验证的开放问题 |
关于时间预测,把公开表态并排放会看到一个惊人的离散度:一部分前沿实验室负责人给出的是数年量级;学术界大规模问卷调查(如 AI Impacts 对数千名机器学习研究者的追踪)给出的中位数长期落在2040 到 2060 年之间,而且这个中位数在 2022 年之后明显提前了;还有一批研究者坚持认为无法预测。需要留意的是利益结构:越是需要融资的机构,预测越激进;越是没有商业压力的学者,预测越保守。这不代表谁在撒谎,但足以提醒我们对任何具体年份都别太当真。
AGI 一旦到来,最先改变什么
抛开时间表,讨论"如果到来"仍然有实际意义,因为它决定了现在该准备什么。
第一个变化不是失业,而是"认知劳动的边际成本趋近于零"。过去请一个分析师、一个译者、一个初级程序员,成本以人月计;如果这些工作可以按需无限复制,整个组织的形态会变——不再是"招人做事",而是"设计流程调度智能体"。历史上蒸汽机做的是同一件事,只不过对象是体力。
第二个变化是科研加速。AGI 最有价值的应用可能不是聊天,而是当研究员:读完某个领域全部文献、提出假设、设计实验、解释结果。这也是很多研究者愿意冒风险推进它的原因——如果它能把新药研发周期从十年压到两年,那笔账很难拒绝。
第三个变化是责任归属的空白。一个能自主规划并执行多步任务的系统做错了事,责任在开发者、部署者还是使用者?现有法律体系是围绕"工具由人操作"设计的,一旦工具开始自主决策,整套归责逻辑都需要重建。这也是为什么各国立法在 2024 年之后突然密集起来。
看懂"AGI 即将到来"的宣传:一副防忽悠的眼镜
正因为 AGI 这么诱人,市面上最不缺的就是"AGI 明年就到"的标题。这里给你三把最方便的尺子,用来快速判断一条消息是严肃报道还是营销话术。
- 看它有没有给出"可证伪的判据""我们公司完成了 90% 的 AGI 前夜任务"这种话无从验证;反之"能在某标准测试上达到某分数""能在某新任务上做到某事"是可证的。给不出判据的,基本都是气氛组。
- 看它说的是"能力"还是"基准""它的数学已经到了研究生水平"是宣传口径;"它在某个公开榜单排第几、题目来源和评卷规则是什么"才是可查证的事实。把两者分开,是防忽悠的第一步。
- 看利益站在哪一边需要融资的机构把年份往前压,没有商业压力的学者把年份往后放。谁嗓门最大,谁更可能靠它赚钱。这不代表他们在说谎,但足以让你在心里给那个年份打个折扣。
最深的一句提醒是:AGI 的争论主要发生在定义层面,而不是能力层面。双方吵得面红耳赤,多半是因为对"什么算 AGI"没有共识,而不是对"模型能干什么"有分歧。所以下次再看到"AGI 近了"或"AGI 还早着呢"的争论,先问一句:他们说的那个"AGI"是一回事吗?很多时候,答案是否定的。
与其抢注"When",不如盯住"What next"
作为普通读者,真正能握住的东西不是某个聚合的年份数字,而是三条具体的、每年都会更新一次的观测线。把它们盯住,比追着热搜看十篇综述都管用。
第一条线:看"常见任务"的完成度。模型会不会读病历、会不会看合同、会不会帮你理清一道没有标准答案的复杂问题——这些不需要任何魔法定义,你能直接问、直接试。它们每半年都在肉眼可见地变好。
第二条线:看"边界的移动"。今年它还搞不定的事(比如某个需要持续纠错的长任务、某个依赖真实动作的事),明年再看它卡不卡。边界的移动方向,比任何口号都诚实。
第三条线:看"世界模型"有没有影子。当模型开始显式地预测"接下来会发生什么",而不是只会接一句通顺的文本,那才是质变的信号。目前它还远。
这三条线合成一句话:AGI 更像一条渐近的曲线,而不像一盏会"啪"地亮起的灯。它不会在某年某月的某一天突然降临——只会以你几乎注意不到的方式,一点点把你熟悉的边界推远。看清这一点,你对所有"元年""时刻"的兴奋,都会多一份平静。
AGI 是一个仍在讨论"该怎么定义"的目标——不同公司甚至对"什么算 AGI"都没共识。与其纠结它到底哪天来,不如关注:每半年发布一次的新模型,正在填补前面表里哪一格。
把这一节压缩成一张检查清单:判定 AGI 要看跨领域、自主学习、世界建模三条硬指标,再加样本效率、持久记忆、元认知三条隐性指标;测法上图灵测试已经失效,取而代之的是咖啡测试、大学考试测试、就业测试、ARC-AGI这类"真去做成一件事"的标准;难点集中在迁移、常识、因果、具身四道坎,其中最深的一道由莫拉维克悖论解释;大模型是不是雏形至今无定论,但它确实第一次证明了通用性可以被训练出来;路线上分成缩放派、世界模型派、具身派、神经符号派、怀疑派,时间预测从数年到永不,离散度本身就是最诚实的答案。下一节我们越过这条线,去看假如它不仅通用、还全面超过人类,会引出什么问题。