文章解读:The Second Half——AI 的下半场才刚开始

这篇文章来自姚顺雨(Shunyu Yao),他是 ReAct、WebArena 等知名工作的作者,目前在 OpenAI 任职。这篇博客基于他在斯坦福 224N 和哥伦比亚大学的演讲整理而成,核心观点相当锐利:
AI 的发展刚刚走到了"中场"。上半场的游戏规则正在失效,下半场的主角不再是"训练更强的模型",而是"定义更对的问题"。
一、文章基本信息
标题:The Second Half
作者:Shunyu Yao(姚顺雨)
发表时间:2025 年 4 月 10 日
二、这篇文章主要讲了什么?
简单来说,姚顺雨想回答一个问题:当 AI 的"万能配方"已经成型,接下来我们该做什么?
他的答案分三层:
上半场:AI 的核心游戏是"发明新模型、刷新基准测试",训练方法是主角,评测是配角
中场转折:一个通用配方(语言预训练 + 推理 + RL)已经能横扫几乎所有任务,老玩法正在失效
下半场:重心从"能不能训练出来"转向"该训练什么、怎么衡量真正有用的进步"——评测和问题的定义,变得比训练更重要
三、上半场的游戏规则是什么?
姚顺雨用了一个直观的观察:回顾 AI 历史上最有影响力的论文——Transformer、AlexNet、GPT-3——全部都是训练方法或模型,而不是基准测试或任务定义。
Transformer 引用超 16 万次,而它最初验证的 WMT'14 翻译基准引用仅约 1300 次
ImageNet 可能是最有影响力的基准,引用量也不到 AlexNet 的三分之一
上半场的潜规则:发明新方法 >> 定义新任务。原因很简单——设计 Transformer 需要极深的洞察力和工程能力,而定义一个任务大多时候就是把人类已在做的事情直接拿过来变成基准测试。而且好方法往往有强通用性,Transformer 横扫了 CV、NLP、RL 等无数领域。
这套游戏玩了几十年,效果显著。那为什么游戏要变了?
四、"万能配方"是怎么回事?
这是整篇文章最核心的部分。姚顺雨用强化学习(RL)的视角,梳理了配方的成型过程。
1. RL 的三个要素:算法、环境、先验
经典 RL 有三个组件:算法(怎么学习)、环境(在哪里行动)、先验(事先知道什么)。长久以来,RL 研究者几乎只关心算法。
2. OpenAI 的早期尝试:从环境入手
OpenAI 做了 Gym 和 Universe 项目,试图把互联网和电脑操作变成 RL 环境。思路很漂亮但走不通——RL 智能体可以打赢 Dota、解魔方,但无法泛化到网页浏览或通用计算机操作。
3. 缺失的拼图:先验(语言预训练)
GPT-2/GPT-3 出现后大家才意识到:缺的不是算法也不是环境,而是先验。语言预训练把常识和语言知识灌进模型,然后才能微调成 Web 智能体或对话智能体。
RL 最重要的部分,可能根本不是 RL 算法本身,而是先验——而且先验可以通过一种与 RL 完全无关的方式获得。
4. 推理:让语言先验泛化的魔法
语言预训练的先验对聊天好用,对操控电脑就不够了。姚顺雨 2019 年用 GPT-2 做文本游戏智能体(CALM),花上百万步 RL 才通关一个游戏且无法迁移。
他意识到:人类能轻松学会新游戏,因为我们可以"思考"——"地牢很危险,我需要武器,也许箱子里有,先去柜子那边"。这就是 ReAct 框架的起源。
"思考"是一种奇特的动作:不直接影响外部世界,空间组合无限。在经典 RL 里加入无限"无用选项"很糟糕,但推理让语言先验得以在任意 RL 环境中泛化。
语言通过推理在智能体中实现泛化。
5. 配方的全貌
有了正确的先验和环境设计,RL 算法本身反而成了最不重要的部分。于是有了 o 系列、R1、Deep Research 等。几十年来 RL 研究者最关心算法,结果发现优先级可能恰好应该反过来。
五、上半场为什么"玩不下去了"?
1. 增量创新可能被通用配方碾压
你发明新方法在某个任务上提升 5%,下一个 o 系列模型不费吹灰之力就提升 30%。通用配方的泛化能力让针对特定任务的增量创新变得无足轻重。
2. 更难的新基准也会被迅速攻克
你造了更难的基准?配方升级一下就解掉了,而且速度越来越快。
六、"效用问题"(The Utility Problem)
AI 在棋类、SAT、律师考试、IMO、IOI 中都达到了顶尖水平。但世界并没有因此发生太大变化——至少从经济和 GDP 看。
根源:我们的评测设置,和真实世界的设置,在很多基本方面是不同的。
例一:评测"应该"自动运行。 传统评测中智能体自主执行后收到奖励。但现实中智能体必须与人持续交互——你不会给客服发一条超长消息等 10 分钟期待一次回复解决一切。质疑这个假设后出现了 Chatbot Arena、tau-bench 等新评测。
例二:评测"应该"独立同分布。 500 个测试独立运行取平均。但现实中你是一个接一个解决问题的,Google 工程师解第 100 个 bug 时远比第 1 个熟悉代码库,而 AI 智能体不会积累这种经验。我们显然需要长期记忆方法,但学术界缺乏合适的基准来证明这种需求。
七、下半场的游戏规则是什么?
为真实世界的效用,开发全新的评测设置或任务
用通用配方去解决它们,或在配方上加入新组件。继续循环
本质变化:上半场主角是研究员和工程师,下半场主角更像产品经理——定义什么问题值得解决、什么才算真正进步。
上半场的玩家在解游戏和考试;下半场的玩家有机会通过构建真正有用的产品,创造数十亿甚至数万亿美元的价值。
通用配方会碾压增量方法——除非你能创造出打破配方的新假设。那才是真正改变游戏规则的研究。
八、局限与值得商榷之处
对"训练方法不再重要"的判断可能过于激进:在科学计算、物理模拟、实时控制等垂直领域,纯粹的语言+推理配方未必够用,训练方法创新仍可能至关重要
"效用问题"的定义还比较模糊:AI 赢了考试但世界没怎么变——这涉及经济结构、监管、信任、基础设施等大量非技术因素,全部归结为"评测设置不对"可能过于简化
评测创新的激励结构仍不清晰:学术界发表机制仍偏向方法创新,如何让评测工作获得应有认可是文章未回答的现实问题
九、为什么这篇文章值得看?
第一,它提供了清晰的思维框架。 "上半场 vs 下半场"不只是修辞,它帮助我们理解 AI 领域的结构性变化——从"能不能做到"到"该不该做、做了有没有用"。
第二,它对从业者有直接的行动指引。 不要再去卷注定被通用配方碾压的增量方法;思考评测方式是否真正反映真实世界需求;去质疑那些"一直都是这样"的基本假设。
十、总结
上半场核心是训练方法和模型创新,基准测试是配角
语言预训练 + 推理 + RL 的通用配方已成熟,能横扫绝大多数传统基准
这导致了效用问题——AI 赢了考试但没改变世界,因为评测设置与真实世界脱节
下半场核心转向评测设置和问题定义的创新
对于每一个在 AI 领域工作或学习的人,这篇文章都值得一读。它提醒我们:最危险的不是做不出好方法,而是在一个已经改变的游戏里,还在按旧规则出牌。