技术博客
VLA

GEN-1:具身智能的「GPT-3 时刻」

知行|NoLimits2026-07-09 14:44
GEN-1:具身智能的「GPT-3 时刻」

官方博客:

https://generalistai.com/blog/apr-02-2026-GEN-1

视频链接:

https://youtu.be/SY2xyrmV44Y?si=rvdGnIdWEU9jqC2w


2026年4月,Generalist AI 发布了他们的最新模型 GEN-1。这篇文章将带大家理解这项工作它到底做了什么,为什么重要,以及技术上的关键突破在哪里。






机器人为什么这么难?


在理解 GEN-1 之前,我们需要知道机器人学习面临的一个根本困境。


大语言模型(LLM)的成功,很大程度上依赖一个叫做"规模定律(Scaling Laws)"的现象:简单来说,给模型更多数据、更多算力,它就会变得更聪明,而且这个改善是可以预测的。这让 AI 研究者有了一张路线图,只要沿着规模化的方向走,就能持续进步。


但在机器人领域,这张路线图一直不存在。原因有几个。首先,机器人数据极难获取。语言数据可以从互联网上抓取,但"机器人抓住一个箱子"的数据,必须通过真实机器人或人工遥操作(teleoperation)一帧一帧地录制,成本极高。其次,机器人需要理解物理世界,力、摩擦、重力、形变,这些比文字的统计规律复杂得多。最后,机器人必须实时行动,不能像 ChatGPT 那样"想几秒再回答",物理世界不等人。




GEN-0:规模定律第一次出现在机器人领域


2025年11月,Generalist AI 发布了 GEN-0,做了一件在机器人领域从未被证明过的事:证明了机器人领域存在规模定律——随着预训练数据和算力的增加,机器人的能力会以可预测的方式持续提升。


这件事的意义,类比到语言模型,就像当年 GPT-2 第一次展示"大模型路线可行"一样。


GEN-0 的核心技术:Harmonic Reasoning

GEN-0 引入了一个叫做"谐振推理(Harmonic Reasoning)"的架构创新。


要理解它,先想一下现有语言模型的工作方式:你输入一句话,模型思考一段时间,然后给出回答。"思考"和"行动"是分开的两个阶段。


但机器人不行,物理世界不会停下来等待。机器人在"思考"的时候,一个正在滑落的物体不会暂停,一条流水线不会等它做完决策。


Harmonic Reasoning 的解决方案是:让感知流(sensing tokens)和行动流(acting tokens)在时间上异步、连续地交织运行,形成一种"谐振"的互动关系。


简单来说,模型可以一边感知世界,一边执行动作,不需要等"想好了再动"。这使得 GEN-0 在不依赖 System1-System2 分离架构的情况下,也能扩展到非常大的模型规模。


GEN-0 的数据引擎:不用机器人数据做预训练

这是 GEN-0 最反直觉的设计之一。GEN-0 的基础预训练模型完全不使用机器人数据,而是使用低成本可穿戴设备收集的、人类进行数百万种活动的数据 。把"人手操作"的视觉-动作数据作为预训练语料,让模型先学会物理世界的基本直觉。


截至发布时,这个预训练数据集包含超过27万小时的真实世界操作数据,覆盖全球数千个家庭、仓库和工作场所,并以每周1万小时的速度持续增长。


一个关键的"相变"发现

在扩展实验中,GEN-0 观察到了一个令人惊讶的"相变"(phase transition)现象,1B 参数的模型在大量数据面前会出现"骨化(ossification)",模型权重逐渐无法吸收新信息,而超过 7B 参数后,模型才能真正从大规模预训练中受益,并以极少的微调步骤快速适应新任务。


这和莫拉维克悖论(Moravec's Paradox)遥相呼应:人类觉得简单的事情(感知和手部操作),对计算机来说反而需要极高的计算复杂度。




GEN-1:从"能用"到"好用"


五个月后,GEN-1 登场了。如果说 GEN-0 是"路是通的",那 GEN-1 就是"车真的开起来了"。


核心成果:三个维度上的跨越

GEN-1 用一个词来定义新的目标:Mastery(精通)。它由三部分组成。


可靠性(Reliability):GEN-1 在多项任务上实现了 99% 的成功率,而此前的 GEN-0 平均只有 64%,从零训练(不使用预训练)的模型更只有 19%。这不是偶尔成功一次,而是机器人能连续工作数小时不出错,折叠箱子连续完成200次,零干预地为机器人吸尘器换配件超过200次,打包零件超过1800次。


速度(Speed):在折叠箱子这一任务上,GEN-1 可以在约12秒内完成,是此前最优水平(包括 GEN-0 和 Physical Intelligence 的 π0,两者均需约34秒)的2.8倍快。速度的提升并非简单地让电机转得更快,而是模型真正理解了物理动力学并学会了更高效的操作策略。


即兴应变(Improvisation):这是最难量化、也最令人印象深刻的能力。在一个长时程汽车零件装配任务中,如果一个垫圈被碰飞到了奇怪的位置,机器人可以自主决定把它放下来重新抓取、利用物体边缘的"外力"辅助重新握持,或者用另一只手配合双手重新操作。这些都是训练分布以外的行为。



技术上做了什么?

GEN-1 并非单纯的"更多数据+更多算力",它在以下几个方向进行了系统性创新:


预训练升级:数据集从 GEN-0 的27万小时扩展到超过50万小时的高保真物理交互数据,同时对分布式训练基础设施进行了彻底重新设计,以支持 PB 级物理数据的高效处理。


推理时技术(Harmonic Reasoning 演进):GEN-1 引入了对推理方式的进一步改进,包括新形式的 paged attention,以实现真正的实时推理。这使得模型在更大规模下仍然能保持低延迟的闭环控制。


训练后技术(Post-training):GEN-1 在预训练基础上引入了强化学习(RL)、多模态人类指导,以及新的推理时引导技术,让模型在具体任务上达到更高的精通程度。


数据效率的质变:GEN-1 的每项任务结果,仅需约1小时的机器人实际操作数据就能达到。预训练完全不含机器人数据,因此每次适配新任务,模型是在同时学习"如何控制这个机器人身体"和"如何完成这个任务",两件事一起学,只需一小时数据。




一个值得思考的深层问题:对齐


GEN-1 展示了涌现式的即兴行为,机器人会自发地摇晃袋子让物体落入正确位置,会在物品掉落前伸手接住,会重新整理放错位置的东西。


但这引出了一个深刻的问题,机器人学中"成功"的定义并不是普世的。它是任务特定的、流程特定的,最终是用户定义的。不仅仅是机器人"应该做什么",更重要的是它"不应该做什么"。


涌现行为既可以是优势(自发的恢复动作),也可能是隐患。这是具身 AI 独有的对齐挑战,和语言模型的对齐问题性质上截然不同,因为物理行动有真实的后果。





总结


GEN-0 证明了规模定律在机器人领域成立。GEN-1 则越过了一个关键门槛:在简单任务上实现了接近工业部署标准的可靠性、速度和鲁棒性,同时只需极少的任务专用数据。


GEN-1 并不能解决所有任务,并非所有尝试过的任务都能达到 99% 的成功率,某些任务甚至需要更高的可靠性才能在实际场景中落地。


但它最重要的意义,或许不在于当下能做什么,而在于它确认了一件事:每一代更大的模型,都会解锁一批新的、更复杂的任务,就像 GPT-3 之后的每一代语言模型一样。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发