技术博客
其他

对话 LeCun:从 JEPA 到世界模型,重新定义具身智能的底层范式

Truman2026-07-09 14:52
对话 LeCun:从 JEPA 到世界模型,重新定义具身智能的底层范式

演讲者:

Yann LeCun (Advanced Machine Intelligence, Founder and Executive Chairman) 

Marc Pollefeys (ETH Zürich and Faculty, ETH AI Center, Professor)

原视频链接:

https://youtu.be/pJyoqapCRZE?si=LQsQVtCdQCsLutSi


具身智能(Embodied AI)指的是将人工智能集成到机器人、自动驾驶车辆等物理系统中,使其能够通过传感器与执行器在现实世界中感知、推理与行动。


本次炉边对话探讨视觉-语言-行动模型等人工智能进展如何重新定义机器的理解与执行能力,特别是在从导航任务向移动操作任务演进的过程中。


演讲者将讨论当前AI技术的快速进步将以多快的速度迁移至机器人及具身系统领域,以及我们何时能预见这些技术对日常生活产生实质性影响。





1. 关键内容摘要


本场对话的核心命题是:为什么目前的 LLM(大语言模型)无法产生真正的智能,以及如何通过“世界模型”让机器人拥有常识。 


LeCun 认为,现在的机器人大多只是“昂贵的木偶”,而真正的突破在于让 AI 像人类婴儿一样,通过观察世界来学习物理规律,而不是通过预测下一个单词。



2. 语言的局限:

真实世界远比文本复杂


语言是高度压缩和抽象的符号系统,而物理世界是高维、连续且充满噪声的。仅靠文本训练的 AI 永远无法理解现实。

Yann LeCun:

"The real world is fundamentally different from language and the reason language has been like LLMs have been so successful is because language is easy."


“真实世界与语言有本质的不同。大语言模型之所以如此成功,是因为语言是简单的。”



3. 生成式 AI 的死胡同:

为什么不要预测像素


LeCun 强烈反对用扩散模型或生成模型来做“视频预测”。他认为预测每一个像素是无意义的浪费,AI 应该预测的是“抽象的表示”。

Yann LeCun:

"It might produce cute videos or cute pictures with diffusion models, but that's it and it will not understand the underlying structure of the world."


“(生成式模型)可能会用扩散模型生成漂亮的视频或图片,但也仅此而已,它并不能理解世界的底层结构。”



4. 核心方案:

JEPA 架构与世界模型


系统必须能够预测其行动的后果。LeCun 强调,这种预测不应在像素级别(像素级预测太浪费且充满不可预测的细节),而应在抽象表示空间进行。


放弃“像素重建”,转而预测“表示空间”。这使得 AI 能够忽略无关细节(如树叶的随机摆动),捕捉物理定律(如物体受重力下落)。

Yann LeCun:

"JEPA means Joint Embedding Predictive Architecture... learning an abstract representation of the input signal and making prediction in that abstract representation space."


“JEPA 代表联合嵌入预测架构……它学习输入信号的抽象表示,并在该抽象表示空间中进行预测。”



5. 具身智能的未来挑战:

数据搬运的能效危机


人脑功耗仅约 20W,因为存储与计算是在同一位置。而当前冯·诺依曼架构的 AI 硬件,能量都浪费在了内存与处理器之间的数据搬运上。

Yann LeCun:

"All the energy, all the power is spent getting data from the memory and writing it back... that's where all your energy is going to go."


“所有的能量、所有的功耗都耗费在了从内存读取数据并写回的过程中……这就是你所有能量损耗的地方。”



6. 下一场 AI 革命:

从“生成”走向“规划”


LeCun 宣布成立新公司,目标是抛弃“自回归令牌预测”(如 GPT),转向基于“规划”的代理系统。他预言这将引发下一场 AI 革命。

Yann LeCun:

"It's a completely different paradigm non-generative... not using autogressive token prediction but using planning."


“这是一个完全不同的范式,非生成式的……不使用自回归令牌预测,而是使用规划。”



7. 核心总结


未来 AI 的核心不再是谁能写出更美的诗,而是谁能让机器像生物一样,通过观察和互动,理解并操纵物理现实。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发