WAM 世界模型VLA

GigaBrain-0.7:37,000 小时数据 + 三系统架构,把世界模型真正接进 VLA 了吗?

yiwan-cat2026-08-21 22:49
GigaBrain-0.7:37,000 小时数据 + 三系统架构,把世界模型真正接进 VLA 了吗?

一句话看懂: GigaBrain-0.7 不再只把机器人看成“看图 → 直接出动作”的 VLA,而是把整套系统拆成三层:System-2 负责理解与规划,System-3 负责预测未来并判断任务进度,System-1 负责生成连续动作;再用 3.7 万小时异构具身数据和“监督学习 → 离线经验学习 → 在线强化”的闭环,把模型从会模仿推向会预判、会恢复。

WRC 2026 上,极佳视界把 GigaBrain-0.7 最吸睛的一幕做成了“超 20 分钟、10+ 个任务一镜到底”的长程真机演示。

但如果只记住这个 Demo,其实会错过这篇技术报告真正有意思的地方。

GigaBrain-0.7 想回答的是一个更大的问题:

具身基础模型到底能不能像大语言模型一样 Scale?如果能,应该 Scale 什么数据、什么架构,以及什么样的经验闭环?

论文给出的答案不是单纯“把 VLA 做大”,而是两座同时向上堆叠的金字塔:

  • 数据金字塔:互联网视觉语言数据、EGO/UMI 真人数据、仿真和生成数据、真机数据;
  • 算法金字塔:System-2 理解规划、System-1 动作生成、System-3 世界预测,再叠加 Experience Reinforcement。

这篇文章不照着发布稿逐条复述,而是从论文机制出发,拆开看它究竟做了什么、哪些结果真正有说服力,以及目前还有哪些关键问题没有回答。


1. 先看全局:GigaBrain-0.7 到底是什么?

图1| Overview of GigaBrain-0.7.

论文对 GigaBrain-0.7 的总览:左边是跨来源数据,中间是预训练与后训练,右边是真机与仿真能力评测。

如果把传统 VLA 简化成:

图像 + 指令
    ↓
   VLA
    ↓
连续动作

那么 GigaBrain-0.7 想做的是:

                    ┌──────────────────────┐
                    │ System-2:理解与规划 │
                    │ 现在是什么状态?     │
                    │ 下一步应该做什么?   │
                    └──────────┬───────────┘
                               │ subtask / context
                               ▼
图像 + 历史 ───────→ ┌──────────────────────┐
                     │ System-3:世界价值模型│
                     │ 下一阶段可能长什么样?│
                     │ 当前动作是否在推进?  │
                     └──────────┬───────────┘
                                │ future image + value
                                ▼
                     ┌──────────────────────┐
                     │ System-1:动作专家   │
                     │ Flow Matching       │
                     │ 连续动作块生成       │
                     └──────────┬───────────┘
                                ▼
                              机器人

可以把三者理解成一支机器人工作小组:

  • System-2 是领班,负责理解任务、拆分子任务;
  • System-3 是沙盘推演 + 质检员,告诉策略“如果继续这么干,接下来可能发生什么,以及任务到底有没有在向前推进”;
  • System-1 是真正的手脚,负责把高层意图落成连续控制信号。

这里最值得关注的变化,是 World Model 不再只躺在训练数据生成流水线上,而是开始进入策略条件本身。


2. 第一座金字塔:37,256.98 小时,真正 Scale 的不是“真机小时数”

图2|Composition of the GigaBrain-0.7 training corpus.

GigaBrain-0.7 训练轨迹的构成。

论文给出的清洗后具身轨迹总量是:

数据来源 时长 占比
Real Robot 真机数据 20,535.65 h 55.12%
UMI 真人示教 8,251.83 h 22.15%
EGO 第一视角真人数据 2,862.36 h 7.68%
Simulation 仿真 1,453.92 h 3.90%
World Model 生成数据 4,153.22 h 11.15%
总计 37,256.98 h 100%

此外,论文还使用了约 2.72 亿条视觉语言图文 / QA 数据来加强视觉语义理解。

这组数字真正有价值的地方,不是“37,000 小时听起来很大”,而是它反映出一个明确的数据观:

具身 Scaling 不应该只靠昂贵的机器人真机轨迹,而要把不同成本、不同物理真实性的数据放进同一套训练体系。

也就是说,真机数据负责“物理落地”,UMI 和 EGO 负责快速扩充人类操作经验,仿真和生成数据负责覆盖危险、稀有和长尾场景,互联网视觉语言数据则负责补充常识、语言和视觉语义。

这和很多早期 VLA “先收一批机器人数据,再针对任务 fine-tune”不是一个路线。

2.1 为什么 UMI/EGO 数据值得单独看?

传统机器人数据的最大问题是贵。

你需要机器人、本体维护、场地、安全员、遥操作员,还可能因为一次碰撞直接把采集暂停。于是“继续扩大数据量”很快会撞上成本天花板。

GigaBrain-0.7 的思路是,把真人采集做成传感器尽量同构、动作可重定向的数据源。

图3| Real-robot data processing pipeline.

论文给出的真机数据处理与标准化流程。

它不是简单把人类视频扔进训练集,而是需要完成:

原始多模态轨迹
  ↓
时间同步 / 标定
  ↓
动作空间转换与机器人统一表示
  ↓
指令改写 + Subtask 标注 + VQA 标注
  ↓
质量筛选
  ↓
统一 LeRobot v3.0 数据格式

这一步非常关键。

对于多本体模型而言,真正困难的从来不只是“数据有没有”,而是:

不同机器人的关节数、控制频率、相机布局、夹爪定义和动作空间都不一样,怎么把它们变成模型可以共享的知识?

GigaBrain-0.7 后面那套 Shared Action Expert,其实和这里的数据统一是互相咬合的。如果输入输出空间完全没有标准化,所谓“跨本体参数共享”很容易只停留在 PPT 上。


3. 论文真的证明了“具身 Scaling Law”吗?

这里需要把发布稿里的措辞稍微收紧。

论文确实展示了三个很清楚的 Scaling trend

  1. 随着预训练数据继续增加,验证损失持续下降;
  2. 增加机器人数据后,真机成功率继续提高,尤其对衣物折叠这类混沌、长程、可变形物体任务更明显;
  3. 在固定约 3,000 小时机器人数据的基础上加入 UMI、EGO,真机效果继续提升,而 Robot + UMI + EGO 的组合最好。

这说明:

无本体真人数据并不是“只能拿来预训练视觉”,它能够转化为真实机器人操作收益。

但严格说,论文目前展示的是“正向 Scaling 证据”,还不是 LLM 论文里那种经过拟合、具有明确指数关系、可用于预测计算/数据/损失关系的完整 Scaling Law。

所以更准确的说法应该是:

GigaBrain-0.7 给出了具身数据规模扩张有效的实验趋势,而不是已经建立了一条普适的具身 Scaling Law。

这一点看似只是措辞,其实很重要。因为具身数据的“1 小时”并不等价:重复桌面抓取 1 小时,和包含多物体、失败恢复、长程任务的 1 小时,信息密度完全不同。

未来真正有意义的 scaling 研究,恐怕不会只统计小时数,还要统计状态覆盖度、动作多样性、任务熵、失败密度和跨本体分布


4. System-1:不是每种机器人一个专家,而是“共享大脑 + 少量本体接口”

GigaBrain-0.7 的动作生成模块建立在 Mixture-of-Transformers(MoT)+ Flow Matching 上。

最直观的理解是:

视觉语言 Token ───────┐
                      ├─→ 联合注意力 → Action Expert → 连续动作块
机器人状态 / 噪声动作 ─┘

其中 VLM 和 Action Expert 保留各自的 FFN,但在注意力层中进行信息交互,形成“双流”结构。

动作生成采用 Flow Matching。无需死记公式,可以把它理解成:

随机噪声动作
   ↓
模型学习“动作应该往哪个方向流动”
   ↓
逐渐靠近示范数据中的真实动作分布
   ↓
得到连续 action chunk

相比把机器人控制离散成一个个 token,这种做法天然更适合机械臂连续控制。

4.1 Shared Action Expert:不同机器人到底共享什么?

GigaBrain-0.7 并不是给 AgileX PiPER、Maker H01 等不同机器人各训练一个完整动作模型。

它让不同本体共享 Action Expert 的 Transformer 主干,只通过 Robot ID 路由到对应的状态 / 动作输入输出投影层。

也就是:

PiPER 状态 ─→ PiPER Adapter ─┐
Maker H01 ─→ H01 Adapter ────┼→ Shared Action Expert
Robot C   ─→ C Adapter ──────┘

Shared Action Expert
        ↓
┌───────┼───────────┐
PiPER Head   H01 Head   Robot C Head

这背后的假设很漂亮:

“抓、放、推、插、折叠、避障”这些操作知识具有跨机器人共性,真正需要本体专属处理的只是动作坐标和低层接口。

如果这个假设能够持续扩展,就意味着未来增加一种新机器人,不一定要重新训练一套 VLA,只需要给它接一个新的 embodiment adapter。

4.2 Soft Knowledge Insulation:为什么不能让动作损失随便改 VLM?

多模态大模型的视觉语言能力很宝贵,但动作数据通常更窄、更偏某几个机器人和场景。

如果训练 Action Expert 时,所有梯度都毫无约束地灌回 VLM 主干,很可能发生一个问题:

动作越来越准,但原本通用的视觉、语言、空间理解反而被“训偏”了。

GigaBrain-0.7 因此使用 Soft Knowledge Insulation,对从动作侧回传到 VLM 的知识更新做软隔离。

它不是完全冻结,也不是完全放开,而是在两者之间找平衡:

通用 VLM 能力  ←── 保住
       ↑
  受控的信息交换
       ↓
机器人动作能力 ←── 继续适配

这个设计对于“一个基模服务多机器人、多任务”尤其重要。

4.3 一个反直觉结果:VLM 更大,不代表机器人更会干活

论文还比较了不同视觉语言骨干。

在 Clean Desk、Fruit Picking、Shirt Folding 三项真机任务上,PaliGemma2 3.5B 的结果分别为 50 / 88 / 30;更大的 Qwen3.5 5B 为 60 / 12 / 0;Gemma4 8.5B 则是 100 / 92 / 0*。

最有意思的是 Shirt Folding:只有 PaliGemma2 版本取得了非零成功率。

这说明具身模型的瓶颈不能简单归结为:

“VLM 再大一点就好了。”

语言模型榜单上的能力,并不会无损映射到动作对齐。视觉时序、动作表征、训练稳定性和本体数据匹配往往更关键。


5. System-2:长程任务为什么需要“记住刚才发生了什么”?

GigaBrain-0.7 的 System-2 使用视觉语言模型完成场景理解、Chain-of-Thought 式推理和 Subtask 规划。

这里有一个容易被忽略、但对长程任务非常实用的设计:短时历史视觉上下文。

为什么?

设想机器人正在“把一件衣服折两次”。第一次折叠结束后,当前画面可能和“准备进行第一次折叠”长得很像。

如果模型只看当前单帧:

看见衣服处于某个姿态
→ 判断应该执行“折一下”
→ 折完
→ 又看见近似姿态
→ 再次判断“折一下”
→ 陷入循环

论文的定性案例显示,加入短时历史后,模型能够区分:

“现在这个画面虽然看起来类似,但这是刚刚完成上一阶段之后的状态。”

这看起来不像“超长记忆”那样炫,但对机器人特别重要。

因为真实机器人最怕的往往不是完全看不懂,而是在几个视觉相似的状态之间不断重复同一动作

长程任务能力,有时并不需要模型记住过去 20 分钟每一帧,而是需要保留足够的信息,让当前状态拥有“任务阶段身份”。


6. System-3:这才是 GigaBrain-0.7 最值得拆开的地方

图4|Architecture of GigaBrain-0.7.

三系统架构及 System-3 如何向 System-1 提供未来视觉与价值条件。

发布稿把 System-3 描述成“机器人先预演未来,再执行动作”,这个直觉没有错,但如果想真正理解论文,需要再精确一点。

它不是经典 MPC 那种:生成 N 条候选动作 → 用世界模型滚 N 个未来 → 挑一条最优轨迹。

GigaBrain-0.7 的 World Value Model 主要向策略提供两种条件:

第一种:未来子目标图像 g_t

System-3 根据当前状态和子任务,预测接下来一段时间世界可能如何变化,并把预测视频的最后一帧作为未来子目标图像。

于是 System-1 不再只看到:

“现在长什么样”

还能够看到:

“如果这个子任务顺利推进,接下来大概应该长什么样”

这相当于给动作生成提供了一张视觉版“施工效果图”。

第二种:任务进度 Value V_t

System-3 同时估计任务当前的进度值。

论文进一步构造了一个非常简单的二值进展条件:

[
A_t = \mathbb{1}\left[V_{t+\delta_t}-V_t>0\right]
]

其中:

  • (V_t):当前状态的任务进度估计;
  • (V_{t+\delta_t}):执行一小段动作后的进度估计;
  • (A_t=1):说明这一段行为让任务向前推进;
  • (A_t=0):说明没有推进,甚至可能退步。

因此,后训练时 System-1 学到的是:

在“未来目标图像 + 正向进度条件”下,什么样的动作更像是能够继续把任务推进下去的动作。

推理时,策略直接条件在“positive progress”上。

所以 System-3 的作用更接近:

未来视觉提示 + 进度价值提示
            ↓
       条件化动作策略

而不是一个每步穷举动作再打分的在线搜索器。

这一区别很关键,因为两者的推理成本、控制机制和失败模式完全不同。

6.1 世界模型到底真的“看见失败”了吗?

图5 Prediction and evaluation with the World Value Model.

System-3 对未来状态进行预测,并根据未来变化给出任务价值判断。

论文展示了一个很直观的案例:当世界模型预测到盒盖掉落等失败未来时,advantage/value 明显下降;当后续行为把任务拉回正确轨道时,价值又重新上升。

这意味着 World Model 的角色已经不只是:

“生成一段看起来像未来的视频。”

而是进一步被用于回答:

“这个未来对完成任务到底是好还是坏?”

这也是 World Value Model 这个名字里“Value”的真正意义。


7. System-3 到底提升了多少?消融比概念更有说服力

论文在 Clothes Folding、Gift Wrapping、Cube Sorting 三类真机任务上,对四种设置进行了对比:

Base
+ Subgoal Image
+ Value
+ Subgoal Image + Value

其中最典型的是 Gift Wrapping:

System-3 条件 成功率
Base 0%
+ Subgoal Image 20%
+ Value 60%
+ Subgoal Image + Value 80%

而 Clothes Folding 中,四种设置成功率都已经达到 100%,这时二元成功率看不出差别,但任务完成质量和速度仍持续改善:

  • Base 平均任务得分约 68.3
  • 完整 System-3 提升到约 88.3
  • 完成时间从约 107 s 降到 75 s

这个结果其实比“成功率又涨几个点”更有意思。

它说明 System-3 的作用不只是在失败任务上“救回来”,还可能在已经能完成的任务上,让行为更完整、更利落、更少绕路

另一个值得注意的现象是:多个任务里 Value 单独加入的效果往往比 Subgoal Image 单独加入更强,但两者一起通常最好。

这提示我们:对于机器人而言,“知道未来应该长什么样”固然重要,但“知道自己有没有真正往任务目标前进”可能更加直接。


8. Experience Reinforcement:真正的闭环不是收更多专家数据,而是让失败变成训练数据


图6| Experience Reinforcement Pipeline.

从 SFT 到 Offline RL,再到带人类干预的 Online RL。

如果只靠行为克隆,机器人会遇到一个经典问题:

专家数据里几乎都是“正确状态”,但机器人一旦自己犯错,就会跑进训练集没有覆盖过的状态分布。

于是一个小误差可能像雪球一样越滚越大。

GigaBrain-0.7 的 Experience Reinforcement 用三步处理:

第一步:SFT

用少量专家轨迹让模型先获得基本任务能力。

第二步:Offline Experience Learning

让当前策略自己 rollout,收集:

  • 成功轨迹;
  • 失败轨迹;
  • 进度快 / 慢;
  • 完成质量高 / 低;
  • 人类在环修正数据。

然后利用 progress/value 估计和类似 Advantage-Weighted Regression 的目标,让更优的片段得到更高权重。

这一步最重要的收益不是“把专家轨迹再学一遍”,而是把模型自己的失败状态重新灌回训练分布,从而训练错误恢复

第三步:Online Reinforcement

对于插线、轴承安装、扎线带这类精细操作,再通过在线 actor-critic 和人类纠偏持续更新。

论文的四个代表性任务结果非常醒目:

任务 SFT Offline RL Online RL
Link Installation 20% 40% 100%
Gift Box Packing 80% 90% 100%
Cable Tie Insertion & Tying 0% 40% 100%
Bearing Installation 20% 60% 100%
平均 30.0% 57.5% 100%

但这里同样需要克制理解:

“Online RL 达到 100%”是这 4 个选定高难任务上的结果,并不意味着 GigaBrain-0.7 在任意机器人任务上都已经稳定 100%。

而且技术报告也明确表示,更完整的人类干预协议和在线 RL 细节将留待后续报告。

因此这部分目前更像是一个强有力的 proof-of-concept,而不是已经完全可复现的 RL recipe。


9. “One Model, Many Tasks”:开箱即用到底到了什么程度?

论文把 foundation model 本身直接放到两个差异明显的机器人上:

  • AgileX PiPER 双臂机器人;
  • Maker H01 人形机器人。

并测试域内 / 域外物体、未知摆放、未知服装实例、不同初始状态等条件。

这个实验最值得看的不是“有没有成功案例”,而是:同一个预训练策略不做每个任务单独适配时,是否仍然保留基础操作能力。

论文观察到了明显的 OOD 泛化,但作者同样承认 ID → OOD 仍存在性能下降。

所以“开箱即用”更准确的理解是:

模型已经表现出跨任务、跨实例、跨本体的 foundation capability,但还没有达到真正开放世界、任意任务零样本可靠执行。

这其实已经很不容易了。机器人世界里的 OOD,不只是换个颜色,它可能同时意味着:物体几何不同、接触动力学不同、相机视角不同、本体动作空间不同。


10. 横向 Benchmark:真正值得看的是 Maker H01 上的差距

在任务级后训练后的真机对比中,GigaBrain-0.7 和 π0.5 等模型进行了统一协议下的比较。

几个核心平均值如下:

评测 π0.5 GigaBrain-0.7
PiPER:语言跟随 88.8 91.5
Maker H01:语言跟随 75.2 84.2
PiPER:复杂操作 76.6 84.9
Maker H01:复杂操作 45.2 74.1

其中 Maker H01 复杂操作从 45.2 拉到 74.1,确实是非常大的差距。

不过这组结果也要带着一个背景来看:Maker H01 是极佳视界自研本体,其采集硬件、数据体系和模型动作接口天然有更深的协同优化空间。

所以这组结果能够证明:

GigaBrain-0.7 在自己的完整“数据 + 本体 + 模型”栈上非常强。

但它不能单独证明:

换到任意第三方机器人上都会保持同样幅度的领先。

这也正是为什么 PiPER 结果同样重要:它至少给了一个第三方机器人上的横向参照。


11. 仿真 Benchmark:RoboTwin、EBench、RoboColiseum 都拿到了领先结果

论文还给出多套仿真 / 统一 benchmark:

RoboTwin 2.0

GigaBrain-0.7 总体得分 67.35,π0.5 为 58.35,在参与比较的模型中排名第一。

EBench

GigaBrain-0.7:

  • Success Rate:33.30
  • Score:46.1

π0.5 分别为 28.08 / 42.0。

RoboColiseum

在论文统计时点的四个维度中,GigaBrain-0.7 均为第一:

维度 GigaBrain-0.7
Instruction Following 0.8166
Spatial Reasoning 0.4729
Robustness 0.6800
General Manipulation 0.6092

这也就是发布稿所说“4 个分项全部第一”的来源。

不过 leaderboard 是动态的。更严谨的写法应该是:

在论文所记录的 2026 年 8 月榜单快照和对比模型集合中,GigaBrain-0.7 四项均居首。

还有一个非常值得表扬的细节:论文在 MiMo benchmark 中明确区分了“MiMo 数据还没进训练集时的 held-out 测试”和“把 MiMo 数据继续预训练之后的诊断结果”。后者虽然更高,但作者没有把它包装成严格 held-out benchmark。

这比单纯扔一个最高分出来要可信得多。


12. 那个“超 20 分钟一镜到底”,到底意味着什么?

项目发布现场最抓眼球的,是机器人连续超过 20 分钟、完成 10 个以上任务的一镜到底演示。

这类 Demo 的价值,主要体现在三个地方:

1)长时间闭环稳定性

机器人单任务成功一次,并不难等价成连续工作 20 分钟。

只要每个动作块有一点点误差,经过数百个闭环周期后都可能累积成灾难。能够不中断完成连续任务,至少说明系统在状态跟踪、动作衔接、错误恢复和策略稳定性上已经跨过了一个更高门槛。

2)任务切换

10+ 任务连续完成意味着模型不是只围着一个固定操作脚本打磨,而需要频繁切换目标和子任务。

这与 System-2 的 subtask planning、System-3 的 progress conditioning,以及 history context 是彼此对应的。

3)失败恢复

长程任务真正危险的不是“大失败”,而是杯子偏两厘米、衣服褶皱了、夹爪第一次没夹正这种小偏差。

Experience Reinforcement 和 World Value Model 都在针对这类问题发力。

但是也要明确:

“20 分钟一镜到底”目前更接近系统 Demo 指标,而不是技术报告中定义严格、可由第三方重复执行的 benchmark。

技术报告没有给出这段 Demo 的标准化任务清单、随机种子、重复次数、置信区间以及与其他模型同协议的 20 分钟长程比较。

所以它很适合证明“系统已经能做到什么”,不应该单独拿来证明“长程任务 SOTA”。


13. 我认为 GigaBrain-0.7 真正值得关注的,不是某一个 SOTA 数字

看完整篇报告,我认为有四个点比“又刷新了一个榜单”更值得长期关注。

第一,Scale 的单位从“机器人轨迹”变成了“异构物理经验”

真机、UMI、EGO、仿真、World Model 生成数据不是互相替代,而是不同成本和真实性的数据层级。

这很可能才是具身数据真正可扩张的路径。

第二,World Model 开始从“训练辅助工具”走进策略本身

过去很多 World Model 的作用是:

生成数据 → 训练 policy

GigaBrain-0.7 则进一步变成:

当前状态
  ↓
World Model 预测未来 + 判断进度
  ↓
作为条件继续影响 policy

如果这条路线成立,未来 VLA 可能不再只是“反应式动作生成器”,而会逐渐拥有显式的未来表征。

第三,多本体不是简单把数据混在一起,而是同时改数据接口和模型接口

统一机器人表示、Robot ID、本体专属投影、Shared Action Expert、Soft Knowledge Insulation 是一整套协同设计。

这比一句“支持多机器人”更有工程含量。

第四,训练闭环开始覆盖“模型自己的错误状态”

从 SFT → offline rollout → online correction,本质上是在解决 imitation learning 最古老的问题:distribution shift

真正能够长期工作的机器人,不可能永远待在专家示范覆盖的“干净状态”里。


14. 但这篇报告还有几个很关键的问题没有回答

GigaBrain-0.7 的结果很强,但距离“具身 GPT-3 时刻”还有几块硬骨头。

14.1 System-3 的真实在线代价是多少?

论文明确给出了 System-1 不同架构的训练 / 推理耗时比较,例如 Dual-Stream 版本单次推理约 0.221 s

但完整系统还叠加了一个基于 GigaWorld-1 的约 5B World Value Model。

论文目前没有给出:

  • System-3 单次预测延迟;
  • 完整 System-1 + System-2 + System-3 的端到端延迟;
  • 真机运行硬件;
  • 控制频率;
  • World Model 是否异步运行;
  • 视频预测多久更新一次。

因此,“System-3 进入实时决策回路”作为架构思想已经成立,但它的实时工程账本还没有完全公开

14.2 世界模型预测错了怎么办?

如果 subgoal image 幻觉出了错误物体位置,或者 value 对进度判断失真,会不会反过来把 System-1 带偏?

论文使用条件 dropout 来提高模型对缺失 / 不稳定条件的鲁棒性,这是很合理的一步,但还没有系统展示 World Model prediction error 和 policy degradation 的定量关系。

14.3 37,000 小时 ≠ 37,000 小时独立知识

机器人数据高度时序相关。

同一个场景连续采集 10 小时和 10 个完全不同任务各 1 小时,信息量显然不同。

未来如果要真正研究 embodied scaling,更值得看的可能是“有效状态覆盖”和“任务多样性”,而不是单一小时数。

14.4 Online RL 还缺完整可复现 recipe

四个高难任务全部做到 100% 很有冲击力,但论文目前还没有公开完整的人类纠偏协议、奖励构造细节和在线训练基础设施。

这部分很可能会决定后续开源版本到底能不能被社区复制。

14.5 代码和 GigaBrain-0.7 权重目前还没有真正放出来

截至 2026 年 8 月 21 日,公开 GitHub 仓库仍主要是此前的 GigaBrain-0,README 对 0.7 的状态写的是 “will be released soon”;Hugging Face 的 open-gigaai 模型列表也尚未出现 GigaBrain-0.7 权重。

因此这篇现阶段应该按“论文 / 技术报告解读”来读,而不是按“开源工程部署教程”来写。

等权重和代码真正发布后,最值得补测的反而不是再看一遍官方 benchmark,而是:

1. 单卡显存到底需要多少?
2. System-3 是否独立常驻?
3. 真实 action chunk 频率是多少?
4. World Model 更新频率是多少?
5. 第三方机器人新增 embodiment adapter 要多少数据?
6. 关掉 System-3 后端到端速度能差多少?
7. 真机失败恢复能否被独立复现?

这些问题,会决定 GigaBrain-0.7 是“很强的内部全栈系统”,还是能够真正外溢成社区级具身基础模型。


15. 最后,用一张逻辑链把 GigaBrain-0.7 串起来

如果只用一条链路记住这篇论文,我会这样概括:

              【数据金字塔】
互联网 VLM 数据 + UMI/EGO + 仿真/生成 + 真机
                    ↓
        统一表示 + 统一数据管线
                    ↓
             37,256.98 h
                    ↓
              【预训练】
     System-2:理解 / 规划 / 历史上下文
                    ↓
     System-1:Shared Action Expert
            MoT + Flow Matching
                    ↓
              【System-3】
   预测未来子目标图像 + 判断任务进度 Value
                    ↓
     给 System-1 一个“未来应该怎样”的条件
                    ↓
            【经验强化闭环】
       SFT → Offline RL → Online RL
                    ↓
     把成功、失败、恢复都重新变成经验
                    ↓
      One Model, Many Tasks / 长程执行

GigaBrain-0.7 最值得关注的,并不是它给 VLA 又加了一个更大的模块。

真正的变化是:它试图把理解、预测、动作、经验四件过去经常分开研究的事情,接进同一套具身基础模型生产线里。

过去的 VLA 更像:

“我看到了什么,所以我下一步应该怎么动。”

GigaBrain-0.7 想向前迈一步:

“我知道现在在做什么,也大致知道做下去会发生什么;如果结果不对,我还要能够从自己的失败里继续学。”

这可能才是 System-3 比“又一个 World Model”更值得讨论的地方。

至于它是不是已经跨过了具身智能的 GPT-3 时刻,现在下结论还太早。

但至少从这篇技术报告可以看到一个越来越清晰的方向:

下一代具身基础模型的竞争,可能不再只是 VLA 主干谁更大,而是谁能把高质量异构数据、未来预测、跨本体动作对齐和真实世界经验闭环一起 Scale 起来。

参考资料

  • GigaBrain-0.7 项目主页:https://gigaai.cc/blog/gigabrain07
  • 技术报告:https://arxiv.org/abs/2608.15875
  • GitHub:https://github.com/open-gigaai/giga-brain-0
  • Hugging Face:https://huggingface.co/open-gigaai/models

注:本文区分“技术报告中的可核验实验结果”和“项目发布 / 演示层面的宣传表述”。“超 20 分钟、10+ 任务一镜到底”属于项目发布演示亮点;本文没有将其当作标准化 benchmark 指标使用。

点赞收藏
// 评论1
0 / 500
limxz2026-08-24 09:50

好长的文,他们是用自己的臂吗