{{ countdown > 0 ? countdown + 's' : '获取验证码' }}

洞察金融市场

传播中国价值

Global Perspective, China Value

智元发布GE-Act 2.0,首次验证原生世界—动作模型预训练与Scaling路径

2026-09-13 21:27

近日,智元发布原生世界—动作模型(World Action Model,WAM)GE-Act 2.0。与沿用现成视频生成模型的主流路线不同,GE-Act 2.0的所有模型参数(视觉表征、未来生成、动作预测等核心组件)均从随机初始化开始,在具身操作数据上从头训练。

训练完成后,GE-Act 2.0不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验,覆盖100项原子任务、20类技能、两种机器人本体。

结果显示,随着数据规模扩大100倍,GE-Act 2.0不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作,原生世界—动作模型的Scaling路径首次被系统性验证。

用100倍数据验证Scaling

针对评测任务做额外训练能刷高成绩,却分不清能力来自通用预训练还是“考前特训”,GE-Act 2.0把真机零样本表现作为标准,不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。

在相同训练配方下,最后一阶段分别使用300/ 1200/5000/30000小时四档数据,三条 Scaling 线索清晰可见。

一是技能“逐格点亮”,取得非零成功率的任务,在G1-OP机器人上从39项增至76项,在G2-90D机器人上从24项增至72项。折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,当数据达到3万小时规模时出现显著的能力顿悟;

二是任务成功率持续提升,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5000到30000小时仍未见明显饱和。

三是“富本体”带动“稀缺本体”,G1-OP机器人贡献超50%训练数据,G2-90D 机器人占比不足2%,但后者仍随共享数据扩大提升17.7个百分点,显示出跨本体能力迁移真实发生。

作为补充,微调后的GE-Act 2.0在RoboTwin陌生环境测试中取得60.52%成功率,在GenieSim指令遵循测试中获得0.770分,均超过π0.5、GR00T N1.7等参与比较的模型。

给出原生 World Action Model预训练方法论

传统动作模型“看到什么就做什么”,世界—动作模型多走一步:先预测“这样做下去,世界会变成什么样”,再决定动作。

大多数世界—动作模型从现有的视频生成模型出发,再接入动作模型,难以看清世界预测与动作能力究竟如何从具身数据中获得。GE-Act 2.0设计了面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。

机器人既要看清物体和运动又要控制计算成本。GE-Act 2.0设计更高效的视觉编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,同时保留语义、运动与局部结构。

压缩后反推动作的精度与 DINOv3、V-JEPA 2.1 等高信息量表征接近,在4000条机器人操作数据的受控测试中,指令—画面匹配准确率达97.95%,为五种对照表征中最佳。

世界模型负责预测未来,逆动力学模型(IDM)负责生成动作。传统方法需要多轮计算才能生成未来,计算与显存占用极高,既难以让两个模型共同训练,也会拖慢推理速度。

GE-Act 2.0采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型;配合高效视觉表征,模型在RTX 5090显卡上生成一个chunk连续动作仅需104毫秒,大幅优于现有大部分WAM。

同一任务常有多种正确做法,模型想象“左手抓取”,数据记录的却是“右手”,各自合理,合在一起就是错误信号。GE-Act 2.0以知识对齐选择性优化方法(KASO),一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练,来解决这个问题。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。

一套“吃进所有数据”的架构

机器人训练与部署中产生的数据形态各异,传统模仿学习依赖完整的“指令—画面—动作”配对,大量数据因此被浪费。GE-Act 2.0 提出的数据架构让每类数据承担合适的学习任务:

3.9万小时“指令—视频”数据预训练世界模型,学习环境如何变化——其中包含3000小时无本体数据(不带动作标注的第一视角与人类操作视频)。

3.2万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”——其中包含2000小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签。

3万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。

借助逆动力学模型,无指令、无成功标签甚至失败的轨迹,都能还原出动作监督信号——失败数据也能成为训练资产。

GE-Act 2.0验证了原生世界—动作模型可规模化的预训练路径,也是从“世界预测”走向“世界驱动行动”的关键一步。

在智元GE世界模型体系中,GE-Sim面向策略评估与环境构建,GE-Act将未来预测转化为真实机器人的操作能力。当更多类型的具身数据被统一利用、零样本能力随数据规模持续增长,具身基础模型的 Scaling 路径正变得更加清晰。

APP