智元发布原生世界—动作模型GE-Act 2.0

2026-09-10 10:26:37
18675
当前具身智能领域的一大痛点是,针对评测任务做额外训练能刷高成绩,却分不清能力究竟来自通用预训练还是“考前特训”。

9月9日,智元机器人正式发布原生世界—动作模型GE-Act2.0(World Action Model,WAM),首次系统验证了原生世界—动作模型的预训练与Scaling路径。这是继今年4月发布GE-Sim2.0世界模型后,智元在具身智能基础模型领域的又一关键进展。

当前具身智能领域的一大痛点是,针对评测任务做额外训练能刷高成绩,却分不清能力究竟来自通用预训练还是“考前特训”。GE-Act2.0因此将真机零样本表现作为检验标准——不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。

与沿用现成视频生成模型的主流路线不同,GE-Act2.0的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件,均从随机初始化开始,在具身操作数据上从头训练。训练完成后,模型直接接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本检验——覆盖100项原子任务、20类技能、两种机器人本体。

实验设计采用了300小时、1200小时、5000小时和3万小时四档数据进行对照训练。结果显示,随着训练数据规模扩大100倍,三条Scaling线索清晰可见:

技能“逐格点亮”。取得非零成功率的任务,在G1-OP机器人上从39项增至76项,G2-90D机器人从24项增至72项。折叠毛巾、嵌套纸杯、拔插笔盖、插花等精细操作,在小规模数据下无法完成,当数据达到3万小时规模时出现显著的能力增长。

任务成功率持续提升。G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5000到3万小时仍未见明显饱和。

跨本体能力迁移真实发生。G2-90D本体训练数据占比不足2%,但随共享数据扩大,其能力仍提升了17.7个百分点。

GE-Act2.0采用了控制导向的自编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,指令-画面匹配准确率达97.95%。模型采用一步式视觉规划器,在RTX5090显卡上生成一个chunk连续动作仅需104毫秒。

针对“预测和动作对不上”的核心难题,团队提出了KASO方法,一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练。在陌生场景评测中,机器人完成抓取的成功率提高了10个百分点。

免责声明:本文观点来自原作者,不代表天天在线的观点和立场。文章内容仅供参考、交流、学习,不构成投资建议
责任编辑:蓝羽_XN054
猜你感兴趣