智元GE-Act 2.0重磅升级 看懂机器人AI的“开窍式”进化路径
- 字号
- 放大
- 标准
机器人想要真正实现自主作业,核心是看懂环境、预判变化、主动行动,并具备持续进化能力。智元全新发布的GE-Act 2.0,成功验证原生世界—动作模型的完整预训练与规模化生长路径,让机器人AI告别“应试刷题”,真正拥有举一反三的通用能力,是国内具身智能领域的重要突破。

图中每个任务接受四档数据量训练(300 小时/ 1200 小时/ 5000 小时/ 30000 小时),随着训练数据不断扩大,技能覆盖范围与任务成功率同步扩大,这验证了原生世界-动作模型预训练与Scaling路径
拒绝应试假象:零样本实测检验真实通用能力
当前多数机器人模型存在“刷分假象”,看似精度很高,实则依靠场景专属微调训练,一旦更换光照、视角、物品,性能迅速崩盘,并不具备通用能力。
为此,GE-Act 2.0采用零样本真机测试作为唯一标准:不微调、不示范、不换模型,所有测试场景、物体、环境均从未出现在训练集中,完全依靠模型原生认知完成操作。
研发团队使用跨度100倍的训练数据(300小时至3万小时)验证缩放规律。结果显示,机器人能力呈现明显“顿悟式增长”:精细操作任务数量大幅提升,毛巾折叠、纸杯嵌套、精细插拔、插花等小动作,小数据模型完全无法理解,在3万小时大数据加持下可稳定完成。
同时,模型整体成功率持续上涨,且5000小时至3万小时区间仍无性能饱和迹象,成长潜力充足。最能体现通用性的是跨机型迁移效果:主力机器人贡献超半数训练数据,另一机型训练占比不足2%,依旧实现显著能力提升,证明模型学到的是通用操作逻辑,而非设备专属技巧,综合性能超越多款行业主流模型。

思维范式升级:机器人从被动反应变为主动预判
传统机器人属于“看一步动一步”的被动执行模式,没有未来推演能力,面对动态场景极易出错。GE-Act 2.0原生世界—动作模型,复刻人类行为逻辑:先预判未来环境变化,再制定动作策略,实现从“被动反应”到“主动预见、驱动行动”的升级。
不同于行业拼接预训练模型的改良思路,GE-Act 2.0从零构建具身专属架构,通过三大核心创新解决识别慢、推理弱、规划乱的痛点。
自研CoAE视觉编码器,将复杂画面压缩为24个视觉特征单元,算力仅为主流模型的十六分之一。通过智能筛选有效信息,在大幅降本提速的同时,指令画面匹配准确率高达97.95%,实现轻量化与高精度兼顾。
传统模型需要多轮反复推演,算力高、延迟大。GE-Act 2.0支持一次性生成完整未来动作序列,并以动作误差反向优化世界预测模型,在常规显卡上单次连续动作生成仅需104毫秒,推理速度大幅领先同类世界动作模型。
同一任务存在多种合理操作方式,传统模型容易因动作差异产生学习混乱。GE-Act 2.0通过KASO算法筛选最贴合真实场景的预测路径,仅保留有效样本参与优化,让陌生场景目标识别率提升7.5%,抓取成功率提升10%,大幅提升泛化稳定性。

GE-Act 2.0架构
全量数据复用:彻底解决训练数据浪费难题
传统机器人训练极度依赖高质量、完整标注数据,大量失败轨迹、无标注视频、试错数据直接作废,数据利用率极低。
GE-Act 2.0重构数据训练体系,让不同类型数据各司其职:3.9万小时环境视频用于学习世界变化规律,包含大量无动作标注素材;3.2万小时机器人轨迹数据训练动作认知,兼容失败操作与部署回流数据;3万小时完整配对数据,打通环境预测与实操动作的协同能力。
这套机制让机器人可以从成功案例学方法、从失败数据学避错,最大化利用海量真实场景数据,大幅降低训练成本,加速模型迭代。
行业价值:敲定通用机器人规模化生长路径
在智元GE世界模型体系中,GE-Sim负责虚拟环境搭建与策略评测,GE-Act承担核心落地功能,将虚拟的未来预测能力转化为真实机器人的物理操作能力。

KASO从多个预测未来中选出与真实动作最一致的结果,再用于联合训练,避免未来预测与动作监督错位
本次GE-Act 2.0的核心突破,是正式证实原生世界—动作模型具备可持续缩放能力。机器人零样本通用能力可随数据规模稳定提升、无明显天花板,彻底打破定制化调参的传统模式,为下一代通用人形机器人的规模化进化,提供了清晰、可落地的技术路径。
随着训练数据规模扩大,两种机器人本体的多数技能持续提升,数据占比不足2%的G2-90D同样获得明显增长。

