原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied

2026-09-08 12:47:52 大公网
字号
放大
标准
分享

智象未来(HiDream.ai)正式发布具身世界模型 HiDream-O1-Embodied。秉承原生全模态的技术理念,模型进一步强化机器人的物理感知及动态预判能力,助力具身智能实现更高阶的物理互动。具身模型的发布,标志着智象逐步打通图像、视频、3D、动作等模态,贯通「理解—推演—执行」全流程,构建统一世界模型基座的技术闭环。

模型发布同期,HiDream-O1-Embodied 首次参评具身智能模型评测平台 RoboColiseum,并即时在核心的 Robustness(扰动适应)子榜单中,以平均分 0.692 的成绩登顶榜首。

智象未来 CTO 姚霆表示:「我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座。智象的原生全模态世界模型技术理念,从设计架构之初便计划面向包括动作等在内的统一表征构建。HiDream-O1-Embodied 的发布,是这一技术战略从『模拟世界』迈向『真实世界』的关键里程碑。」

登顶 RoboColiseum:以 0.692 分的「扰动适应」交出硬核答卷

常态化具身智能仿真评测平台 RoboColiseum 旨在构建多维度的系统评测体系,通过与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标准。

该平台基于高保真仿真环境构建,高度还原真实世界。平台围绕四个维度推出 4 类能力子榜、78 个高保真仿真评测任务——指令跟随、空间理解、扰动适应与通用操作。自内测上线以来,已吸引海内外数十款重量级模型参与评测。

在这四个维度中,扰动适应(Robustness)被公认为最具挑战性的一环。它通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。换言之,这不是在实验室的「温室」里考试,而是在各种「意外」中检验真正实力。

HiDream-O1-Embodied 以 0.692 分的成绩登顶该榜单,这得益于其原生全模态底座。原生全模态世界模型天然为跨模态理解与生成提供基础。而在执行环节,为了确保在真实世界的各类「意外」中保持稳定,HiDream-O1-Embodied 在三项核心能力上进行突破性创新,让理解更精准、感知更稳健、抗干扰能力更强。

语言理解——突破关键词匹配的局限

传统机械人对语言指令的理解往往停留在关键词匹配层面。说「把杯子拿过来」能听懂,换成「给我拿个杯子」或「杯子递我一下」就可能「宕机」。HiDream-O1-Embodied 覆盖多元动词、句式与表达方式的等价指令空间,不受句式限制,只锁定意图本身。无论指令如何变换,它都能穿透字面,直达用户的真正意图。

视觉感知——多视角协同,避免「一处失灵、全局失效」

在物理世界中,机器人的视觉通道并非处于理想状态。相机位置可能发生偏移,标定精度会随时间变化,单一路画面亦可能受到遮挡或干扰。HiDream-O1-Embodied 综合多个视角的讯息,让不同视觉通道相互补充,而非依赖某一固定视角。当部分视觉资讯出现偏差或暂时不可用时,模型仍能借助其他视角理解场景、判断任务并继续执行,让系统由「一处失灵、全局失效」,转变为「局部受限、整体仍可运行」。

高容错机制——在「不完美」中学会稳定执行

大多数模型的训练基于「完美数据」——清晰的图像、完整的画面、标准的视角。但真实世界从来不是这样。光照变化、画面污损、视野遮挡、讯号波动,都是机械人在实际运行时可能遇到的日常情况。

HiDream-O1-Embodied 在训练阶段便主动引入多种非理想条件,让模型反复面对不完整、不稳定的资讯,并学会从有限线索中作出可靠判断。这样的训练使模型不只追求理想条件下的最佳表现,也更加重视复杂环境中的持续稳定。

这种容错能力亦不局限于某一种视觉异常。面对光照、外观和场景变化,模型能够更灵活地利用已有资讯,减少环境变化对任务执行的影响。对 HiDream-O1-Embodied 而言,真正重要的不只是「看得清时做得好」,更是「条件不理想时,依然能够稳稳完成任务」。

模型 + 数据:打造「真实基座 + 生成增强」数据生产范式

而这种「在训练中见过足够多不完美」的能力,并非凭空而来。它触及一个更底层的命题:模型的认知边界,受到其所接触数据的影响。高质量数据,恰恰是具身训练中最稀缺、也最具决定性的变量。智象极力打造的「模型+数据」双驱动策略,正是问鼎具身世界模型榜单的真正护城河。

该策略的关键突破口,在于让数据生产本身成为模型迭代的有机一环。为此,智象探索出「真实基座 + 生成增强」的数据生产范式。模型不再是被动接收数据,而是主动参与数据的创造。

以与诺亦腾的合作为例:其高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级的数据精细化扩增。基於单段真实动作样本,模型可以生成变体视频:在严格遵守物理约束不变的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。

这一机制的关键,在于模型既做「考生」,也做「出题人」——它根据自身所需主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。最终让 HiDream-O1-Embodied 在面对现实世界的强扰动时,展现出超乎寻常的鲁棒性。

原生全模态世界模型矩阵日臻完善

就在不到一个月前,智象刚刚发布了交互式世界模型 HiDream-O1-World,并在交互式视频世界模型评测基准 WBench 的 Navi 分榜中,以平均分 80.9 登顶榜首。

交互式世界模型解决的是「理解与推演」,让 AI 在数字世界中具备对空间、时间、运动与物体关系的完整认知。而具身世界模型解决的是「操作与执行」,让 AI 在物理世界中完成真实任务。两者将形成有力互补,为原生全模态世界模型的发展筑牢根基。

正如智象未来创始人兼 CEO 梅涛博士此前所言,下一代大模型竞争的关键,不在於单一模态能力的增长,而是从单模态走向多模态,并走向原生统一的全模态。

从 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象作为创新型大模型企业,正坚定地逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型家族矩阵。这既是原生全模态技术在多领域铺展的能力,更体现了其强大的内生进化能力。

站在世界模型前沿技术加速发展的时代拐点,智象正加速创新向前。