创科路上/「RoboDojo」平台获全球学术及业界肯定 港大首创具身人工智能统一评测基准
- 字号
- 放大
- 标准

具身人工智能(Embodied AI)技术近年发展迅速,但这些具身机械人模型到底哪个较强?强在哪里?能不能从仿真走到真实世界?离真正通用操作机械人还有多远?这些都缺乏统一的评测标准,令各款机械人难以作公平及标准化的比较。香港大学多媒体实验室(MMLab)近日宣布,推出全球首个结合模拟环境与真实世界机械人操作的具身人工智能统一评测基准平台「RoboDojo」。
评测结果显示,目前表现最佳的模型在真实测试的成功率仅得12.8%,远低于人类专家的100%,反映AI机械人要实现稳定可靠的日常应用,仍有巨大的进步空间。RoboDojo推出以来,迅速获得全球学术及业界高度关注与肯定,于社交平台录得逾10万次浏览及逾10万次下载。\大公报记者 郭如佳
港大首创的「RoboDojo」统一评测基准平台,树立了智能机械人评测的新标准。该项目由港大计算与数据科学学院副院长(人工智能科技转化及拓展)罗平教授,与其博士研究生陈天行共同发起,并汇聚了包括加州大学柏克莱分校及清华大学在内、全球近20所顶尖大学与科研机构共同参与。
透过数十任务全面评估
港大研究团队表示,具身人工智能旨在赋予机械人在实体环境中感知、推理并采取行动的能力。然而,现有的评测方法大多局限于模拟环境,或因采用不同的硬件配置、测试条件和评分标准,导致不同模型之间难以进行公平且标准化的比较。因此,即使机械人在示范中表现出色,亦未必能真实反映其在复杂多变的现实场景中,持续且稳定地执行任务的能力。
为应对挑战,RoboDojo创新地将模拟评测、标准化真实机械人测试及策略模型比较整合至单一框架。平台目前涵盖42项模拟任务、18项真实世界机械人任务,以及30个具代表性的机械人策略模型,全面评估机械人在泛化、记忆、精细操作和长程任务执行等关键维度的能力。
评测结果揭示了当前技术的瓶颈:目前表现最佳的模型,在模拟环境及真实测试中的成功率分别仅为8.80%和12.8%,远低于人类专家的76.03%及100%。数据表明,具身人工智能要在复杂环境中实现稳定可靠的日常应用,仍有相当大的进步空间。
罗平教授表示,RoboDojo是首个由香港牵头、结合模拟与标准化真实机械人评测的基准平台。它有助推动具身人工智能研究由过往着重示范成果,迈向可量度、可比较及值得信赖的技术进步。
促进全球学术产业协作
RoboDojo自推出以来,迅速获得全球学术界与业界的高度关注。项目于社交平台X的发布内容录得逾10万次浏览;同时,其相关的开源资源亦在短短一周内,于AI社群平台Hugging Face录得逾10万次下载,反映国际科研群体对此项研究的高度肯定。
展望未来,港大期望RoboDojo将有助建立公平、透明和可重现的评测机制,促进全球学术界与产业界的深度协作,推动具身人工智能技术,由展示导向走向可持续发展,为研发更安全、更可靠并可应用于真实环境的机械人系统,提供核心技术支撑。

