三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

主动理解物理世界:ROMA让机器人学会交互探索物体

时间:2026-10-10人气: 作者: 佚名

主动理解物理世界:ROMA让机器人学会交互探索物体(图1)

我见,我摸,我理解。

人类认识一个物体,从来不只是「看」。看到一个盒子,我们可能会拿起来掂一掂,判断它有多重;我们可能会摇一摇,听听里面有没有东西;还可能会捏一捏,试试它软不软。人类感知世界的过程不是被动地接受已有的感官信息,而是在发现我们对身边事物不够了解时,主动地与之交互,根据交互的信息补全对世界的物理理解。

来自人大高瓴GeWu-Lab、智源研究院、燧行 等机构的研究者所提出的ROMA (Real-World - Multi- ),正是希望将这种主动感知物理世界的能力赋予多传感器机器人。该工作全面地从数据集与 、多模态推理模型和物理交互系统展开对具身多模态主动感知的系统研究,希望为下一代主动具身 Agent铺平道路。

主动理解物理世界:ROMA让机器人学会交互探索物体(图2)

图 1 | 真实世界多模态主动感知系统 ROMA

如果当前的信息不足以完成任务,

机器人应该怎么办?

想象这样一个场景:人类和机器人说「帮我找个杯子装点茶」。机器人需要首先明白人类的意图是想找一个空的杯子,然后从各种可能的候选物体中,找到这一空杯子。它可能需要通过摇一摇、掂一掂,才能判断哪个杯子是空的。这一稀松平常的场景反映了一个关键的具身研究问题:机器人不仅需要理解人类指令中隐含的意图,还需要知道完成当前任务还缺少什么信息,这些信息需要通过什么方式、哪些感知模态来主动地获取。

ROMA 正是围绕这一关键问题,给出了一套从数据集和,到推理模型和物理系统的完整方案。它将视听触力四大常用模态的感知整合到ROMA-7B模型中,并教会机器人判断自己缺什么信息,确定和哪个物体交互、怎么交互、关注什么模态、是不是已经足以完成任务了,并顺利地执行这些交互来获得多模态反馈,形成一个完整的推理-交互-反馈循环。

ROMI-2K:近 2000 个真实物体,

多感官交互数据

要让机器人学会主动地交互与探索,一个核心的挑战在于:机器人需要理解不同的物理交互会带来什么信息。为此,研究团队构建了一个大规模真实世界多模态物体交互数据集ROMI-2K,覆盖近 2000 个日常物体与内含物组合,并围绕 6 种基础物理交互(举起、按压、碰撞、捏紧、摇晃和旋转),进行手持设备和真实桌面机械臂场景的数据采集。每次与物体的交互同步采集视觉、听觉、触觉和力四种模态的观测信息,同时对物体材质、硬度、粗糙度、纹理、内容物等物理属性进行详细的标注。在此基础上,研究团队进一步构建了场景级多模态主动感知问答数据,让模型学习根据当前任务选择合适的交互行为与感知模态,以获取缺失的关键证据。

主动理解物理世界:ROMA让机器人学会交互探索物体(图3)

图 2 | 真实世界多模态物体交互数据集 ROMI-2K

ROMA Bench:从交互到「感知链」

在主动感知过程中,一次交互获得的模态观测,会影响下一次交互的选择。例如,通过摇晃判断物体是否为空时,如果物体发出了明显的内含物声音,便不再需要交互。而没有发出声音时,也不能排除是内含物将物体内部填满了,需要再掂一掂重量来确认。这就形成了一条由推理-交互-反馈不断串联起来的感知链。基于感知链这一重要概念,研究团队在 ROMI-2K 的真实桌面子集上进一步构建了ROMA Bench,包含2,100 个场景级主动感知任务,覆盖:(1)-Chain:单属性推理;(2)Multi-Chain:多属性、长链推理;(3)-:根据用户隐含意图确定需要获取的属性并推理。任务涉及硬度、粗糙度、纹理、内容物、材质和重量等多种物理属性。这使得主动感知脱离「做一次交互然后回答问题」的简单范式,而是形成一个需要完整的目标选择、动作选择、模态选择和连续推理的过程。

主动理解物理世界:ROMA让机器人学会交互探索物体(图4)

图 3 | ROMA Bench 多模态主动感知任务示例

ROMA 系统:物理接口与会主动决定交互的 ROMA-7B

ROMA Bench 为考察驱动机器人的模型是否「知道该怎么探索」提供了可能,而 ROMA 系统则进一步让这种能力真正地进入物理世界。研究团队搭建了一套真实世界多模态物理交互系统,将视觉、听觉、触觉和力四种感知模态与机械臂连接,并设计统一的物理交互接口,使模型能够直接输出真实物体的交互指令。

具体而言,ROMA 将抓取和 ROMI-2K 中的六大基础交互动作程序化,并基于 抓取策略,搭配精心设计的点云补全、抓取筛选和增强机制,提升真实世界中的稳定抓取能力,将交互决策可靠地转化为真实世界中的物理动作。

在此基础上,研究团队基于 Qwen 2.5-Omni,通过多传感器联合对齐和主动感知场景微调训练了 ROMA-7B 主动感知模型。它能够结合当前任务目标和已有的观测信息,主动地决定抓取哪个物体、执行什么交互、需要哪些模态的信息,以及该何时停止探索,并根据每次交互获得的新数据动态地调整后续的交互,形成「推理-交互-反馈-再推理」的闭环,让机器人能够主动地通过与世界交互,不断完善对物理世界的理解。

主动理解物理世界:ROMA让机器人学会交互探索物体(图5)

图 4 | ROMA 真实世界主动多模态物体感知系统示意图

多模态主动感知能力整体打平 GPT-6 Astra,领先多款前沿大模型

在多模态主动感知 ROMA Bench 的 2100 道多选题、判断题和排序题上,ROMA-7B取得 72.9%的总体任务成功率,整体表现基本与最新的GPT-6 Astra持平,并明显优于GPT-5.4和 3.5 Flash。GPT-6 Astra 凭借更强的视觉理解与通用推理能力,在单步、视觉可推断属性上表现突出;而 ROMA-7B 则在需要连续交互、综合多种模态反馈,尤其是音频的 Multi-Chain 任务中展现出更强的优势,明显超过 GPT-6 Astra。

相比之下,参数规模相近的未经过 ROMI-2K 微调的Qwen 2.5-Omni和Qwen 3-Omni在面对 ROMA Bench 所要求的目标选择、交互指令遵循和多模态主动推理时表现明显不足。这也体现了ROMI-2K 数据集的核心价值:通过大规模真实物体交互时的同步视觉、音频、触觉和力数据,为学习多模态主动感知能力提供了关键的训练基础,使 ROMA-7B 能够以仅 7B 的模型规模获得接近 GPT-6 Astra 的多模态主动感知能力,并超越其他前沿闭源模型。

主动理解物理世界:ROMA让机器人学会交互探索物体(图6)

表 1 | ROMA Bench 多模态主动感知测评结果

在真实世界实验中的 8 个多物体场景、132 道开放问答题上,ROMA-7B 仍取得 61.4%的总体成功率,接近于 GPT-6 Astra 并仍然大幅领先其他前沿大模型,证明通过 ROMI-2K 学习到的主动感知能力能够在真实世界的场景中保持,而不是仅仅局限于基准测试中的固定任务形式。

主动理解物理世界:ROMA让机器人学会交互探索物体(图7)

表 2 | 真实世界多模态主动感知测评结果

主动理解物理世界:ROMA让机器人学会交互探索物体(图8)

图 5 | -Chain 任务完成演示(ROMA全自动,2.5倍速)

主动理解物理世界:ROMA让机器人学会交互探索物体(图9)

图 6 | Multi-Chain 任务完成演示(ROMA全自动,2.5倍速)

主动理解物理世界:ROMA让机器人学会交互探索物体(图10)

图 7 | - 任务完成演示(ROMA 全自动,2.5倍速)

从 ROMA 出发,

迈向更主动的多模态具身智能

ROMA 目前主要围绕 6 种基础物理交互展开研究,但这只是一个起点。作为一个基础性的系统工作,ROMA 未来可以进一步启发并探索:更丰富的交互 Skill、主动感知与操纵策略的统一、多轮对话与长时序推理、跨场景的持久物体记忆、面向不同机器人形态的主动感知等。正如开篇所说:我见,我摸,我理解。ROMA 希望让机器人也能主动与世界交互,并通过一次次的探索真正理解世界。