
在长期的机器人操作 (Robot ) 的研究中,单模型 (如视觉语言动作模型,--, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。

视频链接:
为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——-。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。
该框架打破了「单一 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub ) 与统一技能库 (Skill ) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。

破局「分而治之」:从单一模型到多模型集成具身智能系统
Annie Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「 the brain means to our heads。」)
在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。
- 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」()出来。
这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。
基于 VLA、WAM、世界模型与验证器等模型的异构工具库
- 的核心突破在于其统一技能库( Skill )的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):

图 1:- 系统及其协调组件的总体架构
按图 1 所示,- 将技能分为 3 类:
结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.

图 2:带想象力和评估技能的动作选择与不带想象力的评估
系统级架构:精细分工的图结构调度
在大模型 agent 工程范式变革历史中,从 到 再到 loop ,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。
(1) 主智能体(Main Agent):决策和调度中枢
如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标()。通过分层上下文工程( ),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。

图 3:主代理的协调与反馈流程
(2) 角色化子智能体(Sub-Agent):独立的专职单元
子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。
(3) 三层外记忆和上下文管理机制
为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4):
当上下文达到上限时,系统自动触发 压缩历史,保证系统在超长时序下的稳定运行。

图 4:三层记忆与上下文管理
实验结果:全方位刷新 ,真机表现惊艳
- 研发团队在、-Plus、-Pro 以及 四大被广泛采用的基准及真实机器人上进行了全面评估:
(1). 在 上,得益于将 作为世界模型技能进行轨迹想象和动作选择,- 取得了99.2%的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot 后,平均成功率达到了98.8%(超越底座 2.0%)。
(2). 在面对各种光照变幻、相机位姿突变的 -Plus 扰动测试中,- (w/ WM) 取得了 93.9% 的超高完成率,比单一 基础底座大幅提升了 11.7%( 系列的实验结果可见图 5)

图 5:, -Plus, 和真机实验的不同维度的效果对比
(3) 在测试视觉记忆与长程规划的 -Sim 测试中,- 在 维度取得了 25.00/22.51%(score/ rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。

表 1:- 在五个 -Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。
(4) 真实机器人部署:多层纸杯叠放长程任务为例。- 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi- Cup )」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。

视频链接:

图 6:真实机器人多层纸杯叠放工作流与实验结果
高稳定度:在 100 次标准真机实验中,- 具身智能系统展现出了极高的完成度(见图 6b)。
强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。
结语
- 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。
清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。
未来,团队将进一步推出 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!
从认路到「跌倒再战」,机器人也在重走大模型的Scaling之
过去三年,大模型通过预训练、对齐和部署实现能力提升。具身智能...(121 )人阅读时间:2026-09-14
破局单模型局限!清华大学李秀教授团队提出EMERGE-Pol
在机器人操作研究中,单一模型难以应对复杂任务。清华大学等机构...(172 )人阅读时间:2026-09-14
算法工程师要失业了?阿里和浙大联手提出Astar,用AI指导
AI模型迭代依赖人类经验,修改模型成本高昂,试错难度大。通用...(162 )人阅读时间:2026-09-14
PhyAgentOS v1.0.0发布:为物理智能体打造可执
一条网络视频展示了由 PhyAgentOS v1.0.0 支...(126 )人阅读时间:2026-09-13