
Psi-W0将人手示范转化为机械手可执行的操作轨迹
为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人?
就在上周,发布Helix 2.5,使用人类行为数据集Index进行预训练,在完成三类家务任务的适配后,将机器人带进30个未采集过数据的家庭进行测试。
这项研究关心的,正是从人类经验中学到的能力,能否帮助机器人应对新的环境。
灵初智能这次进一步追问:人类数据进了模型,不等于人的操作经验就能被机器人直接使用。这中间,还缺什么?
在十万小时级数据积累的基础上,灵初智能的模型Psi-R2.5继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。它关注的不只是让机器人看过更多操作,还包括怎样把这些操作变成有效的训练材料,以及面对新任务时,怎样更容易地教会它。
而开头那个看似绕远的办法,恰恰是为了少绕一些弯路。
教机器人学人,这次先倒着来
人和机器人,都能拿起一瓶可乐。但两段“拿可乐”的视频放在一起,就能教机器人照着做吗?
这里面仍然存在一些“老生常谈”的问题:人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同。再加上人手姿态估计的误差,一个人可以顺利完成的动作,转换成机器人的关节运动后,未必还能成功。
所以,给机器人看懂“这是在拿可乐”,和提供一份“可以这样拿起可乐”的动作数据,是两回事。
灵初把人和机器人执行类似任务、主要在任务含义上对应的数据,称为“弱配对数据”。它更希望获得的,是另一种对应关系:除了人和机器人本体不同,两边的场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功,这就是“强配对数据”。
弱Pair与强Pair的对比
强配对数据强调对齐,不只是要求人和机器人“都做了同一件事”,而是“人的这段操作,对应着机器人这段可执行的动作”。
但这样的数据,很难直接采集。
让人和机器人各做一遍,很难保证场景和动作时序逐帧对应。直接照搬人的轨迹也未必成功,因为两者的关节结构、摩擦条件并不一样。
今年4月,灵初已经尝试让Psi-R2与世界模型Psi-W0配合,通过轨迹推演和强化学习,将人类操作转换成可执行的机器人数据。问题是,这套流程涉及多个模型协同和策略优化,生产数据的过程比较重。
灵初巧妙地换了一个方向:为什么一定要从人类操作出发,再费力生成一段能够成功的机器人动作?
反过来,真实机器人操作的图像和动作,本来就是可用的。以它们为起点,生成匹配的人类数据,不就可以获得一份新的对照样本?
按照这条思路,灵初逆向使用Psi-W0,从真实机器人数据出发,生成对应的人手操作数据,再将这些高质量配对数据用于训练端到端转换器。这个转换器的输入是人类操作数据,输出则是匹配的机器人图像和动作
高质量机器手-人手配对视频
只需用手机在日常场景中录制一段人手操作视频,即可通过模型转换为对应的机器人数据。
这里需要区分一下,转换器不是负责决定机器人下一步做什么的策略模型,而是一个带动作输出的视频编辑模型。它要做的,也不只是把画面中的人手换成机械手,而是同时得到机器人可以使用的动作数据
那怎么判断转换有没有用?
灵初设置了两种验证方式:一种是直接在机器人上回放转换后的轨迹,看能否完成相同任务;另一种是把转换后的数据用于后训练,再看训练出的模型能否完成相关任务。
判断标准不再只是“生成的视频像不像”,而是数据能不能支持实际操作。据灵初介绍,转换后的数据已在上述两类测试中得到验证。不过,部分特别复杂的任务仍未直接完成,数据转换并不等于所有任务都已经解决。
沿着这条思路,Psi-R2.5也重新梳理了数据本身的质量。灵初减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线,把任务拆解到更细的原子动作,再进行标注和审核。
毕竟,数据的价值,不能只按小时算,还得看覆盖了多少种任务、机器人能用上多少。
Psi-R2.5多任务评测效果
视频,也能当机器人的
如果一段人类操作,已经能转换成机器人更容易使用的参考,那么它或许也可以有另一种用途:不只是进入训练集,也可以成为当前任务的提示。
这也意味着不必把所有要求都写成一大段指令,而是给机器人一个例子——“照着这个来”。
这是灵初在Psi-R2.5中进一步探索的上下文学习,也就是In- ,简称ICL。在其展示的任务中,机器人不需要更新模型参数,而是根据当前上下文提供的线索,推断该做什么、该如何做
Psi-R2.5 In- 展示
这里有一个关键变化:新示范不一定要再走一遍训练流程,才能影响机器人的行为。它也可以作为当前任务的参考,交给已经训练好的模型使用。
难点仍然在于,示范来自人,执行者却是机器人。灵初的思路,是利用前面的强配对数据模型,将人类示范转换成对应的机器人数据,再更好地作为提示输入模型。
同一种数据转换能力,由此有了两个用途:一是准备训练材料,二是帮助机器人理解眼前的示范
这也与Psi-R2.5的双层架构相衔接。它的上层模型负责拆解长程任务,把一段较长的指令分成子任务;下层模型则结合子任务和当前观测,输出具体操作轨迹。一个负责拆清楚要做什么,一个负责落实到动作。

换个任务,不一定要重新训练模型,也可以用一段示范告诉机器人该怎么做。
当然,这里的不用重新训练,不等于模型此前没有训练过,也不等于随手拍一段视频,就能让机器人完成任何工作。目前灵初展示的是特定任务中的ICL能力,更多实现细节尚待公布。
但它提供了一个值得继续观察的方向:人的示范,不一定只能是离线训练时使用的材料,也可能成为实际使用机器人时的一种交互方式。
99%成功率,不止靠预训练
预训练已经用了十万小时级的数据,为什么到了客户现场,机器人还得接着练?
在灵初看来,真实部署面对的物品种类、规格和作业节拍,往往带有很强的定制化要求。短期内,不能指望基础模型完全不做适配,就直接进入所有客户现场;后训练仍然是必要的一环。
那训练基础模型的意义是什么?
灵初在最新的Tech blog中明确指出,预训练并不是让后训练立刻消失。从部署角度来看,现阶段训练基础模型的意义应该是让后训练需要的数据更少,从而降低适配与部署的成本
手机盒装配,就是一个具体例子。这个任务涉及多个步骤,对操作精细度也有较高要求。据灵初介绍,通过结合人工参与与强化学习的后训练框架,经过几轮迭代,任务成功率达到约99%,耗时1-2个工作日
预训练积累的本事,在这里派上了用场:机器人不用从零学起,只需补充少量任务数据,再通过人工参与和强化学习,把容易出错的地方练好。
到了客户现场,训练也没有结束。机器人在哪里失败,相关数据就被收集回来,用于下一轮改进。团队表示,这套方案已经用于实际客户现场,处理作业中遇到的复杂情况。
这与前面的示范引导并不矛盾。示范提供一种表达新任务的方式,后训练则继续处理具体操作中的难点。两者不是要求机器人每次都从零开始,而是在已有能力上,减少适应新需求的额外投入。
Psi-R2.5正把预训练积累的能力用到具体工作中。用好人类经验,让客户少花时间、少花成本就能把机器人用起来,是灵初持续改进基础模型的目标。
Tech blog:
*本文系量子位获授权刊载,观点仅为原作者所有。
梁文锋署名,DeepSeek发新论文!剑指大规模Agent训
DSec平台为Agent训练提供大规模沙盒支持,保障稳定运行...(127 )人阅读时间:2026-09-24
教机器人干活,光“刷课时”可不够!灵初这次较真数据质量
Psi-W0将人手示范转化为机械手可执行的操作轨迹,通过预训...(130 )人阅读时间:2026-09-24
2026网易未来大会圆满落幕,硅基智能跨越临界点
9月23日,杭州举办网易未来大会,聚焦碳基文明与硅基智能的相...(171 )人阅读时间:2026-09-24
GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,
传统机器人学习新任务需重新编程或训练,难以适应多变环境。GP...(128 )人阅读时间:2026-09-24