三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?

时间:2026-08-10人气: 作者: 佚名

导盲犬有多贵?

光是进行繁育, 再加上养育, 紧接着是施行训练在同一条犬只上, 成本就已然超过了5万美元。存在相当多的申请者处于长期排队状态, 平常往往需要等待2至4年时间, 才能够匹配到适宜的服务犬;然而犬只实际服役的年限也是极为有限的标点。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图1)

此刻, 有一支来自Mila - 魁北克AI研究所的, 以及蒙特利尔理工的团队, 宣称在这件事上成功将成本压低到了大约2000美元。

他们造出了一只名为Milo的机器导盲犬,它无需提前对环境进行扫描, 无需外接笔记本算力, 无需联网, 在室内室外均可行走, 能一边带路一边避开障碍物与行人, 并且知晓旁边人的位置及是否会发生碰撞。

整套硬件方案和软件栈,全部开源

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图2)

01.

先说清楚:它到底比同行强在哪

朝着机器导盲犬这个方向去探索, 并非是头一回有人尝试了, 然而先前那些所作的方案, 或多或少都带有那么一些“局限于实验室环境的感觉”。

部分只能于户外行走, 依靠GPS定位, 一旦进入室内便不知所措;部分必须预先营造环境的3D地图 , 又或者先让人遥控走过一遍路线, 而后交付机器人重现路线;另外部分将感知与规划的计算交由外接的笔记本电脑, 严格来讲不算是“自主”了。

更为关键的一点在于, 以往的系统多数是将机器人当作一个单独的个体, 进而在开展路径规划。

不过导盲这一行为, 从本质上来说, 那是需要协作的, 在实际所处场景当中, 人提出上层的意图, 像是要往哪个方向去走, 行走的速度是怎样的, 下个路口要不要转弯之类的, 而狗负责局部区域的路径跟随以及避开障碍物。要是机器人仅仅只顾着自己能够钻过去, 那其规划出来的路线, 对于旁边的那个人而言, 极有可能会成为一场灾难, 这是由于人在身材方面比机器人要宽, 比机器人要高,并且还可能会出现被拖着走的情况。

Milo做到了这些事, 它在室内外都适用, 不需要已知环境, 具备全机载计算能力, 能接受使用者指令, 可显式建模使用者的动态位置, 并且还是开源的。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图3)

02.

一根手柄,让机器狗知道"人在哪"

宇树Go2 Air/Pro是Milo的硬件基座, 选它的理由很朴素, 它便宜, 自带前视相机, 自带激光雷达,且它买得到。

然而, Go2原厂不存在具备可运行机器学习推理的算力, 团队为其增添了一块Orin Nano, 于价格、体积以及性能之间达成了一种平衡。经过实际测试得出, 这块板子能够以5Hz的频率跑完一整条流水线, 即体素建图、分割网络、目标检测网络, 再加上基于CNN的导航策略。

真正有意思的是牵引部分。

通常情况下, 被握于左手的是导盲犬, 而右手则得留给白手杖, 不过存在左撇子会将此情况反过来。并且, 在窄路上的时候, 有时机器狗需要临时走到人的前方以进行避让, 这就意味着, 人和机器人的相对位置是能够发生变化的。

所以, 团队并未采用刚性的挽具, 而是制作了一根可伸缩的手柄, 该手柄通过一个3D打印的两自由度关节连接至狗的身上。关节内部安装了磁编码器, 其能够实时测量手柄的方位角以及和俯仰角, 再结合手柄的长度, 便能够反解出使用者相对于机器狗的三维位置。

手柄的末端之处, 存在着一个五向的方向键, 其中间的按键具备暂停或者继续的功能, 向前和向后能够对期望的步速予以调整, 向左以及向右则意味着“下个路口我考虑拐弯”。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图4)

03.

不看地图,全靠现场看

Milo没有选取那种从头到尾完全封闭不透明的导航策略, 而是先将世界压缩成为一张能让人类看得清的俯瞰视角图像(BEV), 之后再把它提供给策略网络。

这种做法所具备的好处在于, 它相较于稠密3D地图在内存占用方面更为节省, 并且, 这一幅地图在本质上便适宜于衔接向下的无障碍功能, 像关于前方两米处10点钟方向存在障碍物的语音播报之类的功能。

具体怎么建这张图?

相机获取到分辨率为1280×720的RGB图像之后, 首先进行去畸变矫正操作, 随后分成两条路径。其一, 将图像传递给采用基于蒸馏、着眼于优化版本的方式, 对可通行区域进行分割的部分, 并且把提示點放置于画面下方位置的中央之处, 此处置是基于默认机器人从起始时刻便站立于道路之上, 且朝着道路的方向。其二, 把图像交给用于目标以及行人检测的YOLO部分(进行相关处理)。

把行人特别单独拿出来予以处理, 不与普通障碍物杂乱混淆一同看待, 如此这般才能够生成更为平滑顺畅的交互行为。为了能够让处于远距离位置的行人也可以被及时精准定位, 那团队还采用使用了 Depth V2 来开展做单目深度估计这项工作, 并且还运用利用激光雷达测量值来进行做标定操作。

此事存在一个工程方面的细节是值得被提及的, 那就是, 原始的深度模型在运行的时候, 其速度在数值上仅仅能够达到2.64 FPS, 随后, 团队选择采用优化流水线的操作方式, 结果呢, 推理的速度提升到了24.02 FPS, 并且, 精度在这个过程中基本上没有出现下降的情况。

在激光雷达之处, 系统于实时之际实现对机器人自身所带建图成果的读取, 进而开展运动补偿工作, 之后将其存储成为具备 10 厘米分辨率的体素地图。那些低于某个特定高度的体素会被过滤掉(此为去掉地面之举, 与此同时对于不平整的地形维持鲁棒性), 而高于某个特定高度的同样会被舍弃(诸如天花板、树冠这类情况反正能够从其下方通行过去)。

最终, 被分割出来的能够通行的路面, 检测到的物体与行人, 机器人自身所处的状态, 以及依据磁编码器计算得出的使用者位置, 全被融合到这张BEV图之中。使用者于图之上被绘制成为一个圆形, 这便是策略“看得见”人的途径。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图5)

04.

10分钟练出来的策略,和一个"兜底"的安全阀

策略训练在仿真里完成。

团队写了一个BEV仿真器, 它能通过GPU加速, 可生成由随机直线与贝塞尔曲线构成的道路, 这些道路可依丁子口、十字路口构型旋转拼接, 其宽度范围按当地实施的民法典所确定的人行道宽度标准进行采样, 墙壁由随机采样后的道路轮廓形成, 因而现没墙、仅一侧有墙、两侧全有墙的情形, 障碍物是随机旋转的方块, 行人是沿着有固定偏移且具备随机速度的路径移动的圆。

存在这样一个十分巧妙的细节, 那就是, 仿真器会于路面图之上叠加二维柏林噪声, 通过这种方式人为制造出呈现“缺一块”状态的路面, 而这样做的目的是用来模拟在真实世界当中并不完美的分割结果。

对于一块2018年的Titan RTX而言, 此环境能够并行64份, 其中每份大约是40帧/秒, 总体的吞吐约有2560帧/秒。与之形成对比的那方面, 论文当中提到先前类似工作的策略训练大概要30小时, 而Milo的策略大概仅需10分钟便能够训练出来。

其观测呈现为尺寸是200×200的BEV图像, 此图像叠加了前两帧, 二者共同构成9通道的图像;它的动作涵盖前进速度、横向速度以及偏航角速度;其奖励函数总共包含14项内容, 这些内容有由于“狗/人”与“越界/撞墙/撞障碍/撞行人”组合而产生的八项碰撞惩罚, 还有前向速度跟踪、横移与偏航抑制所带来的效果, 另外有动作抖动惩罚出现, 以及围绕机器人和使用者中点位置的内侧与外侧两圈安全区域产生的奖励表现, 其中内圈半径为0.6米, 外圈半径为1.2米。这两个半径属调试而得: 半径小, 策略会变得激进进而产生危险状况;半径大了, 又将会呈现出“神经质”的状态。

算法用的是GPU优化的PPO,仿真训完零样本部署到真机。

真机之上, 运行着五个线程, 其频率各不相同。这五个线程分别是, 激光雷达体素建图线程, 频率为5Hz;里程计和磁编码器读数线程,频率是18Hz;相机分割检测线程, 频率为4Hz;策略推理线程, 该线程频率为4Hz且被相机线程卡住;控制线程, 频率为10Hz并且在等待新指令时分重复上一条。

另外, 存在着一层局部避障安全滤波器, 它直接读取原始的点云和位姿, 在指令发送给机器人之前进行最后的拦截, 当靠近正前方的障碍时, 会逐步地降低前进的速度, 直至到达临界距离后直接归为零, 朝着障碍方向的横移会先被屏蔽掉, 要是已经过于接近, 还会反向给予一点横向速度进而把机器人推开。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图6)

05.

实测:机器可能会蹭墙,但人不会

在真实的室内外场景当中, 团队进行了对比, 基线是一个好似经典方案的控制器, 此控制器会把分割出的可通行区域投影到地面, 进而生成极左、左、直行、右、极右五条贝塞尔曲线候选轨迹, 然后按可通行长度打分再选出较低代价轨迹中的那条 标点符号用错的地方我及时纠正了哦。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图7)

第一项测试是进行循迹, 场地是位于公园里的一座呈现S形的木桥, 不存在墙, 完全依靠路面来进行分割, 起点的朝向被特意设置成了“至少要拐两次弯”。

成果呈现: 平均用时是二十一·三秒(正负一秒);该策略于最高速度时用时十三·七秒, 处于最低速度时用时二十二·三秒。然而更为关键的要点在于安全性一方面——其每一趟运行时, 使用的人均都撞到了桥的边缘地方所在之处所处位点, 而且有着好几米的长度所延伸扩展拓展的距离范围都是行走在对于人而言不具备安全属性性质特征特性的路线途中位置上;策略处却相应的属于只有零用户进行碰撞的情况形势状况态势, 仅仅是在高速档位的条件情形状况态势下出现了两次机器人自身产生的碰撞情况形势状况态势。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图8)

第二项需进行静态障碍的时候要绕行, 场地存在一个对于“人狗组合”表现而言相对较为紧凑些的转弯情况, 要绕过一个垃圾桶, 还要绕过一个花坛, 地上绘制了两圈舒适区标线, 其分别为0.25米标明有危险, 还有0.5米。

结果是, 策略里, 一个时间为11.7秒, 存在正负2秒的波动范围, 另一个时间是10.5秒, 正负波动范围为1秒, 二者时间大致相近。然而, 三次运行全都致使使用者与垃圾桶产生了硬碰撞, 其中, 在2/3的运行里, 机器人自身也压入到了0.25米线以内。策略这一方面, 使用者的轨迹并未出现任何危险情况, 不过, 在所有回合当中, 机器人自身都是贴着第二个障碍物行进的, 并且,在2/3的运行过程中发生了触碰。

这个结果表现出了策略的取向, 相当一致地展现了这样的情况, 它优先保护人, 却使得自己更容易蹭到东西了, 代价是如此。

第三项本来的计划是, 让两名协作者在走廊里, 以固定的步速, 迎面走来, 是要行人为之避让的, 然而团队却发现, 这个设置在多次实验之间, 可重复性实在很差, 因此仅仅给出了定性的结论来 , Milo是能够比较好地避开迎面走来的行人的, 可是对于从后方超车的行人, 应对起来却颇为吃力——当超车的人第一次进入视野之际, 机器狗有时会出现横向躲闪的动作, 一直到对方走出去一米以上才会恢复。团队觉得, 这能够借助在1米半径内突然出现行人时, 调制横向跟偏航响应来加以解决。

06.

它还有几件事干不了

当然,它还有一些事情干不了。

有一条很有意思的是, 提示点被固定于画面下方中央处, 所以在开机之际, 必须要让机器狗站立于路上, 且朝着路的方向才行。倘若在正对一堵墙的情况下启动它 的话, 它会把墙分割成“地面”。团队尝试过采用替代方式, 后者并不依靠朝向假设, 就算对着墙也能够找出画面里的那一小块地板, 然而其代价 是在室内室外需要切换两套模型, 况且在遇到积雪的人行道、瓷砖广场、公园小径这些分布外场景的时候, 表现力会显著下滑。经过权衡之后, 他们最终还是做了选择, 毕竟“别对着墙开机”这样的一个约束, 实在是很容易就能满足的 就选了它。

5万美元的导盲犬,要被2000美元的开源机器狗顶替了?(图9)

别的那些坑同样是明显在眼前呈现着: 如果地面投影假设地形乃平整情形, 那么那些坡道以及斜面就尚未进行处理;只要行走速度太快一点, 那么关于激光雷达进行建图会演化成为一种瓶颈状况;一旦人数稍多一些, 机器狗表现得就会过度保守(然而实际的状况是路人常常由于内心好奇而主动朝着上面凑过来);并且它当前仅仅能够行走在人行道以及室内的地界上, 至今是没办法真正通过马路的——假如要达成那样的一步, 还必须要补充上人行横道、红绿灯以及开展车辆检测。

也就是说, 当下Milo所能够做的, 乃是导盲犬“基础范畴”之中的那一类工作: 跟随道路前进, 绕过障碍物前行, 避开行人走动, 守护住身旁之人。其余的事务, 团队则将其传递给了社区。

从机器人硬件搭建方式、到仿真环境、策略训练代码、机载感知栈、再到训练好的导航策略, 均为开源状态。感兴趣的朋友可前往详细了解。

项目主页:

演示视频:

标签: 导盲犬   机器导盲犬   Milo   开源   避障