教机器人干活,一直以来都是个“烧钱又费时”的苦差事。传统做法是让机械臂一遍遍去试,哪里抓不稳、哪里放不准,科研人员再手动接管纠正。想多找几个人同时教,就得准备多台昂贵的机械臂和专门的场地,人还得全程守在旁边盯着。
就在最近,这种“围着铁疙瘩转”的训练方式被打破了。董豪团队联合启元机器人、北京大学、西安交通大学等机构,提出了一项名为HIL-UMI的新技术。简单来说,哪怕机械臂全程不通电、不动弹,人类也能精准找出机器人的知识盲区,直接给它“补课”。
给机器人请一位“虚拟家教”
这套新办法是怎么操作的?想象一下,你手里拿着一把特制的轻便夹爪,在桌上演示怎么把玩具收进抽屉。你夹得稳稳的,放得准准的。与此同时,电脑里的机器人模型也在“看”你的动作,并且同步预测:“如果是我,我会这么夹、这么放。”
手持夹爪与采集设备(受访者供图)
系统会把你的实际操作和模型的预测放在一起比较。一旦发现两者差别很大——比如你调整了夹爪角度才夹稳,模型却直愣愣地冲过去——系统就会提示:“这个地方我不懂,能再教一遍吗?”
你只需要从当前状态继续录一段,不用每次都从头演示整个任务。这样,模型就能精准知道自己哪里薄弱,缺什么补什么。
整个过程,机械臂完全不用出场。你手里那把夹爪,就是一套轻便的采集设备,能记录画面、位置、角度和开合数据。一个人、一张桌子、一台电脑,就能完成以前需要整套机器人设备才能干的活。
让机器人知道怎么做更有效
还有一个问题:人演示的时候,有些动作是有效的,有些只是来回晃悠。比如叠方块,夹着方块对准下方是推进任务,拿着方块在空中转圈就不是。
HIL-UMI里有个叫“优势估计器”的小模块,专门判断这段动作对完成任务有多大帮助。它看操作前后的画面变化,给出评分。如果人明明做对了,它却打低分,系统也会把这段示范收进去,帮它修正判断。
这样一来,机器人学到的不只是“怎么做”,还有“怎么做更有效”。
三轮“补课”,提分效果惊人
团队在真实机械臂上测试了四项任务:整理桌面(开抽屉、分颜色放笔、收玩具)、折毛巾、叠方块、盖章。按完成步骤打分,满分100。
四项真实机器人任务。上两行依次为折毛巾和整理桌面,下方为叠方块与盖章(受访者供图)
同样多的数据,传统方法三轮训练后平均得分58分;HIL-UMI去掉“优势估计器”的版本拿到88分;完整版本直接从62.3分飙升到94.8分。第三轮结束后,叠方块和盖章两项都拿了满分,整理桌面也达到96分。
更关键的是效率。在整理桌面任务上,HIL-UMI的数据采集速度是传统方法的5.63倍——单位时间内能获得更多训练数据,最终得分还更高(96分vs91分)。
人人都能当“机器人老师”
这项技术带来的最大变化,是把机器人训练从“围着机械臂转”变成了“围着人转”。模型在采集阶段就参与决定该学什么,反馈通过预测获得,不需要机器人实际运行。
团队下一步计划探索分布式训练:不同城市的人,各自用手持设备采集数据,汇入同一个模型。每个采集点都不需要配机械臂,普通人也能参与机器人的成长过程。
也许不久的将来,你在家随手教几遍,就能帮远方的机器人学会一项新技能。那时候,每个人都可以是机器人的辅导老师。
