近日,计算机(网安)学院高联丽教授团队在机器人学习与具身智能领域取得新进展。研究成果《Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation》(《仿真与人类数据协同训练:面向数据高效和可泛化机器人操作》)被机器人学习领域国际顶级会议 Conference on Robot Learning(CoRL)接收。
该工作提出 SimHum 仿真与人类数据协同训练框架,揭示仿真数据与人类数据在机器人操作学习中的互补机制,为低成本获取大规模训练数据、提升机器人真实场景泛化能力提供了新的研究路径。论文第一作者为计算机(网安)学院高联丽教授团队成员方恺鹏,通讯作者为高联丽教授,电子科技大学计算机科学与工程学院(网络空间安全学院)为论文署名单位。此外,该团队与北京智源人工智能研究院等多家单位联合开发的高质量双臂机器人真机数据集RoboCoin,发布一年以内下载量突破4千万。
机器人操作研究长期面临数据采集成本高、规模有限以及真实场景泛化能力不足等问题。仿真数据能够低成本、大规模生成,并提供与机器人形态相匹配的动作信息,但仿真视觉与真实环境之间存在差异(图1a);人类数据能够反映真实世界的视觉特征,却受到人类与机器人身体形态和运动方式不同的限制(图1b)。针对上述问题,研究团队提出 SimHum 仿真与人类数据协同训练框架,利用两类数据的互补优势:从仿真数据中提取机器人运动学先验,从人类数据中学习真实世界视觉先验,并通过协同训练将两类先验结合起来(图1c)。
图1.SimHum框架核心思想示意图
SimHum采用模块化策略架构。预训练阶段,模型同时利用仿真机器人数据和真实世界人类演示数据,学习跨具身形态的操作语义;在真实机器人微调阶段,保留真实世界视觉适配模块和机器人动作模块,实现视觉先验与运动学先验的选择性重组(图2)。该设计减少了对复杂跨域对齐操作的依赖,为异构数据的统一利用提供了简洁路径。
图2.SimHum模型架构及训练流程
研究团队在多种双臂机器人操作任务上开展实验,涵盖物体叠放、按钮点击、抽屉操作和双臂同步抓取等典型场景,并评估模型在训练分布内场景和未见物体、复杂背景及极端干扰条件下的表现。在仅使用80条真实机器人数据进行微调的条件下,SimHum在分布内和分布外场景都表现出更稳定的优势, 其中分布外场景取得62.5%的任务成功率,相较于仅使用真实数据的基线方法提升约7.1倍(图3)。说明仿真数据与人类数据能够形成有效互补,帮助机器人在不同环境中完成操作。
图3.SimHum 在真机任务上取得最好的表现
数据效率实验进一步表明,在相同的数据采集时间预算下,SimHum始终优于仅使用真实机器人数据的方法,且时间预算越充足,优势越明显。在只增加少量真实演示数据时,SimHum的任务进展也能快速提升(图4a);扩大仿真或人类预训练数据规模还能持续带来性能增长(图4bc)。这意味着研究者可以用更少的真实机器人数据,获得更好的操作效果和泛化能力。
图4.不同数据采集预算下的性能对比
该成果为低成本构建可泛化机器人策略提供了新的技术路径。研究团队将进一步探索 SimHum 在灵巧操作、长时序任务和视觉语言条件控制等场景中的应用,推动机器人从有限示范学习走向更加高效、稳定和可泛化的自主操作。
Conference on Robot Learning(CoRL)是机器人学与机器学习交叉领域的重要国际学术会议,自2017年创办以来,持续关注机器人感知、控制、模仿学习、强化学习以及机器人基础模型等方向,推动机器人学习理论、方法与实际应用的发展。CoRL采用严格的同行评审和单轨交流形式,汇聚全球高校、科研机构和产业界研究人员,已成为机器人学习领域展示前沿成果、交流重要进展的重要学术平台。