IJCAI 2026 专访:机器人想学会人类动作,还差一座桥 | GAIR Paper 118
重新审视人类视频如何赋能机器人学习 作者丨 邓哲敏 编辑丨 齐铖湧 大模型时代,规模化的数据能带来能力跃迁,这一规律已被反复验证。 当这套范式进入机器人领域,问题变得复杂。机器人需要的不仅是大量数据,而且是能够转化为动作能力的数据。 人类视频近期成为研究者关注的新来源。它规模巨大、获取成本低、覆盖场景丰富,但它毕竟不是机器人数据,视频里没有机器人动作标签,人类手部运动也无法直接对应机器人的控制信号。 问题由此产生: 人类视频进入机器人学习流程后,究竟应该被表示成什么? 过去一年,研究者给出了不同答案:有人把动作压缩到隐空间,有人让模型学习视频背后的世界规律,也有人直接提取二维、三维轨迹。但这些