众力资讯网

[CV]《RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning》H Qian, Y Chen, Y Xie, K Ren… [Rice University] (2026) 在机器人灵巧操作领域,从海量网络视频中有效检索可用的演示是一个悬而未决的难题。过去的方法受困于依赖视觉或语 ​

[CV]《RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning》H Qian, Y Chen, Y Xie, K Ren… [Rice University] (2026)

在机器人灵巧操作领域,从海量网络视频中有效检索可用的演示是一个悬而未决的难题。过去的方法受困于依赖视觉或语义相似性,本质原因是外观相似的场景可能包含完全不同的手部动作,导致检索到的数据对机器人学习无效。

本文的核心洞见是:把手部操作重新看作以演示者为中心的3D运动轨迹,而非相机视角下的像素变化。由此,模型仅从手部轨迹反推出一个稳定的躯干坐标系,并将所有动作归一化到该坐标系下进行标准化比较,这一关键操作使问题得以解开。

这项工作真正留下的遗产是,一个不依赖视觉外观、仅根据底层3D手部运动学来索引海量网络视频的引擎。它为后来者打开的新门是,让机器人能从持续增长的互联网内容中自动挖掘学习素材,但尚未跨过的门槛是如何处理移动相机下的演示。

arxiv.org/abs/2609.03199 机器学习 人工智能 论文 AI创造营