对机器人来说,学会一个新的操作动作从来不是难点,难点是演示数据从哪来。遥操作真机采一批演示贵到让账本爆炸,而现实任务的长尾永远等不起慢慢采集。莱斯大学 RobotPI Lab 与 NVIDIA 的论文 RoboTok(arXiv 2609.03199)换了个思路:人类早把各种操作上传到视频网站了,缺的只是一个靠谱的「检索器」。

方法:比手部轨迹,不比画面

RoboTok 把互联网操作视频转成 3D 手部轨迹,并表达在估计出的躯干参考系里——手的运动相对人自己的身体描述,相机视角、场景外观、人物遮挡随之被消掉,不同视频里的同类操作变成同一坐标系下可直接比较的向量。训练时用 DTW 度量轨迹相似度监督一个紧凑嵌入空间;查询时只做余弦相似度搜索,不必对全库逐对算 DTW,互联网级持续索引才可行。即使人已出画,模型也能凭两只手的轨迹估计出躯干坐标系。语料 10 万条片段:9 万条训练、1 万条留出做查询。

检索表:0.3531 对 0.0071

自建评测集上,RoboTok 的 mAP@20 为 0.3531,此前最强的 STRAP(ICLR 2025)是 0.0071,差约 50 倍;MRR@20 为 0.8576 对 0.0824。在带传感器级 3D 手部标注的 AssemblyHands 语料(831 条双手装配片段)上做域外测试,mAP@5 为 0.2614,约为 STRAP(0.1330)的两倍。按 DTW 成本看,RoboTok 检索结果 1.333,已接近完美检索的 1.145。

VTDexManip:hard 榜几乎一边倒

下游才是重点。论文报告,RoboTok 检索的演示让策略在 VTDexManip 6 个原始任务中的 5 个、以及 3 个自改 hard 任务(手自由运动、去掉密集奖励)的全部任务上拿到最高成功率。hard 版 Lever Sliding:RoboTok 79.3%,最强基线 HAND(ICRA 2026)19.5%;hard 版 Faucet Screwing:44.8% 对 6.8%。策略输入只有本体感知和指尖力,不靠视觉。

冷水:数字全在仿真里

项目页真机结果一栏写的是 coming soon。mAP 0.35 距上界 1.0 仍远,「远超基线」不等于「够用」。开源仓库 RoboTok-Code(MIT 许可)不含那 10 万条视频库:数据构建代码依赖未随仓库发布的私有片段数据库,MANO/SMPL-H 手部模型需另行注册获取——想复现「互联网级」全链路,先得自攒语料。

所以呢

LLM 时代「嵌入 + 向量检索」这套基础设施,正在平移进具身智能的数据层。当人类视频库本身能当机器人教材,瓶颈便从「采集」转向「检索质量与真机闭环」——这套数字能否在真机上站住,是论文的下一道题。

参考:arXiv:2609.03199 / rice-robotpi-lab.github.io/RoboTok/