如果说大语言模型主要从互联网文本中学习,那么具身智能模型还必须学习另一件事:如何在物理世界中观察、行动,并根据结果修正动作。
这类数据比文本数据难采集得多。它不仅要记录“看到了什么”,还要尽可能对齐动作、手部或机械臂位姿、环境变化、接触结果和任务是否成功。于是,具身智能的数据采集逐渐形成了几条不同路线:机器人遥操作、仿真与合成数据、UMI 手持式操作接口,以及 Ego 第一视角人类数据。
一、具身智能为什么特别需要数据
语言模型可以从网页、书籍和代码中获得大量“输入—输出”关系。机器人面对的则是连续的物理过程:相机看到一个杯子,机械臂需要决定从哪里接近、以什么姿态抓取、施加多大的力,以及抓取失败后如何重新规划。
因此,一条有用的机器人轨迹通常至少包含以下信息:
- 观测:相机图像、深度、声音或其他传感器信号;
- 动作:末端位姿、关节角、夹爪开合或灵巧手指关节动作;
- 状态:机器人本体状态、物体位置和场景变化;
- 结果:任务是否完成、是否发生碰撞、是否需要重试;
- 上下文:自然语言指令、任务阶段和长时序关系。
机器人数据的难点不只是“数量不够”,还在于动作必须和具体的身体结构、传感器视角及控制接口对应。数据越贴近真实交互,通常越有价值,但采集成本也越高;数据越容易规模化,通常越需要额外的对齐、过滤和 sim-to-real 校准。
二、四类数据采集方式对比
| 方式 | 采集对象 | 主要优势 | 主要短板 | 更适合的训练阶段 |
|---|---|---|---|---|
| 遥操作 | 真实机器人轨迹 | 物理真实性高,动作标签直接 | 设备、场地和人工成本高 | 真机后训练、失败修正 |
| 仿真与合成 | 虚拟环境中的轨迹 | 安全、可重复、易扩展 | 存在 sim-to-real gap | 预训练、长尾场景扩展 |
| UMI | 手持夹爪与真实物体交互 | 轻量、可移动、兼顾真实接触 | 受夹爪形态和接口限制 | 通用技能和中期对齐 |
| Ego | 人类第一视角视频与手部动作 | 规模大、场景自然、适合长时序 | 人机形态差异和动作映射困难 | 预训练、语义与技能学习 |
这四种路线不是互相替代的关系。它们分别在物理真实性、采集规模、动作可迁移性和数据成本上做不同取舍。
三、遥操作:最直接的真实机器人数据
1. 基本流程
遥操作是最容易理解的一种方式:人不直接触碰任务物体,而是通过主控设备控制机器人完成任务,同时记录机器人的视觉观测和动作轨迹。主控设备可以是主从机械臂、VR 控制器、动作捕捉系统、力反馈设备或更简单的空间鼠标。
一条典型流程是:
- 操作者观察机器人摄像头传回的画面;
- 通过主控设备输入末端位姿、关节或夹爪动作;
- 机器人在真实环境中执行动作;
- 系统同步保存观测、动作、机器人状态和任务结果;
- 对轨迹进行分段、去重、质量检查,再用于模仿学习或策略后训练。
2. 优势:物理交互是真实的
遥操作记录的是机器人本体实际执行的动作,所以摩擦、遮挡、物体柔性、接触变化、相机噪声和执行延迟都会自然出现在数据里。这些因素很难通过简单的规则或渲染完全复现。
对于需要精确接触的任务,例如插拔、擦拭、折叠、开关旋钮和双臂协同,真实机器人轨迹仍然是很重要的监督来源。它还可以记录失败样本,为后续的失败恢复和真机强化学习提供基础。
3. 短板:高成本和低吞吐
遥操作的问题也很明显:
- 需要真实机器人、工作空间、传感器和安全保护;
- 操作员需要训练,长时间采集容易疲劳;
- 更换机器人形态、末端执行器或相机视角后,数据往往不能直接复用;
- 复杂任务的有效轨迹比例低,失败、暂停和无效动作需要额外清洗;
- 想要扩大规模,通常意味着部署更多设备和数据采集场地。
因此,遥操作更像是高价值的“真机校准数据”,而不是唯一的数据来源。
四、仿真与合成:用规模换取覆盖范围
1. 从虚拟环境生成轨迹
仿真数据把机器人、物体和任务放进虚拟环境中。最常见的方式是先用人工示范或规划器提供少量轨迹,再在不同的环境、光照、物体材质、初始位置和任务条件下批量生成变体。
一个简化的仿真数据流水线可以写成:
少量示范或任务规划
↓
虚拟机器人与场景执行
↓
随机化物体、光照、材质和初始状态
↓
自动记录图像、状态、动作和成功标签
↓
筛选轨迹并与少量真机数据混合训练
2. 优势:便宜、安全、可控
在仿真中,机器人不会撞坏设备,也不会因为物体摔落而产生安全问题。采集速度、场景数量和任务变体都更容易扩展,还可以针对真实数据中很少见的失败状态进行定向生成。
仿真还有一个重要优点:标签几乎可以自动获得。物体位姿、碰撞状态、深度、分割掩码和任务完成条件都能由环境直接提供,减少了人工标注成本。
3. 短板:sim-to-real gap
仿真世界再精细,也可能和现实存在差异。最难模拟的往往不是物体的外观,而是接触过程:布料的形变、软物体的压缩、摩擦系数、液体流动、夹爪打滑,以及动作延迟和传感器噪声。
如果模型只在理想仿真中训练,部署到真实机器人后可能出现以下问题:
- 视觉上识别正确,但抓取点不准确;
- 轨迹在仿真中稳定,在现实中因摩擦变化而失败;
- 模型没有见过真实相机的曝光、运动模糊和遮挡;
- 控制频率、动作延迟和机器人动力学与仿真不一致。
所以,仿真数据通常需要和真实数据混合使用。世界模型和更逼真的视频生成模型可以帮助扩大场景分布,但它们仍然需要通过真机评估验证动作是否真的可执行。
五、UMI:不搬运整台机器人,也能采集真实动作
1. UMI 是什么
UMI 的全称是 Universal Manipulation Interface,可译为“通用操作接口”。它的核心思路是:采集数据时不必让人操控一整台机器人,而是让人直接手持一个带传感器的夹爪或操作器,与真实物体进行交互,再把记录下来的动作迁移到机器人上。
原始 UMI 工作使用手持平行夹爪和腕部相机记录视觉与动作信息,并通过相对轨迹等表示方式,将人类示范迁移到不同机器人平台。项目页面展示了动态抛掷、双臂叠衣、洗盘子等任务,也强调了它对真实环境和多种机器人平台的适配能力。
2. 它如何把人的动作映射给机器人
可以把 UMI 理解成一个“人—接口—机器人”的中间层:
- 人手持夹爪完成抓取、移动、旋转和释放;
- 腕部相机记录与动作相关的视觉上下文;
- 追踪系统估计夹爪的空间位姿、夹爪开合和相对运动;
- 数据处理模块检查轨迹是否满足目标机器人的运动学约束;
- 训练得到的策略在机器人端根据相同的动作表示输出控制指令。
与完整机器人遥操作相比,采集者不需要一直围绕某一台机器人工作;与普通人类视频相比,UMI 又保留了更明确的末端执行器状态和真实接触信息。
3. 优势:便携、真实、相对跨平台
UMI 的价值主要体现在三个方面:
- 采集设备轻量:不需要在每个采集点部署完整机器人;
- 物理交互真实:手持夹爪确实接触了杯子、衣物、海绵等物体;
- 动作表示更容易迁移:通过末端位姿和相对轨迹,可以把示范用于不同机械臂。
UMI 官方页面给出了一个具体对比:在杯子摆放任务中,UMI 夹爪的示范采集速度为每小时 111 条,空间鼠标遥操作为每小时 35 条。这个数字是特定任务、设备和实验流程下的结果,更适合作为“轻量接口可能提升吞吐”的示例,而不是对所有任务的统一结论。
4. 短板:接口仍然会限定动作空间
UMI 并没有消除所有的人机差异。常见限制包括:
- 许多实现以平行夹爪为主,无法完整表达五指灵巧手的手指协同;
- 手持设备的尺寸、视角和可观测范围会影响数据质量;
- 轨迹仍然需要做运动学检查、同步和异常过滤;
- 真实接触虽然被保留,但夹爪和目标机器人之间仍可能存在动力学差异。
因此,UMI 更适合被看作一个低成本的真实动作接口,而不是“无需对齐就能适配所有机器人”的万能方案。
六、Ego:让人类第一视角成为可扩展的数据源
1. Ego 数据采集什么
Ego 是 egocentric 的缩写,通常指从人的第一视角记录的数据。采集者可以佩戴头戴式相机、AR 眼镜或其他可穿戴设备,在日常环境中直接完成任务。系统记录的是人看到的画面,以及从视频中估计出来的手部、手腕或身体运动。
它和 UMI 的关键区别是:Ego 数据不要求采集者手持机器人夹爪。采集者使用自己的手完成任务,因此设备成本低、动作自然,也更容易进入家庭、商店、维修间等真实场景。
2. 从视频到机器人动作,需要经过哪些步骤
一段第一视角视频不能直接等同于机器人动作,通常还要经过一条处理链路:
- 采集第一视角视频和同步传感器数据;
- 估计相机运动、手腕位姿和手部关键点;
- 找到有效操作片段,去掉走动、停顿和与任务无关的画面;
- 将人手动作重定向到目标机器人或夹爪的动作空间;
- 用少量真实机器人数据校准视角、动力学和控制接口;
- 将第一视角数据与机器人轨迹共同用于视觉—语言—动作(VLA)模型或模仿学习训练。
这里的难点在于“看见动作”和“能够执行动作”并不是一回事。视频可以告诉模型人手向哪里移动,却未必能直接提供接触力、夹爪受力、物体是否打滑等机器人控制所需要的信息。
3. EgoMimic:把人类和机器人示范放到同一套训练框架
EgoMimic 提出了一套从第一视角人类视频扩展模仿学习的完整框架。它使用 Project Aria 眼镜采集人类具身数据,通过 3D 手部追踪得到更明确的动作线索,再配合低成本双臂机器人和跨域对齐方法,让人类数据与机器人数据共同训练一个策略。
EgoMimic 的重点不是把视频当作普通的动作分类数据,而是把人类和机器人都视为“具身示范”。论文还报告,在其任务设置中,增加人类手部数据带来的扩展效果优于简单增加等时长的机器人数据。这说明第一视角数据有机会承担大规模预训练的角色,但仍需要机器人数据把表征锚定到可执行的控制空间。
4. EgoScale:规模化第一视角数据与少量机器人数据结合
EgoScale 进一步研究了大规模第一视角人类数据对灵巧操作的帮助。论文使用超过 20,854 小时的带动作标签的第一视角人类视频训练 VLA 模型,并采用“人类预训练—人机对齐中期训练—任务后训练”的三阶段方案。
其中,人类预训练负责提供丰富的任务、物体和环境分布;中期训练使用约 50 小时人类数据和约 4 小时机器人数据,把表征对齐到机器人的观测与控制接口;最后再用任务相关的机器人示范做后训练。论文在 22 自由度灵巧手的实验中报告,最终策略相对于无预训练基线的平均成功率提升了 54%。这些结果说明:规模化的人类数据可以负责“学会很多”,少量高质量机器人数据则负责“把学会的东西落到机器人身上”。
需要注意的是,Ego 数据的规模优势并不等于它可以完全替代真机数据。手部姿态估计会有噪声,第一视角视频中也可能存在遮挡、无效片段和动作歧义;想让模型真正控制机器人,还需要动作重定向、跨视角对齐和真实执行验证。
七、这四类数据应该如何组合
更现实的方案不是在四种路线中选出唯一胜者,而是按训练阶段分工:
1. 预训练:优先追求覆盖范围
第一视角人类数据和仿真数据更容易扩展任务、物体、场景和动作分布,适合学习通用视觉表征、语言条件和长时序技能。这个阶段的目标是让模型先“见得多、理解广”。
2. 中期对齐:把抽象技能接到机器人接口
UMI 或带有同步人类—机器人示范的数据,可以提供更清晰的末端动作和视角对应关系。它们的作用是缩小人类动作、接口动作和机器人控制之间的差距。
3. 后训练:用真机数据解决最后一公里
特定任务的遥操作数据仍然不可替代。它可以暴露真实摩擦、延迟、遮挡和失败恢复问题,让策略适应目标机器人、末端执行器和工作空间。
可以用下面的原则理解四者的关系:
- 仿真负责扩展状态空间和长尾场景;
- Ego负责扩展人类行为、自然环境和长时序上下文;
- UMI负责以较低成本采集真实物理交互;
- 遥操作负责把策略校准到具体机器人和真实任务。
八、未来:第三视角视频会成为新的数据来源吗
第一视角数据很有价值,但它毕竟需要重新组织和采集。互联网上已经存在大量第三视角视频,例如教程、纪录片、家庭操作视频和工作流程视频。它们通常缺少机器人动作标签,却包含丰富的任务步骤、物体关系和场景变化。
因此,一个值得关注的方向是:能否从第三视角视频中抽取任务结构,再通过手部重建、动作重定向、视频生成或世界模型,把它转化为可用于机器人学习的监督信号。近期的 Ego2Robot 已经开始探索将第一视角人类视频转换为机器人训练数据,说明“视频规模”与“机器人可执行性”正在被拆成两个可以分别解决的问题。
不过,第三视角视频更适合作为语义、流程和场景分布的补充来源。它可能看不清手指细节,也往往无法直接提供接触力和精确末端位姿。因此,短期内更可能出现的是多源数据融合,而不是某一种数据完全取代其他来源。
总结
具身智能的数据采集大致经历了从“让机器人自己动起来”,到“让人通过接口教机器人”,再到“把人类在现实世界中的行为规模化利用”的变化:
- 遥操作提供最直接的真实机器人轨迹,但成本高、扩展慢;
- 仿真数据可以低成本覆盖大量场景,但必须面对 sim-to-real gap;
- UMI用轻量手持设备保留真实物理交互,缩短了采集与迁移的距离;
- Ego 数据把人类第一视角行为变成可规模化的数据源,但需要动作估计和人机对齐;
- 未来的主流形态更可能是混合数据闭环:大规模数据负责预训练,少量对齐数据负责迁移,真机数据负责验证和后训练。
具身智能真正缺的并不只是“更多视频”,而是能和动作、身体、环境以及任务结果对应起来的数据。数据采集技术的演变,本质上是在不断寻找更好的平衡:既保留物理世界的真实性,又让数据具备足够的规模和可迁移性。
参考资料
- DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset
- RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
- UMI 项目主页与数据采集对比
- EgoMimic: Scaling Imitation Learning via Egocentric Video
- EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data
- EgoScale 项目主页(NVIDIA GEAR)
- Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data