Ego2Robot:基于以自我为中心的人类数据的可扩展机器人数据合成

发布时间:2026/9/3 7:01:26
Ego2Robot:基于以自我为中心的人类数据的可扩展机器人数据合成 26年8月来自人民大学、阿里千问、上海科技大学、北京BIGAI和北航的论文“Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data”。学习可泛化的机器人操作策略需要大规模且多样化的演示数据。以人类为中心的操作视频提供丰富的场景和任务多样性先前的研究表明将此类视频重定向并渲染成机器人格式的数据可以在小规模下产生有效的单任务策略。然而这种方法能否大规模地为视觉-语言-动作模型提供预训练优势仍有待探索。Ego2Robot这是一个可扩展的流程它通过动作重定向、机器人手臂视觉合成和多级质量管理将以人类为中心的操作视频转换为机器人训练数据。Ego2Robot 同时支持精选数据集和真实场景视频生成 18,561 小时的机器人训练数据涵盖 15 种机器人形态使其成为迄今为止最大的自体到机器人数据集。为了评估泛化能力扩展 RoboTwin2.0使其包含解耦的扰动轴涵盖视觉外观、场景布局、具身形态和任务语义。实验表明在 Ego2Robot 合成数据和机器人数据上进行联合预训练可以持续提高多种扰动类型下的分布外泛化能力并且在真实机器人部署中验证了其优势。Ego2Robot是一个端到端的流程它通过动作对齐、视觉对齐和多级质量管理图1所示将以自我为中心的人类操作数据转换为特定于机器人形态的训练数据。该流程支持带标注的自我数据集和纯自我视频并处理了来自四个不同来源、涵盖15种机器人形态的约1940小时的以自我为中心的视频生成了18561小时的有效机器人训练数据这是迄今为止最大的一个自我到机器人数据集。如图所示15个机器人形态为了评估ego2robot合成的数据是否能提高机器人的泛化能力进一步引入一种基于RoboTwin2.0 [16] 的解耦评估协议。与以往将多个分布偏移聚合为单一分数的评估方法不同协议将扰动从四个维度进行解耦视觉外观、场景布局、形态和任务语义。这可以对结合机器人和ego2robot合成数据的预训练的优势进行精细分析并探究这些优势是源于视觉鲁棒性、具身迁移还是语义泛化。大量实验表明ego2robot合成数据能够持续提升分布外性能并为机器人数据提供补充价值。尤其值得注意的是在视觉、具身和语义扰动下这些优势最为显著这表明大规模ego2robot合成数据主要提升的是不变性和跨分布鲁棒性而不仅仅是增加轨迹覆盖范围。针对以自我为中心的、描绘人类手部操作的视频其流程通过三个阶段生成特定于人体的机器人训练数据动作对齐、视觉对齐和质量筛选图 1所示。动作对齐通过重定向和时间平滑将手部姿态转换为机器人末端执行器轨迹。视觉对齐通过手臂分割、手部移除、使用逆运动学求解进行机器人基础姿态搜索以及深度感知渲染将人类手臂替换为渲染的机器人手臂。质量筛选则在轨迹、帧和片段级别对样本进行过滤。该流程支持两条输入路径路径 A 接受带有现有手部姿态标注的自我数据集而路径 B 处理未标注的视频首先使用 WiLoR [47, 48] 逐帧重建和 DynHaMR [49] 时间优化估计手部姿态。对于较长的视频采用 Qwen3.5 [50] 将连续录像分割成具有自然语言描述的离散子任务。在手部姿态估计之后两条路径共享一个统一的流程该流程并行生成 15 种支持的机器人形态的训练数据。动作对齐动作对齐阶段通过重定向和时间平滑将手部姿态转换为平行夹爪末端执行器的运动轨迹。视觉对齐视觉对齐将自视频从描绘人手转换为显示在同一场景中操作的机械臂。质量控制应用三级质量过滤。L1流水线内部在处理过程中标记存在逆运动学故障、自碰撞、动作异常值或工作空间覆盖不足的帧。L2统计移除具有极端动作值、突然不连续或无效帧比率过高的轨迹。L3VLM 一致性使用视觉-语言模型 [50] 审核合成视频以确保渲染的机器人动作与原始操作意图之间的语义一致性。将该流程应用于四个以自我为中心的数据集ANT7 小时内部的带有手部姿态标注的抓取放置数据集、EgoDex [12]732 小时、ViTRA [29]249 小时和 EgoVerse [13]954 小时总计约 1940 小时的带标注自我数据。由于以自我为中心的手部操作速度远快于机器人远程操作在训练过程中对每个数据集的帧进行下采样以匹配机器人的速度分布ANT 和 EgoDex 的帧率下采样至原始帧率的 60%约慢 1.7 倍EgoVerse 下采样至 45%约慢 2.2 倍ViTRA 下采样至 25%约慢 4 倍。经过对 15 种机器人形态的处理和质量控制后最终得到 18561 小时的合成机器人训练数据。每个样本包含一个机器人合成的视频帧、对应的相机帧末端执行器EEF动作、相机参数以及一段文本指令。由于以自我为中心的视频是在各种未知的相机位置拍摄的因此采用世界坐标系下的动作表示方法需要对每个视频进行校准并且会导致不同来源的动作空间不兼容。相机帧相对的EEF动作表示末端执行器在观察者坐标系中的位移自然地统一了来自不同相机设置和机器人形态的数据。了解哪些泛化维度受益于 ego2robot 合成数据以及哪些维度受限于领域差异需要现有基准测试无法提供的评估粒度。当前协议例如 RoboTwin 2.0 [16]同时应用多个扰动因子生成一个单一的综合 OOD 指标该指标混淆了视觉、空间、具身性和语义变化。扩展 RoboTwin 2.0使其包含 11 个独立的扰动设置和相机帧相对 EEF 支持并补充 EBench [46]。EBench 在 Isaac Sim 中提供 7 个精确的桌面任务其头部摄像头位置更高更接近自我中心视角。该扩展涵盖四个泛化维度如图 2 所示(1) 视觉外观——独立控制背景纹理、光照和机器人颜色。背景和光照与原始捆绑的随机化解耦以便进行单独测试。 对所有机器人连杆应用随机色调偏移测试其对训练期间未见过的外观变化的视觉不变性。2场景布局桌面高度变化±4厘米、干扰物和相机视角偏移±5厘米所有这些都相互独立以便进行独立评估。这些空间扰动旨在探测其对真实部署中常见的物理布局变化的鲁棒性。3机器人形态将默认的Aloha-Agilex替换为UR5-WSG、ARX-X5和Franka Panda进行零样本跨形态评估并通过逆运动学IK对齐初始末端执行器姿态以确保一致的起始条件。这测试相机帧动作表示是否能够在形态不同的机器人之间泛化而无需针对特定形态进行微调。4任务语义使用在任务训练期间未见过的物体实例评估50个任务并使用505条用口语形式重新表述的自然语言指令进行评估。这可以探究模型对新物体外观的泛化能力以及对语言变异的鲁棒性。这种分解方法能够将泛化能力的提升精确地归因于特定的扰动类型。实验设置模型架构。采用基于VLA的架构以Qwen3.5-4B作为视觉语言骨干并使用扩散transformerDiT作为动作头。该模型预测以相机帧为基准的末端执行器表示的32步动作块扩散步骤数为8。训练协议。所有预训练运行均使用相同的超参数8个GPU批大小为12/GPU学习率从1e-5递增至1e-6采用余弦衰减bf16训练步数为20万。由于所有配置均使用相同的批大小训练相同数量的步数因此每种设置处理的训练样本数量相同约1920万帧从而确保了无论数据集大小如何都能进行公平的比较。微调加载预训练权重并使用ColorJitter增强进行5万步训练。预训练数据。比较四种配置i仅机器人数据DROID [7] AgibotWorld [8] InternData [55]约 6,565 小时以及ii-ivEgo2Robot 合成数据简称 Ego2R与机器人数据按 1:3、3:1 和 1:1 的比例混合。微调和评估。所有模型均在 RoboTwin 的 50 个干净设置任务每个任务 50 次演示上进行微调并在每种扰动设置下进行评估每个任务 50 次演示。EBench 模型在其训练集上单独进行微调。对于真实机器人评估在 ARX ACone 平台上测试了 5 个长时域操作任务。真实机器人实验在 ARX ACone 平台上对五项长时程任务图 5所示进行评估将水果放入篮子、将积木放入抽屉、折叠毛巾、将垃圾扫入垃圾桶以及拧入螺丝。对于每项任务收集 20 个远程操作演示。此外还录制以自我为中心的手部操作视频每个场景约 7 分钟并通过Ego2Robot 流程处理这些视频以生成 ACone 特有的合成演示。比较三种配置纯机器人配置使用纯机器人预训练并在远程操作演示上进行微调混合配置使用 Ego2R机器人 (1:1) 预训练并使用相同的演示混合 Ego2R 播放配置在远程操作演示和经流程转换的自我操作 (Ego2R) 数据 1:1 混合的基础上进行微调。