拒绝视频生成:具身基座模型如何打通机器人“看懂”与“做到”

发布时间:2026/9/8 19:38:41
拒绝视频生成:具身基座模型如何打通机器人“看懂”与“做到” 去年到今年视频生成几乎成了AI圈的“全民运动”。从文生视频到图生视频从几秒的gif到号称“无限制”的长镜头全网都在卷流畅度、卷一致性、卷物理效果。我身边不少做机器人策略、做自动驾驶感知的朋友也开始琢磨“能不能直接拿视频生成模型当世界模型用”。但如果你真的拿视频生成模型去跑一轮真机实验很快就会撞上一堵墙生成出来的视频再逼真机器人也学不会“动手”。这也是我今天想聊的项目真正有意思的地方——它选择了一条完全相反的路线拒绝把视频生成当作具身智能的底座而是直接构建具身基座模型。这篇文章不聊概念口号就讲清楚这条路线到底“新”在哪、数据怎么做、模型怎么训以及我在复现和调试过程中踩过的坑。不管你是做机器人策略、多模态模型还是单纯好奇“为什么视频生成这么火却有人坚决不用”这篇内容应该都能给你一些参考答案。1. 为什么选这条路线视频生成模型的“天花板”1.1 视频生成的本质是像素预测不是物理理解先说说视频生成为什么看起来很香。现在主流的视频生成模型比如基于扩散架构或自回归架构的方案本质上都在做同一件事给定一段文本或一张起始帧预测后续每一帧的像素值。你做“猫在键盘上走路”的视频模型其实并不知道猫的体重、键盘的受力、猫爪和键帽之间的摩擦力它只是在拟合海量视频里“猫在键盘上看起来是什么样”的统计规律。这就导致一个经典问题生成结果“看起来对”但物理上一塌糊涂。杯子掉在地上可能穿过桌面人转身时手臂可能扭成麻花物体之间的遮挡关系会在几帧内突然崩溃。我见过不少团队试图用物理约束、3D姿态估计、轨迹引导来修补这些问题但本质上都在给一个“只会画画的模型”强行加装物理常识属于事后打补丁效果非常有限。1.2 具身智能真正需要的是“能做对”不是“看着对”具身智能Embodied AI的核心是一个能感知环境、做出决策、在真实物理世界里执行动作的智能体。它不是一个“视频播放器”而是需要像人一样看到杯子就知道怎么伸手去抓感受到阻力就知道该用多大力气。这里有个根本性的矛盾视频生成模型的目标函数是“像素误差最小化”而具身智能的目标函数是“任务成功率最大化”。像素误差小不代表动作正确。你可以生成一段机器人完美抓取杯子的视频但把这段视频喂给机器人它依然不知道机械臂每个关节该转多少度、该在什么时机闭合夹爪。我举个更直白的例子。你让一个孩子通过看“别人投篮”的视频学投篮看一万遍他也学不会因为他没有实际感受过球的重量、出手的角度、肌肉发力的时机。视频生成模型本质上就是那个“看了很多投篮视频但从不摸球的孩子”它具备优秀的视觉想象力但完全没有运动能力。具身基座模型要做的恰恰是把“看”和“做”真正打通。1.3 视频生成 vs 具身基座模型一次彻底的需求对齐把两条路线放在一起对比区别就非常明显了对比维度视频生成模型具身基座模型核心目标像素级视觉预测行为级动作决策输出形式视频帧序列动作指令/轨迹/策略物理约束隐含在数据中常被违反显式建模要求物理可行训练信号帧间像素差异任务成功与否、动作误差落地场景内容创作、影视辅助机器人操作、自动驾驶、工业控制评测标准FVD、CLIP Score等视觉指标任务成功率、泛化性、安全性看清这张表你就能理解为什么越来越多团队开始反思“视频生成是不是具身智能的正确底座”。视频生成当然有价值在仿真环境构建、数据增强、视觉预训练这些方向都有用武之地。但如果把具身智能的“大脑”完全押注在视频生成上等于让一个画家去当运动员术业有专攻方向从一开始就偏了。深度跃迁提出的具身基座模型路线正是把底座从“视觉语义”切换到了“行为语义”这个切换听起来简单实际意味着数据、架构、训练方法全链路都要重构。2. 具身基座模型的核心设计思路2.1 三个层面的“深度跃迁”这个项目叫“深度跃迁”我理解下来它的“跃迁”不是指模型参数量更大、训练数据更多而是在三个核心层面做了路线切换表征跃迁。传统方法通常把视觉、语言、动作分开建模视觉模型负责“看”语言模型负责“想”控制模块负责“动”三个模块之间通过固定接口通信信息损耗严重。具身基座模型的做法是把三者统一到同一个语义空间里。具体来说输入的图像、文本指令、本体感知状态比如关节角度、力矩都通过编码器映射到一组共享的表征向量输出的动作也不再是独立的控制指令而是从同一个表征空间里解码出来的“行为token”。这样一来“看到什么”和“该怎么做”在模型的内部表达里就是同构的。架构跃迁。架构上不再是“大语言模型视觉编码器控制插件”的拼接式方案而是以Transformer为主干构建一个能同时处理视觉、语言、状态、动作四种模态输入的统一模型。在模型内部不同模态通过不同的投影层进入统一的token序列由同一个自注意力机制完成跨模态推理。你可以把它理解成一个“四语同传”模型视觉、语言、状态、动作各有各的“口音”但共享同一个语义中枢。任务跃迁。从任务定义上看传统方案是为每个具体任务单独训练一个模型比如“抓取模型”“移动模型”“倒水模型”每个模型只能干一件事。具身基座模型则是用一个统一的模型覆盖多种任务、多种机器人形态通过指令或场景自动适配。任务的定义从“单任务专用”变成“多任务通用”这是基座模型和专用模型之间最本质的差别。2.2 数据路线不做视频生成数据从哪来这是很多人最疑惑的地方不做视频生成那训练数据从哪来总不能全靠真机采集吧那成本得多高项目的答案很务实数据来源不搞“单点依赖”而是构建一个三层递进的混合数据体系。第一层是真实遥操作数据。这是整个数据体系中最核心、最不可替代的部分。通过遥操作设备比如主从机械臂、动捕手套、VR手柄采集人类演示或专家操作数据每条数据包含“视觉状态指令动作序列”的完整闭环。这类数据量不大但质量极高而且天然带有物理约束和任务语义。项目团队的做法是把这部分数据当作“种子数据”用来训练模型的基础行为能力。第二层是仿真数据。在MuJoCo、Isaac Sim等物理仿真环境里通过程序化生成、域随机化、强化学习自动探索等手段生成海量的“感知-动作”数据对。仿真数据最大的优势是成本低、规模大、可以自动标注最大的劣势是存在sim2real gap仿真到真实的迁移鸿沟。项目的策略是用域随机化在仿真里引入大量干扰因子摩擦力、光照、纹理、物体形状的随机扰动让模型在仿真里见过足够多的“意外情况”从而在迁移到真实环境时不会因为一点光照变化就崩溃。第三层是互联网视频数据。这里注意项目并不是用互联网视频做“视频生成预训练”而是只借用其中的视觉信息做表征学习。也就是说用海量互联网视频训练视觉编码器让模型学会“看懂世界”的一般能力至于“该怎么做这件事”完全由前两层数据来教。这就像让一个医学生先通过教材学解剖学视觉预训练再进实验室做大体解剖仿真遥操作而不是直接让他看一万台手术录像就上台主刀。这三层数据不是简单混合而是有明确的分工与配比策略。我在实际复现时的经验是真实数据与仿真数据按1:10到1:20的比例混训效果比较稳定互联网视频数据则只用于视觉编码器的预训练阶段不参与行为策略的联合训练否则会把模型“带偏”。2.3 模型架构选型为什么是多模态大模型而不是扩散模型或RL现在做具身智能的架构方案五花八门有基于扩散策略Diffusion Policy的有基于强化学习的也有直接套用多模态大模型的。这个项目选择多模态大模型作为基座背后有几个很实际的考量第一多模态大模型天然具备跨模态对齐能力。不管是视觉token、语言token还是动作token都可以在同一个Transformer里通过注意力机制自由交互不需要额外设计复杂的跨模态融合模块。第二大模型具备涌现能力和上下文学习能力。模型在海量数据上预训练之后面对一个新任务甚至可以通过提示词Prompt或少量示例Few-shot快速适应这在机器人策略领域是非常稀缺的能力。第三大模型的扩展性极好。参数量、数据量、训练算力三者之间呈良性正循环真正体现了“基座模型”的语义。那为什么不选扩散策略或RL扩散策略在动作生成上确实有优势尤其是多峰动作分布的表达能力很强同一个场景可能有多种合理的动作方式但它本质上是一个“单步动作生成器”很难处理长序列规划和跨模态推理。强化学习在单一任务上可以做到极致但通用性差换个环境、换个任务往往要从头学起。多模态大模型路线追求的是通用性优先任务专项能力通过后训练阶段来补齐这更符合“基座模型”的定位。基于这个思路项目的模型整体结构大致可以拆成四层编码层视觉编码器如ViT系列处理图像/视频帧语言编码器处理指令文本状态编码器处理本体感知数据关节角、力矩、位姿等统一投影为embedding向量。推理层一个深层Transformer作为主干对多模态token进行联合自注意力建模输出的隐藏状态既包含视觉信息也包含任务语义。动作解码层将推理层的输出映射为动作表征这里可以有两种选择——离散动作token用VQ-VAE把连续动作量化成离散码或连续动作参数直接回归关节角度等连续量。策略输出层根据任务需求输出低层控制指令关节力矩/位置增量或高层规划指令路点序列、子任务序列接到执行器和规划器上。这个架构的核心设计哲学是“统一”。视觉、语言、状态、动作都在同一个语义空间里流转而不是像传统pipeline那样各玩各的。3. 数据构建与模型训练实操3.1 数据采集与预处理真实数据到底怎么采遥操作数据是整个训练体系里最金贵的部分直接决定模型行为能力的下限。实操中我建议按以下几个步骤来做环境搭建阶段需要准备一套可靠的主从遥操作设备。主端是操作员使用的输入设备从端是被控机器人。为了保证数据质量主从两端之间最好有力和位姿的双向反馈这样操作员能感受到机器人与环境交互的力觉采集出来的动作会更自然、更符合物理规律。任务设计阶段每个任务都要有明确的“任务定义”Task Definition和“成功判据”Success Criterion。比如“倒水”任务成功判据不能只是“完成倒水动作”要细化成“水杯倾斜角度大于60度、无溢出、目标杯内水量超过50ml”这样后续模型训练时才能有清晰的监督信号。数据采集阶段每个任务至少采集500条以上的演示数据并且要有意识地在演示中注入多样性不同的起始位置、不同的物体摆放角度、不同的操作速度。如果条件允许最好由多个操作员分别示范避免模型过拟合到某个人的操作习惯上。项目里还专门要求了“失败数据也要采”——操作员故意做出一些失败的尝试比如抓偏了、力度不够这些负样本对后续训练非常有价值。数据清洗与标注阶段一条原始的遥操作数据通常包含高帧率的视觉流、状态流、动作流不能直接用于训练。要做时间戳对齐视觉帧、状态帧、动作指令必须在同一时间轴上、异常段剔除抖动、传感器掉线、误操作的部分要切掉、语义标注给每条数据补充任务描述、物体标签、关键步骤标注。我实测下来一个熟练的数据标注团队清洗100小时原始数据最终能用的高质量数据大约只有60到70小时这个损耗率一定要提前规划好。3.2 动作token化如何把连续动作变成模型能学的东西这是整个模型设计里最容易被忽视、却直接影响训练效果的关键环节。机器人动作是连续量比如一个六轴机械臂每个时刻的输出是六个关节的角度/角速度加上夹爪的开合量就是一个7维连续向量。但标准的Transformer架构更擅长处理离散token序列词、图像块所以必须决定怎么处理动作输出。我前后试过三种方案直接回归连续值。模型直接输出连续动作向量用L2 Loss或类似损失函数训练。好处是简单直接坏处是训练不稳定模型容易输出均值化的动作对所有情况都输出一个“平均动作”看上去不犯错但实际动作质量平庸。离散动作token。先用VQ-VAE把连续动作空间离线量化成一组离散码本Codebook比如4096个动作基元再把每个动作表示成码本中的某个索引。模型训练时只需要预测下一个动作token本质上和预测下一个词一样可以无缝复用语言模型的训练框架。我在实验中发现离散方案明显更稳动作的多样性保留得也更好。缺点是需要额外训练一个VQ-VAE而且码本大小的选择需要反复调参。扩散动作头。在Transformer输出层后面接一个扩散模型对动作分布做去噪生成。这是近几年比较火的方案比如基于扩散策略的系列工作好处是动作分布的表达能力强能刻画多峰特性坏处是推理速度受限每一步动作都要做多步去噪采样真机实时控制对延迟的要求经常吃不消。综合稳定性、实现成本、推理延迟三方面因素我在实验中最终采用了“离散动作token连续力觉回归”的混合方案主控制通道用离散token表示轨迹规划同时额外输出一组连续值用于控制接触力/力矩。这样既保留了语言模型训练框架的稳定性又不会丢失需要精细力控的任务能力。3.3 训练流程预训练和后训练两阶段的完整Pipeline模型的训练流程我拆成三个阶段每个阶段都有不同的数据配比和训练目标阶段一视觉-语言预训练。使用海量互联网图像-文本对和视频数据训练视觉编码器和语言编码器的对齐能力。这个阶段模型只学习“看懂世界”和“理解指令”不输出任何动作。训练目标和常规多模态大模型基本一致包括对比学习损失、图像描述生成损失等。数据量级在数亿对以上是成本最高的一个阶段但如果能直接加载开源的多模态预训练权重可以省下大量算力。阶段二行为预训练。引入遥操作数据和仿真数据开始训练“从感知到动作”的映射能力。这个阶段有两个关键配置一是冻结或低学习率微调视觉-语言编码器避免灾难性遗忘二是动作头和推理层用相对较高的学习率训练让模型尽快学会行为生成。损失函数由动作预测损失交叉熵或L2辅助的状态预测损失预测下一时刻的关节状态组成辅助损失能帮助模型理解动作带来的物理状态变化。阶段三后训练与对齐。用高质量专家数据和任务反馈做强化学习或DPO直接偏好优化对齐。这里的目标是让模型不仅“会做”而且“做得好”。比如面对同一个抓取任务抓取成功但动作僵硬、路径绕远和抓取成功且动作流畅、路径高效后者才是我们期望的行为。后训练阶段通常需要构建一个自动化的奖励函数或偏好对数据集我实际跑下来发现偏好对数据不需要太多一两千条高质量对比就能看到明显的行为质量提升。训练过程中的一个核心技巧是课程学习Curriculum Learning。不要一开始就给模型上最难的“多物体堆叠”任务而是先从“单物体抓取”“推动单一物体”这类基础任务开始等模型的基础行为能力稳定后再逐步混合更复杂任务的训练数据。我在实验中验证过同样的数据量使用课程学习策略的模型最终成功率比直接混合训练高出10到15个百分点效果非常显著。3.4 sim2real迁移仿真里训得好真机上为什么就废了仿真数据虽然便宜但“仿真里是王者真机上成青铜”的问题几乎每个做机器人学习的团队都遇到过。项目在这个问题上花了很多功夫我总结下来核心是三条域随机化要“随机到痛点”。很多团队做域随机化只是象征性地改改光照和物体颜色这远远不够。真正的域随机化要把仿真环境里所有可能与真实世界不一致的物理参数全部纳入随机范围包括但不限于物体质量与质心位置、接触面的摩擦系数、机械臂的关节阻尼和力矩上限、相机的内参和安装位姿、观测延迟。我在Isaac Sim里做抓取任务时把摩擦系数从0.2到1.0之间随机采样、物体质量从0.05kg到0.5kg之间随机采样之后sim2real的成功率直接从30%跳到了70%以上提升非常明显。系统辨识别怕麻烦。域随机化是让模型“见过各种情况的仿真”系统辨识则是让仿真“尽量贴近真实”。建模阶段要花时间校准机械臂的动力学参数连杆质量、惯性张量、关节摩擦力尤其是关节摩擦仿真里默认的库仑粘滞模型和真实电机减速器的摩擦特性往往差很多。有一个简单有效的校准方法让真实机器臂以一系列已知的轨迹运动记录关节电流/力矩数据然后在仿真里跑同样的轨迹反向优化仿真动力学参数使力矩误差最小。最后的微调必须上真机。不管仿真做得多好模型迁移到真机后仍然会出现偏差。正确的做法是准备一组覆盖各任务类型的“校准任务集”通常是20到50个简短任务在真机上测试模型表现找出系统性失败的模式比如“总是在接近物体时犹豫”“总是抓偏右侧”然后针对这些失败模式采集少量真机数据对模型做快速微调。这个“仿真预训练真机快速微调”的模式从成本和时间上都比纯真机训练高效得多。4. 常见问题与排查技巧实录4.1 动作token的码本大小怎么选这是我在训练初期反复调的一个参数。码本太大比如16384动作表达能力强但训练难度大模型很难在有限的训练数据里学好这么大的码本码本太小比如512训练容易收敛但动作多样性受限模型输出的动作会明显“僵硬”丢失精细操作能力。我的经验是先从小码本开始比如1024跑通整个pipeline确认模型能学到有效行为然后逐步增大码本尺寸每次翻倍做对比实验观察任务成功率的变化趋势。以我的项目为例处理器械臂抓取和插拔类任务2048到4096之间的码本表现最好再往上收益就开始递减。如果你同时处理非常多样的任务类型比如既有精细操作又有大幅度移动可以考虑分层码本策略——不同动作维度轨迹、夹爪、力度使用独立的子码本。4.2 模型真机上“眼高手低”看得懂、做不对怎么办一个非常典型的现象在仿真评测里模型成功率有85%部署到真机后直接掉到40%。先别急着改模型按以下顺序排查第一步检查观测。真机相机采集的图像和仿真渲染的图像之间存在巨大的distribution shift包括光照、白平衡、畸变、噪声、遮挡。建议在真机部署前做一遍图像标准化并确认视觉预处理流程和训练时完全一致。第二步检查动作执行延迟。模型推理时间指令传输时间伺服响应时间整个链路可能带来几十到上百毫秒的延迟而仿真里通常假设零延迟。一个简单的解法是在训练时显式注入随机延迟比如在动作指令上随机增加0到100ms的时间戳偏移让模型学会容忍执行延迟。第三步检查动作尺度。仿真里输出的是归一化动作空间比如-1到1真机上要映射到实际关节空间这个映射关系scaleoffset必须和训练时完全一致。我就犯过“训练时用弧度部署时代码里写的角度制”的低级错误导致机械臂动作幅度放大了57倍调试了一整天才发现。4.3 互联网视频数据到底该不该用怎么用不翻车先说结论该用但只用它做视觉预训练不要直接混进行为数据做联合训练。我踩过一个坑为了让模型“世界知识更丰富”把几万段互联网操作视频直接混进行为训练集结果模型训练loss不降反升真机上的行为成功率也明显下降。原因很好理解互联网视频里的“操作”绝大多数是人体演示而非机器人演示视觉内容极其多样而且没有精确的动作标注模型从中学不到干净的“图像到动作”映射反而被噪声信号干扰了行为表征。正确用法是把它限制在阶段一的视觉-语言预训练里而且数据要经过一道筛选优先选取包含明确操作的视频做饭、修理、装配等过滤掉纯风景、采访、动态壁纸等无关内容。在行为阶段宁可多用仿真数据做规模扩展也不要让互联网视频的“视频预测”信号污染“行为决策”信号。4.4 常见问题速查表问题表现可能原因排查与解决方案训练loss不降动作token码本初始化不佳检查码本使用率尝试重新初始化或改用连续回归头仿真成功率50%数据多样性不足增加遥操作演示者人数和物体位姿随机范围真机部署后动作抖动观测噪声过大或推理延迟不稳定加入观测平滑滤波用固定推理频率替代“跑完就发”抓取总是偏离目标一侧相机标定误差或sim2real位姿偏移重新做手眼标定在仿真里增加相机位姿随机扰动模型在长任务后期“失忆”长程时序建模能力不足引入显式的时间位置编码或状态记忆单元夹爪力度控制不准离散token表达连续力的能力有限增加连续力觉回归头单独设置损失权重多任务间互相干扰任务间数据比例失衡按任务难度动态调节采样权重困难任务适当过采样5. 写在最后的一些体会这条“拒绝视频生成”的路线做下来给我最大的感受是在AI领域“跟随热点”和“解决问题”往往是两回事。视频生成确实是过去两年最耀眼的进展之一但如果目标不是“生成一段好看的视频”而是“让机器人在物理世界里完成真实任务”那从一开始就要想清楚底座的语义层级——像素级对齐解决不了行为级问题。具身基座模型这个方向当然远未成熟数据效率、跨形态迁移、长程任务规划、安全可靠性每一个问题都还有巨大的研究空间。但至少它找到了一个我很认同的方向与其用一个错误的底座硬撑着往上搭不如把自己的地基重新打一遍。最后再给想尝试这个方向的朋友一个实用建议不要一上来就追求“全模态统一大模型”的大而全。我的路线是先在小规模任务集上跑通“视觉语言动作”的联合训练确认pipeline稳定后再逐步扩展任务类型、增加数据规模。先有一个能用的系统再去谈跃迁这条路走起来会稳很多。