具身智能论文学习4:PaLM-E: An Embodied Multimodal Language Model

发布时间:2026/8/14 14:11:18
具身智能论文学习4:PaLM-E: An Embodied Multimodal Language Model 第一部分论文基本信息项目内容论文题目PaLM-E: An Embodied Multimodal Language Model中文名称PaLM-E具身多模态语言模型第一作者Danny Driess主要团队Google Research、TU Berlin 等发表会议ICML 2023收录级别CCF APMLR 卷号Volume 202页码8469–8488最大模型规模562B代码和权重未完整开源模型定位Embodied VLM、高层具身推理模型PaLM-E 是建立在 PaLM 基础上的模型PaLM 是纯文本大语言模型 LLMPaLM-E 中的字母 E 表示 Embodied即“具身化”。PaLM-E 保留 PaLM 作为语言模型主体再增加视觉编码器、状态编码器和投影接口将图像、机器人状态等连续观测转换到 PaLM 的语言 embedding 空间图像/机器人状态→编码器→与文字token同维度的向量→PaLM因此PaLM-E 可以理解为PaLM-EPaLM视觉/状态编码器多模态联合训练PaLM论文解读https://blog.csdn.net/weixin_74009895/article/details/163689758?spm1011.2415.3001.10575sharefrommp_manage_linkhttps://blog.csdn.net/weixin_74009895/article/details/163689758?spm1011.2415.3001.10575sharefrommp_manage_link第二部分解决的问题如何让预训练 LLM不再只理解文本而是直接接收图像、机器人状态等真实世界连续感知信息从而进行 grounded embodied reasoning 和机器人高层规划SayCan 这类方法虽然通过 robot policy 和 affordance function 对 LLM 进行 grounding但LLM 本身仍然只有文本输入对于依赖场景几何结构的任务是不够的RT-1 没有显式 robot state/action 输入PaLM-E 可以输入机器人状态 robot state不是action第三部分PaLM-E创新点1整体框架PaLM-E High-level Embodied Reasoner高层具身推理器不是直接 low-level VLA controllerTextImagesRobot / Object State3D Scene Representation文本图像状态/连续传感器观测 ↓ Encoder ↓ 映射到 Language Embedding Space ↓ PaLM-E ↓ Autoregressive Text Output ↓ ┌──────────────┬────────────────┐ ↓ ↓ VQA Answer High-level Robot Plan ↓ Low-level Policy ↓ Robot Actions2multimodal tokens和Multimodal SentencePaLM的输入原本都是文字token文字token经过embedding映射得到例如Push the green block to the bottom left.经过tokenizer和embedding后变成一串连续向量每个向量都是也就是问题是机器人不能只看语言指令它还需要看当前场景。PaLM-E增加了视觉和状态编码器后面会说到统一成通用的连续观测编码器然后把它们放进同一个序列表示文本、图像、机器人/环境 state 都已经被编码成了 PaLM 能处理的embedding然后作为同一个序列送进PaLM关键点是图像本身不经过SentencePiece也没有先变成文字视觉编码器直接把图像映射到PaLM的语言embedding空间。PaLM-E论文正是把视觉、状态等连续观测转换成与文字embedding同维度的向量再与文字tokenmultimodal tokens交错组成“多模态句子”Multimodal Sentence例如提示Given image, push the green block to the bottom left.在模型内部可以概念化为所以技术链条是PaLM 文字 token → embedding → Transformer → 文字 token PaLM-E 文字 embedding 图像 embedding 状态 embedding → 同一个 Transformer → 文字输出如下所示橙色普通文字 token绿色emb机器人状态、物体状态或其他连续观测蓝色img图像输入。图中下面那一排橙色、绿色、蓝色小块就是这些交错排列的输入向量这就是论文中的Multimodal Sentence多模态句子3通用的连续观测编码器PaLM-E增加通用的连续观测编码器具体到不同模态会有不同的连续观测空间观测编码器PaLM的embedding空间一次观测被编码成多少个向量。通用编码器输入来源主要包括图像robot / object state其他 continuous sensor observations但文本走的是上面的 PaLM 原来的 token embedding文本不使用这个通用的连续观测编码器假设输入是一张图像经过视觉编码器后每一个视觉向量都满足这些向量分别携带不同图像区域、物体或场景信息。整理汇总一下也就是正常文字 token连续 observationImage / State / Sensor所以整个输入统一成论文就是通过这种方式把观测信息observation embedding和文字信息word embedding统一拼成一条输入序列一起送进语言模型LLM。4为什么必须与文字embedding同维度假设使用PaLM 8B那么文字token的向量是图像编码器最终产生的每个向量也必须是机器人状态向量同样需要被投影为这样它们才能作为同一种形式的输入进入同一个Transformer。同维度不代表图像向量变成了文字也不代表某个图像向量对应某个具体单词。它只是说PaLM内部要求每个输入位置都用相同长度的向量表示。5使用的预训练模型它不是Robot data ↓ 从头训练一个 multimodal transformerPaLM大语言模型负责推理ViT大型视觉编码器负责图像MLP小型普通神经网络负责把结构化 state 数值“翻译”成 PaLM embedding。最大的 PaLM-EPaLM 540B ViT 22B PaLM-E 562B。6输入输出和训练损失函数PaLM-E的输入可以是多模态句子图像向量状态向量文字token输出是文本token。输入前缀Given image, what should the robot do?训练目标Push the green block to the bottom-left corner.模型仍然使用自回归语言建模目标使用交叉熵损失函数计算目标文本部分其中给定前面的多模态输入前缀​模型一个 token 一个 token 地生成后面的目标文本需要模型生成的目标文本。图像向量本身不是预测标签它们是条件输入。对于特殊占位符怎样被替换问题训练样本的文字中可先写Given img, what should the robot do?在进入模型时img这个位置不会作为普通文字token处理而是被视觉编码器产生的一组向量替换所以训练数据表面上可以用特殊标记组织模型内部实际接收的是连续视觉向量。7模型训练全参训练以及微调配置PaLMViT / EncoderProjector / MLPEnd-to-end finetune训练训练训练LLM frozen❄️冻结训练训练OSRT frozen variant可冻结OSRT representation 冻结只训练 projectorPaLM-E通常包含三部分观测编码器投影层PaLM语言模型“观测编码器”其实就是一个总称如果输入是图像观测编码器可以是ViT如果输入是State 向量观测编码器可以是MLP如果输入是 3D / object-centric scene representation也可以是OSRT物体场景表征 Transformer。Projector 的作用是把“非文本模态编码器输出的特征”映射到 PaLM 的文本 embedding 空间。文本本身通常不需要再经过这个 projector它本来就在 PaLM 的 embedding 空间里以图像为例①冻结PaLM固定语言模型参数不更新只训练即更新视觉编码器和投影层这种情况下编码器需要学会生成一种PaLM已经能够理解的“视觉软提示”。可以理解为PaLM保持原来的语言能力视觉编码器努力把图像翻译成PaLM内部容易处理的向量形式。优点是更好保留原始语言能力需要更新的参数更少不容易发生语言能力灾难性遗忘。局限是机器人任务适应能力有时不如全模型微调冻结的PaLM不能充分改变内部表示来适应具身任务。②端到端微调同时更新也就是视觉编码器、投影层和PaLM一起训练。优点是模型可以更充分适应机器人和多模态任务视觉信息与语言推理可以共同调整某些机器人规划任务表现更好。风险是模型可能因为大量适应新任务而损失原有语言能力。这叫Catastrophic Forgetting灾难性遗忘论文发现模型规模越大这种语言能力损失越小。最大规模模型在多模态训练后能够更好地保留PaLM原来的语言能力。Figure 6比较了PaLM和PaLM-E在一般语言生成任务上的差距。大致趋势是PaLM-E-12B在多模态训练后语言能力下降较多PaLM-E-562B的下降明显更小。它支持的结论是模型规模越大多模态微调后越容易保留原始语言能力也就是更少的catastrophic forgetting灾难性遗忘。8机器人控制输出文本如何转化为动作控制需要一个独立的低层策略完整过程是图像指令→PaLM-E→高层文字子目标→​→机器人动作PaLM-E输出Push the green star to the bottom-left corner.低层策略输入当前图像“Push the green star to the bottom-left corner”低层策略输出代表的是沿着3个方向的移动大小PaLM-E论文明确假设存在可执行一组低层技能的策略或规划器。PaLM-E负责选择和排列这些技能所以可以被理解成一个高层策略。但它不是只在任务开始时规划一次而是可以不断根据新观测进行重规划。过程是当前图像或机器人状态PaLM-E产生的语言子目标低层策略产生的实际动作​执行之后的新观测。然后再次循环PaLM-E重新判断执行过程中有人把积木移走了机器人获得新图像后PaLM-E可以发现积木位置发生变化重新生成合适的子目标。移动操作任务任务是Bring me the rice chips from the drawer.PaLM-E逐步生成Go to the drawers → Open the top drawer → Take the rice chips out → Bring them to the user → Put them down中途有人把薯片重新放回抽屉模型根据新图像重新规划然后继续执行。这说明它不是只生成一次计划而是观察→生成下一步高层指令→低层策略执行→重新观察→重新规划桌面操作任务图中还展示one-shot任务zero-shot任务新物体组合未见过的玩具乌龟等目标。PaLM-E向低层策略输出语言子目标低层策略再生成实际机器人动作。正文描述中PaLM-E约以1 Hz产生高层语言子目标低层策略以5 Hz输出低层动作。第四部分实验结果1PaLM-E 的不同 Observation Encoding 方式State → MLP结构化状态输入ViTTL → 图像输入ViT-4B → 图像输入OSRT → 3D/Object-centric 场景输入这样就完全不会产生不同输入表示效果不同结构化状态、普通ViT、面向对象表示和OSRT各有差异。OSRT等对象级表示在需要精细场景几何推理时可能更有效。同一种ViT训练数据不同结果差别很大例如ViT-4Bsingle robotfull mixture。完整混合训练的规划性能明显更好。因此模型效果不仅取决于视觉编码器还强烈依赖预训练方式联合训练数据\text{预训练方式联合训练数据}预训练方式联合训练数据①State Estimation Vectors结构化数值状态向量最简单的情况是机器人已经获得结构化状态例如状态向量中可能包含这些信息可能表示机器人自身状态物体位置和姿态物体大小物体颜色场景中已估计出的结构化属性。PaLM-E用MLP将其映射到语言embedding空间或者映射成多个向量这种方式的优点是输入非常明确但前提是系统已经知道物体的准确状态。②Vision Transformer直接处理RGB图像更通用的方法是直接输入图像ViT会把图像划分成patch并产生一组视觉特征视觉token数量ViT自身的输出维度。但ViT输出维度不一定等于PaLM的所以增加一个可学习投影层最终于是每个视觉token都变成PaLM能够接收的维度。流程是RGB图像→ViT视觉特征→投影层→PaLM embedding空间③Object-Centric Representations面向对象的表示普通ViT通常按照图像网格或patch生成特征但机器人任务需要围绕具体物体推理例如任务把绿色积木放在黄色积木左边。模型需要区分哪一个是绿色积木哪一个是黄色积木两者的位置关系哪个物体应该被移动。因此论文还研究了面向对象的输入表示。可以写成每组向量专门对应某个对象而不是对应图像中的固定网格区域。一种方式是使用已知的物体分割mask其中是第个物体的mask再分别编码这样不同物体的视觉信息被明确分开。④OSRT3D感知的对象场景表示PaLM-E还研究了Object Scene Representation TransformerOSRT它尝试从多视角图像中学习3D感知的场景表示并将场景分解为不同的object slots​多个视角的图像第个对象槽位。然后再经过MLP投影到PaLM的embedding空间这样PaLM-E获得的不只是“整张图的平面特征”而是结构化、面向对象、带有3D信息的表示。2跨任务联合训练PaLM-E不是只用机器人数据训练。训练数据混合包括通用语言数据视觉语言数据机器人具身数据通用语言任务Q: Miami Beach borders which ocean? A: Atlantic.视觉问答Given image, what is in the image? A: A bowl of fruit.图像描述Describe image. A: A dog jumping over a hurdle.机器人规划Given image, how should the robot grasp the blue block? A: First move the yellow block, then grasp the blue block.这些数据被混合训练到同一个模型中,论文的完整训练混合中具身机器人数据只占约8.9%其余主要是不同类型的视觉语言数据。机器人数据通常数量较少收集成本高场景和物体有限指令类型有限。而互联网视觉语言数据能够提供大量物体概念颜色和属性知识空间关系常识知识视觉问答和语言推理能力。因此联合训练可能产生迁移互联网视觉语言知识→机器人具身推理例如机器人训练数据里没有见过玩具乌龟,但模型可能在互联网图文数据中学过“turtle”的视觉概念.当用户说Move the green block to the turtle.PaLM-E可能仍能识别乌龟并生成正确高层计划。3主性能结果跨机器人、跨任务与跨域等多源数据的正迁移假设只用单个机器人数据训练规划成功率较低。加入其他机器人数据VQA数据图像描述数据通用视觉语言数据之后当前机器人的规划能力反而提升这就是Positive Transfer正迁移单独训练TAMP机器人 → 单独训练一个模型 Language-Table → 单独训练一个模型 移动机器人 → 单独训练一个模型PaLM-E联合训练多个机器人任务 WebLI VQA COCO 通用视觉语言数据 ↓ 一个共享的PaLM-E结果显示使用PaLM和ViT预训练再加入完整混合数据进行联合训练多个机器人任务的性能都明显高于只使用各自领域数据训练。它表达的是PaLM-E最重要的实验结论视觉语言知识和其他机器人任务的数据→能够帮助当前机器人任务这就是positive transfer正迁移。第五部分Limitation → Next PaperLimitation ①它还是高层 Planner不直接输出低层动作PaLM-E 最终Image Language ↓ PaLM-E ↓ Textual Plan ↓ Low-level Policy ↓ Action论文自己明确说在 embodied planning / control 情况下PaLM-E 输出 text再由已有 low-level policies 执行。Limitation ②Perception / Reasoning / Action 没有真正统一为什么说PaLM-E还不是RT-2式VLA因为PaLM-E中仍存在明显的两层结构PaLM-E高层文本规划独立低层机器人策略而RT-2进一步变成图像指令→同一个模型→动作token→机器人低层动作所以PaLM-E虽然能参与机器人闭环控制但主要是高层决策模型而不是直接动作生成模型。Limitation ③机器人数据仍然稀缺PaLM-E 已经证明通用 VLM/Web 数据能够 transfer 到 robotics。但是它并没有完全解决怎样直接利用 Web-scale knowledge 来学习机器人控制 action它仍然输出高层 text plans。于是下一篇 RT-2 会进一步解决既然 VLM 已经从 Web 学到了大量视觉和语义知识能不能让 VLM 直接把 robot action 也当成 token 输出