华科大×华为TurboVLA:不需要大语言模型,照样实现高性能 VLA!

发布时间:2026/8/14 22:10:26
华科大×华为TurboVLA:不需要大语言模型,照样实现高性能 VLA! 机器人底层执行控制是否需要通用大语言模型——VL→A目录01 LLM中心VLA的底层矛盾02 核心VL→A架构三模块极简轻量化设计多模态独立编码分离视觉、文本特征流双向跨模态交互模块替代LLM融合功能非自回归连续动作并行解码03 仿真真机双维度实验轻量模型性能反超大模型LIBERO单臂仿真基准行业通用VLA评测集RoboTwin 2.0双臂复杂操作基准实体机械臂真机落地验证04 TurboVLA差异化核心竞争力05 总结现有视觉 - 语言 - 动作VLA模型普遍采用大语言模型居中的 V→L→A 架构每次动作预测都需经过数十亿参数 LLM带来巨大算力、显存与延迟瓶颈。华中科技大学联合华为推出的TurboVLA创新 VL→A 直接映射范式仅 0.2B 参数、0.9GB 显存、31.2ms 推理延迟32Hz在 LIBERO 基准达到 97.7% 操作成功率兼顾轻量化、实时性与机器人操控性能。本文将基于该研究重新探讨“大语言模型在机器人底层操控中的必要性边界”。01 LLM中心VLA的底层矛盾一些主流的V→L→A串行架构例如OpenVLA、π0.5、CogVLA等流程大致为相机视觉特征先投影对齐LLM词嵌入空间和自然语言指令拼接送入数十亿参数大模型做全局语义融合最后解码输出机器人动作。这条路线理论上具备强开放词汇理解、高层推理能力但针对机器人实时闭环执行存在三重不可调和的底层矛盾极高硬件门槛π0.5参数量3.4B推理显存占用12.8GB普通消费显卡无法承载必须依靠云端服务器机器人本体依赖网络传输图像指令网络波动直接丢控控制频率极低LLM完整前向推理耗时93ms以上动作更新频率仅11Hz动态场景下机器人无法快速响应物体位移、光照变化极易操作失败冗余算力浪费机器人执行阶段仅需依据指令匹配视觉目标完成抓取、堆叠等基础动作不需要LLM具备长篇文本生成、复杂任务规划能力大模型海量通用语义能力对即时动作预测属于算力空耗。▲从以大语言模型为核心的 VLA 到 TurboVLA 架构对比(a) 子图左侧为 LLM 中心式 VLA右侧为本文 TurboVLA 架构对比(b) 子图TurboVLA 在延迟与参数量上实现大幅性能提升此前优化思路常局限于动作解码器加速、模型蒸馏量化没有改变“LLM作为中间必经通道”的底层逻辑延迟与显存开销的核心瓶颈始终无法根除。TurboVLA的核心创新直击痛点自然语言指令仅用来定义操作目标机器人底层连续动作预测不需要通用大模型轻量文本编码器双向跨模态交互足以完成视觉-指令特征匹配彻底砍掉LLM中间层。02 核心VL→A架构三模块极简轻量化设计整套模型无任何大语言主干由多模态独立编码器、双向视觉语言交互模块、并行动作块解码器三部分构成。全程无LLM参与整体参数量仅0.2B单臂配置架构极简且全链路并行计算。▲TurboVLA 可实现轻量化本地部署基于 0.2B 参数量、0.9GB 推理显存、31.2ms 策略延迟完成实时语言操控机械臂多模态独立编码分离视觉、文本特征流放弃视觉特征送入LLM词嵌入空间的操作视觉、文本采用两套独立轻量化编码器并行提取特征视觉分支DINOv3视觉骨干提取多视角图像空间特征叠加位置、相机视角嵌入保留物体空间几何信息文本分支轻量BERT编码器解析自然指令完整token序列不做全局池化完整保留物体、空间方位细粒度语义信息两路特征统一投影至256维共享隐空间完全独立运算不存在大模型全局计算开销。机器人关节状态仅在动作解码阶段输入不参与跨模态融合进一步减少交互模块计算量。双向跨模态交互模块替代LLM融合功能这是TurboVLA区别于轻量化VLA的核心创新摒弃单方向特征映射采用视觉到文本、文本到视觉双向交叉注意力多层堆叠结构。每层交互单元流程先通过指令特征修正视觉图中目标区域权重再用视觉实景约束文本语义理解多层迭代后生成「带指令条件的视觉特征」和「贴合当前场景的文本特征」拼接融合为面向动作预测的专用多模态表征。消融实验证明仅单向注意力、直接拼接特征都会大幅降低任务成功率双向交互才能精准匹配文字目标与图像物体。整个交互层仅6层堆叠参数量极小无百亿级矩阵运算。▲TurboVLA 整体架构总览非自回归连续动作并行解码借鉴ACT解码器设计内置可学习动作查询向量融合跨模态特征与机器人本体状态单次前向直接输出连续12步7自由度动作块无需像自回归VLA逐token生成动作彻底消除串行解码延迟。训练仅采用L1行为克隆损失无需配套语言建模辅助损失训练开销同步降低。整套流程从图像输入到动作输出仅31.2ms稳定32Hz闭环控制。03 仿真真机双维度实验轻量模型性能反超大模型实验分为LIBERO单臂仿真、RoboTwin 2.0双臂仿真、AgileX Piper实体机械臂真机三大场景。LIBERO单臂仿真基准行业通用VLA评测集LIBERO分为空间、物体、目标、长时序四类任务覆盖泛化、长流程操作场景。▲LIBERO基准主流VLA完整指标对比TurboV仅为π0.5约6%参数量、7%显存占用延迟缩减2/3平均成功率小幅超越全部大尺寸LLM-VLA轻量化基线Evo-1参数量是TurboVLA4倍速度更慢、任务成功率低近3个百分点。不过LIBERO场景固定、指令简短具象仅能证明执行级抓取堆叠任务不需要LLM无法代表开放世界自由对话、长任务规划能力。RoboTwin 2.0双臂复杂操作基准双臂协同对多模态匹配、连续动作平滑度要求更高TurboVLA升级至0.4B参数配置43.4ms推理速度50项双臂任务平均成功率60.2%领先π0.557.0%、StarVLA-α50.3%证明直连VL架构同样适配多自由度协同控制。▲RoboTwin 2.0 双臂仿真基准对比表实体机械臂真机落地验证基于AgileX Piper单臂机器人搭建双RGB-D相机硬件平台测试抓取滚筒、移扑克牌、按订书机、叠碗四类真实杂乱场景。▲AgileX Piper 实体机械臂真实场景评测TurboVLA四项任务成功率分别92.5%、80%、90%、87.5%全部高于同训练条件下的π0.5模型。真机存在传感器噪声、物体反光、轻微位姿偏移干扰轻量化模型依旧保持更高鲁棒性核心原因是无LLM冗余计算推理链路短噪声累积更少。04 TurboVLA差异化核心竞争力硬件门槛断崖式下降消费级RTX 4090即可本地离线部署无需云端服务器与稳定通信链路仓储、家用小型机器人、教学机械臂均可低成本搭载高频率实时闭环32Hz动作更新适配动态场景解决传统VLA延迟过高导致的跟踪失效问题部署成本大幅压缩无大模型推理算力消耗边缘低功耗GPU、嵌入式显卡存在适配潜力单模型兼容单/双臂仿真到真机迁移稳定无需针对硬件重新微调大量参数。▲视觉‑语言交互的不同变体。(a) 直接拼接视觉与指令特征(b) 利用视觉特征仅更新指令特征(c) 利用指令特征仅更新视觉特征(d) 双向交互同时更新两路特征流本文方案05 总结TurboVLA通过极简VL→A范式打破固有技术路径用0.2B轻量模型实现对标超大VLA的操作精度同时把显存、延迟压缩至消费硬件可承载范围。机器人底层执行控制是否需要通用大语言模型答案是分场景取舍。对于即时、短指令操作设备完全可以剥离LLM实现极致轻量化实时推理对于具备自主思考、长任务规划需求的通用人形机器人LLM仍不可替代。TurboVLA这类轻量直连VLA负责底层高速动作执行兼顾智能推理与实时控制两大需求为嵌入式、低成本机器人提供全新技术迭代方向。Ref论文标题TurboVLA: Real-Time Vision-Language-Action