NVFP4 量化 × 具身智能:ModelScope 模型生态调研

发布时间:2026/9/6 4:02:22
NVFP4 量化 × 具身智能:ModelScope 模型生态调研 目的了解当前行业模型情况“机器人/具身智能方向有哪些模型可用其中有没有 NVFP4 量化版”适合读者正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。摘要NVFP4 侧ModelScope 上 NVFP4 量化的视觉多模态模型共133 个调研时查找到的数量全部是Qwen、GLM、Gemma、Kimi等通用大模型的量化版很少具身智能专用模型。具身侧ModelScope 的具身智能分类下有621 个模型调研时点快照主力是VLA 操作模型π0/π0.5、GR00T、OpenVLA、LingBot、小米 Robotics、腾讯混元 Hy-Embodied等外加具身大脑、导航、世界模型几条支线国产厂商 2026 年发布密集。交叉结论调研时点未发现具身模型提供 NVFP4 版本均为原版BF16/FP权重。NVFP4 具身智能目前基本是个空白而主流 VLA 只有0.45B~14B自行量化的门槛并不高——想在 Blackwell 显卡上跑机器人模型只能自己动手但这条路走得通。选型速查上手选SmolVLA或π0端侧中文选MiniCPM-RobotManip人形选GR00TN1.7 已 Apache-2.0可商用。一、调研思路与流程本次调研从NVFP4 量化模型出发逐步扩大到整个具身智能模型生态流程如下没有沾边候选起点NVFP4 视觉多模态理解筛选页共 133 个结果其中有机器人/具身智能模型吗切换检索口径具身智能 robotics 任务分类共 621 个模型视觉定位 / 指向 / 空间感知类Qwen3-VL 底座等按技术路线分类梳理VLA / 具身大脑 / 导航 / 世界模型行业公开资料附件文档全球代表模型全景表含未上架 ModelScope 的模型交叉分析NVFP4 × 具身智能的空白与机会结论与选型建议三步走第一站分析指定筛选页NVFP4image-text-to-textmulti-modal133 个模型调研时点快照——回答NVFP4 量化模型里有没有具身方向的第二站转向 ModelScope 的具身智能robotics“任务分类621 个模型调研时点快照——回答平台上有哪些具身模型可用”第三站结合附件行业资料——把视野放大到全球含未上架 ModelScope 的模型形成完整行业图景。二、第一站NVFP4 量化有哪些从 ModelScope 开源的模型库中查看页面https://www.modelscope.cn/models/unsloth/gemma-4-26B-A4B-it-NVFP4共133 个结果调研时点快照。2.1 结果构成全是通用多模态大模型的量化版底座系列代表模型命名空间/模型名数量级说明Qwen3.x 系绝对主力RadixArk、Inferact、unsloth、RedHatAI、mlx-community等发布的 Qwen3.5/3.6/3.8 NVFP4约 7027B / 35B-A3B / Flash-Next 等规格Safetensors/GGUF/MLX格式GLM 系LibertAIDAI/GLM-5.3-Flash-NVFP4、baseten/GLM-5.2-Vision-NVFP4、hf/GadflyII-GLM-4.6V-NVFP410智谱视觉模型量化版Gemma 4 系unsloth、RedHatAI、mlx-community、r0b0tlab等15E2B / E4B / 26B MoE / 31B Dense 全规格Gemma 4 官方无 12B 规格NVIDIA 官方nv-community/Qwen3.8-Flash-Next-NVFP4、NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD等若干NV 社区官方量化其他Kimi-K2.5/K2.6-NVFP4、MiniMax-M3-NVFP4、Step-3.7-Flash-NVFP4、dots.ocr-nvfp4、Muse-Glimmer、Inkling 等若干大模型 OCR 专用模型结论这个筛选页里没有专门的机器人/具身智能模型。NVFP4 量化目前只做到通用 VLM 这一层还没延伸到 VLA 和具身模型。这些沾边模型虽然不直接输出机器人动作但它们作为 VLA 的视觉底座如Qwen3-VL其 NVFP4 量化经验可直接迁移到具身模型上——这正是第五节交叉分析中底座复用机会的来源。2.2 页面中沾边具身方向的候选模型与具身智能的关联局限sahilchachra/LocateAnything-3B-NVFP4A16通用视觉定位grounding具身感知的基础能力非具身专用mlx-community/MolmoPoint-8B-nvfp4指向pointing能力可用于机器人目标指示同上timepal/Qwen3-VL-8B-Instruct-NVFP4、cpadyun/Qwen3-VL-8B-FlashRT-NVFP4、hf/GadflyII-Qwen3-VL-235B-A22B-*-NVFP4Qwen3-VL具备空间感知 / 3D grounding常被用作具身智能的 VLM 底座国内多个 VLA 基于它构建本身不输出机器人动作sahilchachra/Agents-A1-NVFP4A16智能体方向InternScience Agents-A1 量化版偏科研 agent非具身三、第二站ModelScope具身智能分类全景621 个模型入口模型库 → 多模态 →具身智能tasksrobotics。以下为综合排序靠前的代表性模型按技术路线分类。下载量为调研时点快照。3.1 VLA视觉-语言-动作操作模型 · 国际模型机构规模协议下载量说明lerobot/pi0Physical Intelligence / LeRobot3.3BApache-2.02.2kπ0通用机器人操作基础模型PaliGemma 骨干 动作专家lerobot/pi05_base及 LIBERO 微调系列同上3.6B 级Gemma 许可2.3kπ0.5 升级系列lerobot/pi0fast_base、pi0fast-libero同上2.9~3.5BApache-2.0574π0-FAST token 化加速版lerobot/smolvla_base、smolvla_libero等HuggingFace450MApache-2.02.4kSmolVLA轻量端侧 VLAnv-community/GR00T-N1.5-3B/N1.6-3B/N1.7-LIBERONVIDIA3B 级N1 约 2.2BN1.7 为 3BApache-2.0N1.7 已并入 LeRobot明确支持商业部署65~697GR00T 人形机器人基础模型a11111ad/openvla-7b-oft-finetuned-libero-object斯坦福系社区上传7B 级MIT87OpenVLA-OFT 微调版VLA-Adapter/LIBERO-GoalOpenHelix1.25BMIT100轻量化改造 OpenVLALLM-Research/Magma-8B微软8B 级MIT1.7kUI 操作 机器人通用 agentallenai/GraspMolmoAI28BMIT315基于 Molmo 的抓取专用模型3.2 VLA 操作模型 · 国内模型机构规模协议下载量说明OpenBMB/MiniCPM-RobotManip面壁智能1.5BApache-2.0663端侧 VLA 操作另有MiniCPM-RobotTrack0.9B跟踪导航Robbyant/lingbot-va-base、lingbot-vla-v2-6b、lingbot-va-posttrain-libero-long蚂蚁灵波v2 官方口径为1.6B 稀疏 MoE0.6B 激活其余版本规模以官方为准Apache-2.0941~1.5kLingBot 系列真机后训练版本齐全Tencent-Hunyuan/Hy-Embodied-0.5-VLA-RoboTwin/-UMI腾讯混元4B 级骨干 Hy-Embodied-0.5-MoT约 4B0.5为版本号Apache-2.0163~181混元具身 0.5UMI 预训练 RoboTwin 2.0 SFT 两种数据配置XiaomiRobotics/Xiaomi-Robotics-0-LIBERO、-1-5B、-1-RoboCasa365小米机器人4.7~5B 级Apache-2.034~119小米 Robotics-04.7B 实时 VLA/ Robotics-1 系列LimXDynamics/FluxVLAEngine逐际动力—工程框架非单一权重模型Apache-2.02.8k开源 VLA 工程底座覆盖数据→训练→真机部署链路LET全尺寸机器人VLA1.0模型乐聚机器人—Apache-2.0申请制4全尺寸人形机器人 VLADAMO_Academy/RynnVLA-001-7B-Trajectory阿里达摩院7B 级Apache-2.0152轨迹预测式 VLA另有RynnValue-4B/8B价值模型Galaxea/G0-VLA星海图—CC-BY-NC-SA非商用49星海图 G0Dexmal/DM05-Lerobot、DM05-SO101-Pick-CubeDexmal0.3~5.2B—11~50基于 Gemma/SO-101 机械臂starVLA/Qwen3VL-PI_v3-Bridge-RT_1等StarVLA—MIT24基于Qwen3-VL的新一代 VLA 栈seeklhy/ZR-0系列、YuzeZhu/BridgeVLA、huixiAI/RhinoVLA学术/社区2.1~3.2BApache-2.045~78学术改进版 VLA3.3 具身大脑空间推理 / 任务规划 MLLM模型机构规模协议下载量说明BAAI/RoboBrain2.0-7B、-3B北京智源3B/7BApache-2.0申请制1.1k / 755具身大脑空间感知 任务规划FlagRelease/RoboBrain2.5-8B-ascend-FlagOS智源 / FlagOS8B 级—407RoboBrain 2.5基于Qwen3-VL昇腾适配X-Humanoid/Pelican1.0-VL-7B/72B北京人形机器人创新中心7B / 72B官方仅发布此两档Apache-2.0110~270天工配套具身 MLLM目前最大规模的开源具身多模态脑模型openmoss/RoboOmni复旦 OpenMOSS4.7BCC-BY-NC-4.0146语音视觉动作全模态3.4 导航VLN与空间智能模型机构规模协议下载量说明InternRobotics/InternVLA-N1上海 AI Lab8B 级CC-BY-NC-SA306导航专用双系统 VLAmisstl/JanusVLN_Base/_Extra学术9B 级Apache-2.0632 /1.2k基于Qwen2.5-VL的视觉语言导航amap_cvlab/FantasyVLN、ABot-M0-Pretrain、ABot-Recon、ABot-World-0-5B-LF高德视觉技术8B 级 等Apache-2.075~130导航 重建 世界模型系列高德 ABot / ABot-WorldStudio 技术栈admagic/ETPNav学术—Apache-2.0219经典层级式 VLNvalyentine/IndoorUAV-Agent社区——119室内无人机导航3.5 世界模型 / RL 后训练 / 感知组件模型机构规模下载量说明极佳视界/Giga-World-1极佳科技47B 级官方口径以模型页为准533通用世界模型lerobot/fastwam_baseLeRobot6B35FastWAM 世界-动作模型THU4Spiderman/Semantic_Temporal_World_Action_Model清华—2语义时序世界动作模型RLinf/RLinf-Pi05-SFT、RLinf-Gr00t-N1.6-SFT-Spatial、RLinf-DreamZero-*清华 RLinf3.3~12.6B12~310π0.5 / GR00T / DreamZero 的 RL 后训练权重Sunjian520/SDPose-Wholebody社区1.3B4.1k全身姿态估计感知前端全分类下载量最高之一Twang2026/HumanoidArena_models社区229B3.3k人形机器人评测基准模型集lerobot/act_aloha_*、diffusion_pushtLeRobot52M~263M868 / 896ACT / Diffusion Policy 经典基线3.6 自动驾驶 VLA归入具身智能分类模型机构规模下载量说明nv-community/Alpamayo-R1-10B、Alpamayo-1.5-10B、Alpamayo2-SuperNVIDIA10B ~ 约34B68~471Alpamayo 自动驾驶 VLA带推理链2 Super 为 32B Cosmos 3 骨干 2.3B 扩散动作专家四、第三站全球行业代表模型全景含未上架 ModelScope以下综合附件行业资料整理覆盖VLA、VLM、世界模型、专用架构四条主线。标注 ✅ 的表示已在 ModelScope 可下载。4.1 代表模型一览模型发布机构类型参数规模核心特点 / 定位ModelScopeRynnBrain 1.1阿里巴巴达摩院VLA2B / 9B / 122B-A10B首个 122B 级稀疏 MoE 具身脑模型支持 3D 空间定位与真实机器人控制宇树 G1、Astribot 等可搜索相关 checkpointHy-Embodied-VLA-0.5腾讯 Robotics XVLA4B 级骨干 Hy-Embodied-0.5-MoT连接小脑与身体将高层目标转化为连续可纠错动作0.5为版本号✅Hy-Embodied-0.5-VLA-UMI/-RoboTwinHy-Embodied-VLM-1.0腾讯 Robotics XVLM—“右脑”理解图像、空间和场景—Hy-Embodied-RxBrain-1.0腾讯 Robotics X具身大脑—统一认知、规划与未来状态想象—GO-2智元机器人具身基座—融合大小脑2026 年 4 月发布2026 被视为具身智能部署元年—GR00T N1 系列NVIDIAVLA2.2BN1起N1.7 为 3B双系统架构System-2 推理 System-1 扩散策略首个开源人形机器人基础模型N1.7 已 Apache-2.0 并入 LeRobot✅ N1.5-3B、N1.6-3B、N1.7-LIBEROπ0pi-0Physical IntelligenceVLA3.3B基于 PaliGemma10,000 小时跨本体遥操作数据✅ lerobot/pi0π0.5 / π0.7Physical IntelligenceVLAπ0.5 为 3.6B 级π0.7 未公开π0.5开放世界泛化至未见过的家庭环境π0.72026 年 4 月主打可操纵性子目标图像 / episode metadata与组合泛化部分pi05_base 系列在架OpenVLAStanford / BerkeleyVLA7BRT-2 开源复现学术界广泛微调✅ 社区微调版RT-2Google DeepMindVLA55B首个 VLM-to-Action Transformer开创 VLA 类别❌ 闭源OctoBerkeley AI ResearchVLA93M / 27M轻量通用策略800K 条 Open X-Embodiment 轨迹—InternVLA-A1 / A1.5上海 AI LabVLA2.7B 级统一理解、生成与行动的操作模型✅ InternVLA-A1.5-baseLingBotVLA蚂蚁集团灵波VLAv2 为 1.6B 稀疏 MoE0.6B 激活开源具身基座模型✅ lingbot-va-baseLingBot-Video蚂蚁集团灵波视频预训练—首个面向具身智能的大规模视频预训练模型GitHub 项目Qwen-RobotManip / RobotNav / RobotWorld阿里 QwenVLA / 世界模型—标准化状态-动作空间 / 移动控制 / 世界动态预测—MiniCPM-RobotManip面壁智能VLA1.5B端侧机器人操作✅ OpenBMB/MiniCPM-RobotManipRoboBrain 2.5北京大学 / 智源具身基础模型8B 级深度感知坐标预测 密集时序价值评估✅ FlagOS 版RoboBrain2.0 为申请制Pelican-VL 1.0北京人形机器人创新中心具身 VLM7B / 72B目前最大规模的开源具身多模态脑模型配套 RoboMIND 2.0 数据集✅ 7B / 72BWALL-OSS / WALL-A自变量机器人具身基础模型—中国最早落地的具身基础大模型之一—ERA-42星动纪元具身大模型—通用具身大模型—UnifoLM-VLA-0宇树科技VLA—开源 VLA—Thinker优必选具身大模型—开源具身大模型—盘古具身智能大模型华为具身大模型—盘古系列具身方向—MiMo-Embodied小米具身大模型—开源具身大模型与 Xiaomi-Robotics-0/1 为不同模型线—GigaWorld 系列极佳视界世界模型47B 级世界模型 GigaBrain 具身基模✅ Giga-World-1GOVLA智平方具身大模型—全域全身具身大模型—RoboMamba智平方 北京大学VLA—视觉编码器 Mamba 状态空间模型仅调 0.1% 参数—Brain-Si 0.5CasiaHand灵巧操作—类人灵巧操作模型三层架构待确认未检索到公开资料—AstraBrain-WBC 0.5GalaxyBot小脑基模80M全身实时人形控制待确认—SAM-6D跨维智能姿态估计—零样本 6D 姿态估计—PaLM-EGoogle TU BerlinVLM562B全球最大视觉语言模型之一融入连续传感器模态❌ 闭源VLM-3RUT AustinVLM—单目视频隐式 3D Token无需深度传感器—KairosACE RoboticsWAM—世界-语言-行动模型待确认—4.2 四条技术主线解读VLA端到端融合视觉、语言与动作是目前具身智能做得最多的一条路线。当前的难点在于推理能力和动作精度难以兼顾。开源梯队已经比较完整RT-2 → OpenVLA → π0 → GR00T国产模型发布也很密集GR00T N1 用的双系统架构慢思考推理 快反应策略正被越来越多模型采用。VLM具身场景要求模型理解3D 空间结构而不只是看懂二维图像。代表工作VLM-3R从单目视频提取隐式 3D Token、RoboBrain 2.5深度感知坐标预测直接输出 3D 操作轨迹。世界模型 / WAM世界模型负责预测物理世界的下一状态2026 年起开始与动作生成融合形成世界-语言-行动模型WAM。代表蚂蚁LingbotVA、NVIDIADreamZero、极佳GigaWorld智源相关世界模型项目待确认。专用架构面向灵巧操作和全身控制的专用模型如灵巧操作三层架构模型、80M 级全身实时控制小脑基模等部分厂商项目公开资料有限待确认。五、交叉分析NVFP4 × 具身智能的空白与机会维度现状含义NVFP4 量化覆盖133 个模型调研时点快照全部是通用 VLM/LLMQwen、GLM、Gemma、Kimi等NVFP4 已经比较普及但只覆盖通用对话/理解场景具身模型量化调研时点未发现具身智能分类下的模型提供 NVFP4 版本均为原版BF16/FPsafetensorsBlackwellRTX 50 系/B200上部署 VLA需自行量化模型规模主流 VLA 在0.45B~14B之间SmolVLA450M、MiniCPM-RobotManip1.5B、π03.3B、GR00T N1.73B小模型量化到 NVFP4 的可行性和收益都很高底座复用多个 VLA 直接基于Qwen2.5-VL/Qwen3-VL/Gemma构建这些底座的 NVFP4 量化经验本站已有可直接迁移这意味着一个实际的工程机会在端侧/边缘部署场景Jetson、机器人本体上的 RTX 5090用TensorRT Model Optimizer把SmolVLA、MiniCPM-RobotManip、π0这类0.5~3.5B的 VLA 量化到 NVFP4路径是通的而调研时点尚未发现有人公开发布这类权重。以SmolVLA450M为例量化思路大致如下# 1. 导出 ONNX 或 TensorRT 引擎# 2. 使用 TensorRT Model Optimizer 进行 NVFP4 量化# 3. 在 Jetson / RTX 5090 上验证精度与延迟配合 LeRobot 框架可在 30 分钟内跑通一个简单的抓取仿真任务安装lerobot→ 加载smolvla_base→ 运行 LIBERO 仿真环境。六、结论与选型建议需求推荐快速上手机器人操作仿真/真机lerobot/smolvla_base450M最轻或lerobot/pi05_baseπ0.53.6B 级生态最好端侧中文场景OpenBMB/MiniCPM-RobotManip1.5BApache-2.0人形机器人nv-community/GR00T-N1.7-LIBEROApache-2.0已并入 LeRobot可商用具身大脑 / 空间推理X-Humanoid/Pelican1.0-VL-7B开源可商用RoboBrain2.0 需申请视觉语言导航misstl/JanusVLN_BaseApache-2.0下载量高商用项目优先Apache-2.0/MIT模型避开 CC-BY-NC 系列InternVLA-A1.5、G0-VLA 等和申请制模型想要 NVFP4 部署现成模型不存在建议自行量化小体量 VLA或先用Qwen3-VL 系 NVFP4版做具身感知层总的来说2026 年的具身智能模型数量已经很可观仅 ModelScope 上就有600 多个调研时点快照可直接下载国产厂商占了不小比例。但 NVFP4 量化还停在通用 VLM 层面NVFP4 具身智能这块暂时没人做需要用的人得自己量化。数据来源ModelScope魔搭社区模型库 行业公开资料整理分享完成~