谷歌发布 Gemini Robotics 2.0,机器人灵活性与安全性大幅提升

发布时间:2026/7/31 18:33:10
谷歌发布 Gemini Robotics 2.0,机器人灵活性与安全性大幅提升 人工智能谷歌旗下 Gemini AI 模型驱动的机器人迎来全面升级。随着 Gemini Robotics 2 的正式亮相这些实体机器人如今能够完成更复杂的任务、持续分析动态变化的环境并与其他机器人协同作业。这一切得益于三个全新子模型的支撑其中一个已于今日向开发者开放使用。多年来机器人奔跑、跳舞、后空翻的视频在互联网上广泛流传但这些机器人大多是为完成特定动作而编程的。Gemini Robotics 的目标是打造一款通用型机器人使其具备与人类相当的行动能力。谷歌 DeepMind 的科学家们有时将这一目标称为物理 AGI——即你告诉机器人做什么它便能执行。在 2.0 版本中谷歌表示其机器人 AI 已能控制完整的仿人机器人即使面对结构复杂的仿人机械手灵活性也得到了显著提升。此次升级的核心是 Gemini Robotics ER 2这是一款升级版的具身推理模型DeepMind 声称其性能相较于此前的 1.6 版本实现了重大飞跃。该模型已与 Gemini Live API 集成为开发者提供了率先体验这一进步的机会。Gemini Robotics ER 2 属于视觉语言模型VLM专为理解操作指令与周围环境而设计。此次升级的亮点在于ER 2 能够实时处理机器人摄像头的视频流使系统得以在机器人逐步推进任务的过程中持续追踪执行进度。谷歌指出Gemini Robotics ER 2 对视频帧完整性的分类准确率接近 60%。尽管距离完美仍有差距但这一表现已远超 1.6 版本也优于目前同类竞争 AI 模型的视觉理解能力。精准识别视频流中的关键时刻同样是机器人准确完成任务的关键所在。以倒咖啡为例机器人必须清楚地判断何时停止倾倒。ER 2 在这方面表现尤为出色对关键时刻的识别准确率接近 90%。在执行多步骤任务时具身推理模型使机器人能够实时感知操作失误并在原步骤上进行重试而无需从头开始。例如若机器人尝试抓取的球滚走或有人移动了容器系统可以直接调整手部位置和动作而不必重置整个流程。此次发布的升级版具身推理模型也赋予了谷歌 DeepMind 机器人 AI 多机协作的能力。演示视频展示了 Apptronik 的 Apollo 2 与更简单的 Franka F3 Duo 协同完成任务且互不干扰的场景。尽管测试机器人在速度和动作流畅度上仍与人类存在差距但演示视频中包含了大量实时操作画面机器人的表现明显比以往测试中更加果断、自然。理解指令只是第一步驱动机器人在物理世界中实际行动则由另一个模型负责。视觉语言模型在完成任务规划后会将控制权移交给升级版的视觉语言动作模型即 Gemini Robotics 2。该模型依据任务指令生成机器人动作其原理与其他生成式 AI 系统生成文本或图像的方式如出一辙。此外还有一款低延迟的本地离线版本名为 Gemini Robotics On-Device 2。目前这两款模型仍处于小范围测试阶段。QAQ1Gemini Robotics ER 2 和之前的版本相比有哪些具体提升AGemini Robotics ER 2 相比 1.6 版本有多项显著提升。它可以实时处理机器人摄像头的视频流对视频帧完整性的分类准确率接近 60%对关键动作时刻的识别准确率接近 90%。此外它还支持多机器人协同作业并能在任务执行失败时实时感知并在原步骤上重试而无需从头开始整个流程。Q2Gemini Robotics 2 和 Gemini Robotics On-Device 2 有什么区别AGemini Robotics 2 是标准版视觉语言动作模型负责将任务规划转化为具体的机器人动作原理类似于生成式 AI 生成文本或图像。Gemini Robotics On-Device 2 则是它的本地离线版本具有低延迟特性适合在设备端运行无需依赖云端连接。目前这两款模型都仅对小范围测试用户开放。Q3Gemini Robotics ER 2 现在普通开发者可以用吗A可以。Gemini Robotics ER 2 已与 Gemini Live API 集成开发者从今日起即可访问和体验该模型。而另外两款模型——Gemini Robotics 2 和 Gemini Robotics On-Device 2——目前仍处于小范围测试阶段尚未对所有开发者开放。