谷歌 DeepMind 发布了 Gemini Robotics ER 2 模型,将其定位为公司面向机器人的最强具身推理(embodied reasoning)模型。这一发布标志着人工智能在物理世界任务执行层面迈出了重要一步。
ER 2 的核心升级体现在其对连续视频的理解能力上。相较于此前发布的 1.6 版本,Gemini Robotics ER 2 模型具备了通过持续观看视频来追踪自身运行进度并能在出现问题时进行调整的能力。这种基于时间序列的反馈机制,极大地提升了模型在复杂、非结构化环境中的鲁棒性。
从技术实现层面看,Gemini Robotics ER 2 模型展现出高度的工具调用能力。该模型可以原生调用 Google Search(谷歌搜索)或开发者自定义函数,这意味着机器人不再局限于预设的知识库,而是能够结合实时网络信息和外部专业工具来解决问题。
在任务执行流程上,ER 2 的设计旨在消除传统机器人系统中的明显停顿。当Gemini Robotics ER 2 模型处于执行任务状态时,它能够同步推理后续步骤,从而避免了以往“停止 — 思考 — 再行动”带来的可见延迟,使得机器人的操作流程更加流畅自然。
为了适应对实时性要求极高的机器人应用场景,谷歌展示了该模型接入 Gemini Live API(Gemini 实时 API)的双向流式端点。这为那些需要低延迟交互的机器人任务提供了关键的技术支撑。
在实际性能测试中,Gemini Robotics ER 2 模型展现出令人瞩目的指标。例如,在 moment-finding 时刻寻找(关键时刻定位)测试中,ER 2 的准确率达到了 91.3%,平均绝对时间误差控制在了 0.96 秒。此外,在任务进度分类测试中,Gemini Robotics ER 2 的准确率为 57.4%。
除了单机性能的提升,多机器人协作能力是 Gemini Robotics ER 2 模型的重要亮点之一。ER 2 支持多机器人协作,不同类型的机器人可以借助共享语义理解进行沟通和任务交接,这极大地拓宽了其在复杂工业或家庭环境中的应用前景。
谷歌展示了一个具体的协作案例,即Apptronik 的 Apollo 2 与 Franka 的 FR3 Duo 协作的场景。这一演示直观地展示了不同品牌、不同类型的机器人如何通过一个统一的AI大脑进行协同工作。
从可及性角度看,Gemini Robotics ER 2 模型已通过 Gemini API 和 Google AI Studio 面向开发者公开提供,并且已经在 Gemini Enterprise Agent Platform(Gemini 企业智能体平台)中开启了私密预览。这表明谷歌正加速将这一前沿技术推向企业级应用。
背景分析方面,具身推理模型的发展趋势是让AI从纯粹的软件逻辑走向与物理世界的深度耦合。以往的模型更多停留在“知道如何做”,而Gemini Robotics ER 2 模型则更接近于“能流畅地、持续地完成任务”。这种能力的飞跃,预示着机器人自动化将进入一个需要复杂决策链和实时环境适应的新阶段。
影响分析方面,ER 2 的发布对工业自动化领域的影响是深远的。它不仅提升了单个机器人的效率,更重要的是通过多机协作能力,使得原本需要多个专业系统串联才能完成的复杂任务,现在可以通过一个统一的AI层进行调度和优化。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。