用视频理解、任务编排与多机器人协作赋能机器人
核心亮点
与同日发布的 Gemini Robotics 2 互补,Gemini Robotics ER 2 把重心放在「先想清楚,再决定怎么做」。它是面向具身推理的机器人基础模型,不直接产出关节动作,而是理解场景、规划步骤、选工具,把复杂任务拆成可逐步执行的方案。说白了,Robotics 2 是「手和脚」,ER 2 是「脑和眼」——一个执行,一个推理,本为搭档而生。
具体能力
ER 2 的最大提升在视频理解:它能从演示视频读懂「人做了什么、为何这样做」,把观察转成可复用任务表示,不必每次人工示教。工具编排上,它能判断需要榔头、螺丝刀还是夹爪,规划使用顺序与姿态,让机器人像人一样临时组合工具。多机协作则让多台机器共享任务的空间与语义理解,把「一起干活」升级为有逻辑的分工。
技术细节
ER 2 基于 Gemini 大模型构建,把语言与世界知识注入感知与规划。训练强调「视频即示教」,用大量人类操作视频让模型从观察推断意图与因果,面对新物体、新布局也能泛化。与纯 VLA 动作模型不同,ER 2 输出更接近结构化计划与约束,再由下层执行器(如 Robotics 2)落地。这种「先推理、后执行」分层让出错时有清晰干预点,也便于人类审核每步决策。
与竞品对比
相比直接输出动作的端到端方案,ER 2 把「推理」显式独立,更适合长链条、需临场判断的任务。与只做识别或单纯视频理解的模型相比,它把理解直接连到「下一步该干什么」,形成从看到想的闭环。简单说,它不追求一次把动作做完美,而是把问题想明、工具用对,再交执行层打磨。这让它特别适合非结构化、多变的真实环境。
行业影响
对行业而言,ER 2 代表趋势:机器人「智能」正分化为推理与执行两层,各自迭代。企业可先用 ER 2 规划复杂工序,再对接不同厂商执行器,避免被单一软硬件栈绑定。对需人机协作的产线、仓储与家庭场景,会思考的机器人意味着更少示教工时与更高弹性。说白了,当机器人能自看视频学、自选工具、自分工,部署 AI 工作流的门槛与成本都会明显下降。