看点
Google DeepMind 在 Gemini Robotics ER 2 的官方发布页展示了几种具体机器人任务。最容易看懂的一段,是 Boston Dynamics Spot 听到自然语言要求后移动、操作机械臂并取回爆米花;另一段让 Apptronik Apollo 2 与 Franka F3 Duo 在共享环境中协作。画面有趣的地方不只在机器人终于把东西送到手上,而在于模型要持续判断“现在做到哪一步了”“这一动作算不算完成”“下一台机器人什么时候接手”。
怎么开始
打开官方文章后先跳到 Spot 演示,观察口令、导航、机械臂动作和最终交付之间的顺序。随后看多机器人协作部分,找出任务从一台机器人切换到另一台机器人的时刻。第三遍可以专门观察失败或不确定动作:模型是否重复、暂停、改动作,还是误以为任务已经结束。页面免费阅读,普通读者无需调用API,也不能远程控制官方实验室里的机器人。
AI在做什么
Gemini Robotics ER 2 在这里承担高层大脑,而不是直接输出每个电机的力矩。它接收连续视频、音频或文字,规划多步任务,再把具体运动交给VLA模型、导航接口或机器人API。连续视频让它能跟踪进度、识别关键时刻并在失败后调整。官方还展示了多机器人协作:不同形态的机器人可以通过共享的语义理解完成交接。文章同时说明,这些能力来自受控演示和评测,不能据此推断所有机器人都能在任意家庭环境可靠工作。
门槛与来源
完整观看只需打开Google官方文章,约五分钟,不用注册。开发者若想接入模型,需要Gemini API、Google AI Studio或相关机器人控制接口,这与普通读者观看演示是两种门槛。作者、发布日期、Spot演示、多机器人协作、实时视频进度跟踪和公开可用状态均来自Google DeepMind官方页面。封面远程引用同页官方首图,未下载再托管,也不把实验室演示写成已经量产的家用功能。