AI很好玩
← 回到脑洞实验室
脑洞实验室

机器人开始组队干活:Gemini一边看视频一边指挥

Introducing Gemini Robotics ER 2

Google DeepMind 的实体机器人演示:模型持续看视频判断进度,让 Spot 按口令取零食,也让不同机器人协作完成多步任务。

上手时间5 分钟上手
费用免费
打开原作 →

看点

Google DeepMind 在 Gemini Robotics ER 2 的官方发布页展示了几种具体机器人任务。最容易看懂的一段,是 Boston Dynamics Spot 听到自然语言要求后移动、操作机械臂并取回爆米花;另一段让 Apptronik Apollo 2 与 Franka F3 Duo 在共享环境中协作。画面有趣的地方不只在机器人终于把东西送到手上,而在于模型要持续判断“现在做到哪一步了”“这一动作算不算完成”“下一台机器人什么时候接手”。

怎么开始

打开官方文章后先跳到 Spot 演示,观察口令、导航、机械臂动作和最终交付之间的顺序。随后看多机器人协作部分,找出任务从一台机器人切换到另一台机器人的时刻。第三遍可以专门观察失败或不确定动作:模型是否重复、暂停、改动作,还是误以为任务已经结束。页面免费阅读,普通读者无需调用API,也不能远程控制官方实验室里的机器人。

AI在做什么

Gemini Robotics ER 2 在这里承担高层大脑,而不是直接输出每个电机的力矩。它接收连续视频、音频或文字,规划多步任务,再把具体运动交给VLA模型、导航接口或机器人API。连续视频让它能跟踪进度、识别关键时刻并在失败后调整。官方还展示了多机器人协作:不同形态的机器人可以通过共享的语义理解完成交接。文章同时说明,这些能力来自受控演示和评测,不能据此推断所有机器人都能在任意家庭环境可靠工作。

门槛与来源

完整观看只需打开Google官方文章,约五分钟,不用注册。开发者若想接入模型,需要Gemini API、Google AI Studio或相关机器人控制接口,这与普通读者观看演示是两种门槛。作者、发布日期、Spot演示、多机器人协作、实时视频进度跟踪和公开可用状态均来自Google DeepMind官方页面。封面远程引用同页官方首图,未下载再托管,也不把实验室演示写成已经量产的家用功能。

这个项目好玩吗?

匿名反馈只用来校准选题,不建立用户画像,也不公开小样本票数。