AI很好玩
← 回到摸得到的 AI
摸得到的 AI

Alter3:大模型接管身体后,机器人开始自己比划

Alter3

研究团队把 GPT-4 与 43 轴人形机器人连接,让模型根据语言编写身体动作代码,探索无需为每个动作逐帧编排的身体表达。

上手时间5 分钟上手
费用免费

一分钟速览

Alter3 是东京大学团队研究的 43 轴人形机器人。传统机器人表演常要工程师逐个关节、逐段时间编动作,这个项目让 GPT-4 根据自然语言生成控制代码,再由机器人执行“自拍”“喝茶”“假装幽灵”等身体表达。它的意义不是机器人突然有了灵魂,而是大语言模型把对动作的文字理解翻译成了可见的身体运动。

普通访客可以在官方项目页看多段完整演示并阅读论文,但不能在线发指令遥控 Alter3。把它当成一场“语言模型第一次得到身体”的研究录像,会比寻找试玩入口更准确。

先这样开始

  1. 打开官方项目页,先看金属乐、幽灵、自拍和喝茶等不同动作视频。
  2. 每段先只读动作名称,猜模型会怎样表达,再播放结果比较你的身体想象与机器的选择。
  3. 看页面中的系统结构图,找到自然语言、GPT-4、代码与 43 个执行轴之间的顺序。
  4. 最后读论文的反馈与动作记忆部分,理解失败动作如何由人用语言指出并保存修正。

值得观察的细节

最值得盯的是模型如何把抽象词拆成身体部件。比如“像幽灵”并没有标准关节答案,模型可能同时使用手臂、头部和躯干来拼一个文化上常见的姿势。动作看起来滑稽时,不一定只是机械精度差,也可能是语言模型对身体常识的理解很粗糙。

同一个指令还可能产生不同代码和动作,这种非确定性给表演带来意外,也给实体安全与复现带来挑战。研究团队因此加入反馈和动作记忆,而不是让每次结果都无条件执行。

AI 在做什么

GPT-4 接收动作要求,并生成调用机器人关节接口的代码。论文说明系统面向 43 个执行轴,不需要人为给每个示例预先编完整动作。人类可以观察结果,用自然语言指出问题;修正后的动作会保存到 JSON 形式的动作记忆中,供之后复用。

模型本身不能像人一样看见动作造成的全部物理后果,反馈依赖外部观察者。它也没有凭空获得平衡、触觉或安全常识,所以“模型接管身体”是方便理解的标题,不代表它拥有完全自治。

实际门槛

项目资料和论文免费,不需注册;演示视频由外部视频服务承载,在中国大陆可能无法稳定加载。没有公开下载的控制面板、远程机器人或购买页面。完整硬件实验只属于研究团队的设备环境。

如果视频打不开,论文摘要、系统图和页面文字仍能说明机制,但无法替代观看实际动作。本站因此把访问状态标为不稳定,也不会把“页面可打开”冒充“核心体验已在大陆跑通”。

来源与核验

项目日期、研究成员、演示视频和系统结构来自 Alter3 官方研究页;43 轴、代码生成、非确定性、语言反馈及动作记忆来自论文 arXiv 2312.06571。封面来自 2025 年开放获取论文 Figure 2,连续展示 Alter3 自拍、扮鬼和演奏金属乐的动作;论文按 CC BY 许可,本站保留作者与期刊署名。

中文导游没有把论文原型外推成量产机器人,也没有声称 GPT-4 可以观察并独立修正所有物理后果。可核验的是语言到代码再到动作的链路,以及团队展示的具体示例。

本条目由 xiaojiao 老板在内容后台完成审核并公开。

这个项目好玩吗?

匿名反馈只用来校准选题,不建立用户画像,也不公开小样本票数。