先是挂裤子的行为, 极为充分地展现出两个机器人协同合作时行为的精确程度, 精准万分的夹取裤子而后穿过晾衣架, 在交接晾衣架的整个过程当中十分自然, 相当稳定, 未有丝毫多余的颤动。
视频地址:https://mp.weixin.qq.com/s/2AUEhxMflRoXkhAYJmZTHA
需给枕头装上真空袋, 两个机器人的协作水准令人惊掉下巴。其中, 这是一项颇为长程的复杂任务, 同时也是极为典型的家庭应用场景。机器人稳健地达成了自主动作决策, 它把具有弹性的枕头放进透明的真空袋里, 在扶好袋子之际捏紧密封, 最终对准位置进行吸真空操作。当中任何一环出现偏差都不能顺利达成。
值得一提的是, 更具趣味的是, Demo当中的每一个每台机器人, 其所运行的实际上都是同一套策略模型的副本, 它们各自依据自身所观察到的信息来做出判断, 会有谁去进行抓取, 哪一个来予以配合, 何时应当等待, 什么时候需要接手, 而这般的协作行为, 是从同一个相同模式当中自我「涌现」出来的。
这, 与传统多机器人系统, 所依赖的中央控制器统一分工的思路, 不同, 和其同步时钟的思路也不同, 已然是两条, 完全不一样的路线。
技术拆解:Zeno-1 的四阶段训练
能将Zeno-1的核心问题以一句话进行归纳, 那便是: 应如何促使一个模型, 在未被告知队友所想内容的情形下, 自行着手去学会与队友展开配合呢?
视频地址:https://mp.weixin.qq.com/s/2AUEhxMflRoXkhAYJmZTHA
这个问题之所以难,原因有三。
第一, 存在维度爆炸的情况。两台机器人分别拥有各自观测空间与动作空间, 联合状态空间会随机器人数量增加而迅速膨胀, 各个智能体之间的交叉注意计算量呈指数级增长。传统多智能体强化学习, 其做法是在一个中心化模拟器里同时训练所有 agent, 然而这种方式在物理机器人上几乎行不通, 原因在于必需的多机器人同步协作数据以及特权极难获取。
其次, 存在时间累积误差, 两台机器人进行协作, 并非如同下棋那般以回合制交替开展, 而是呈现出连续的、实时的状态, 0.1秒的时序偏差当下或许并无大碍, 然而5秒之后却极有可能致使整个任务走向失败, 误差会随着时间不断累积, 并且不可逆转。
第三位, 是搭档存在不确定性, 于真实场景里, 你的搭档有可能会出现踌躇的状况, 有可能会产生打滑的情形, 还可能会由于观测噪声而做出出乎你意料的动作, 任何假定「搭档会完美执行预设轨迹」的方式都是注定会显得脆弱的, 模型必须要对于搭档行为的改变保持鲁棒性。
四阶段递进训练
第一阶段:学习世界(大规模视频预训练)。
第一阶段的目标是让模型建立对物理世界的广泛先验知识。
在大规模视频数据之上做预训练的 Zeno - 1, 并学习物理世界的基本规律, 物体在遭受力的作用之际是怎样移动起来的, 接触发生之时究竟会产生了些什么样的存在, 柔性物体于其被抓取期间是如何产生形变的, 液体倾倒之际又是怎样流动的?
这一步全然不关乎机器人控制, 模型仿若一个“旁观者”那般, 去观察诸多真实世界的物理交互视频, 于其中挑选出运动、接触、形变、因果等普适物理先验。这些先验知识给后续阶段奠定了基础, 模型无需从零基础去学习“物体会掉落”或者“用力过大会把东西推翻”, 并且这些常识于预训练阶段就已然被编码进去了。
第二阶段:学习自身(单体具身训练)。
由视频预训练所获取的物理直觉具备普遍性, 然而却无法径直促使特定的机器人切实执行动作以达到某种效果。在第二阶段, 会把这些具有全般通用性的先验知识落实到专门特定的机器人本来身子结构上, 从而引导后续行动。
于这一阶段之时, 单台的机器人于真实的环境里展开训练, 把预先训练而获得的视觉 - 物理先验变换成具体的感知 - 决策 - 执行能力。模型得以学会从自身的视觉观测以及本体状态之中提取任务相关特征, 并且将其映射为连贯的全身动作序列。
在经历这一阶段之后, Zeno - 1, 作为单体, 已然具备了诸如灵巧操作、工具使用以及移动交互等方面的基础能力。
「先成为一个称职的个体,然后才有资格谈协作。」
第三个主要进程阶段当中, 存在着这样一种情况, 即学习协作, 对了也就是闭环伙伴交互, 英文表述为Closed-loop partner interaction, 简称为CPI。而所有这些情况呢, 其实就是Zeno - 1被认定为是最最为重要至关关键的核心创新之处了。
视频地址:https://mp.weixin.qq.com/s/2AUEhxMflRoXkhAYJmZTHA
先收集大量多机器人协作的演示数据, 走传统路径, 接着用监督学习去模仿, 然而这条路几乎走不通, 因为你很难使两个真实机器人在真实环境里大规模生成高质量的协作数据, 成本不允许, 效率也不允许。
CPI有着全然不一样的思路, 它致使两台处于分割分开状态独立运行的机器人彼此成为训练搭档, 每一台机器人依据自身的观测独自展开行动, 并且它的动作会使共享的物理环境发生改变, 进而对另一台机器人接下来的决策产生影响。
需要特别指出的是, 在 CPI 训练里, 搭档自身是一个处于学习过程中的自主体, 其行径自然而然呈现出多种不完美: 偶尔速度较快、偶尔速度较慢、偶尔出现失误。模型于训练进程中见识过数量众多的搭档行为偏差范例。所以, 模型对于延迟便拥有了鲁棒性。
在我们怀着特定意图去对协作机器人的动作时序施以致扰的情形下, Zeno-1 的部署鲁棒性显著地得以展现。哪怕是遭遇到那种会致使基于同步演示开展训练的策略快速丧失效用的延迟状况, Zeno-1 依然能够维持协调协作。
借助 CPI 训练, Zeno-1 掌握了一系列特定的协作适应行为, 这些行为包括减速、等待、让步、维持接触、重新校准时序, 之后在交互再度变得兼容时恢复正常节奏, 并且这些行为完全自闭环交互里自发涌现出来。
第四阶段:协作失败的针对性纠正
在实际的真实部署里, 对机器人的协作进程予以观察, 从中辨别出协作出状况的关键时间点, 随后, 让操作员依据这些关键时间点, 给出具有纠正性质的演示情况, 而这些演示情形会被补充进训练数据内。
在于最后一步的关键机制, 呈现出的状貌却是,模型并非以均匀的态势涉猎所有经验, 但它能在协作极容易出错的地方, 投入更为大量的学习资源, 此为其独特之处。

在协作适应进程里, 提升闭环伙伴交互的占比, 其协作表现明显比增添相同数量同步多机器人演示数据的成效要好得多。
具体而言,训练过程如下:
视频地址:https://mp.weixin.qq.com/s/2AUEhxMflRoXkhAYJmZTHA
两台机器人于持续交互期间共同进化, 机器人借由切实的协作去学习协作, 并非借助观看人类演示来模仿协作?
两个关键子系统:持久交互记忆与预测式内省
我们于演示视频之中发现, 机器人可顺利达成颇为长程的任务, 这意味着, 在 CPI 之上, Zeno-1 存有两个能使长时间协作得以实现的子系统。
Zeno-1 机器人长程任务演示https://mp.weixin.qq.com/s/2AUEhxMflRoXkhAYJmZTHA
持续的交互性记忆是这样一种记忆, 它具有持久性, 并且是交互性质的, 被称为持久交互记忆。
通常, 多机器人的协作任务会跨越数分钟, 甚至会超过十分钟以上。在这样的时间尺度范围之内, 纯粹的反应式策略会致使大量关键上下文丢失掉。
Zeno - 1 借助一个能够学习的记忆模块把这个问题给解决掉, 这个模块对每个时间步予以更新, 维持一个经过压缩的交互历史表征, 它编码了三类信息。
经过消融实验可知, 持久记忆对于时长超过3分钟的协作任务而言是极其关键的。当把这个模块移除之后, 模型在长时序任务方面的表现出现了明显的退化。
不具备持久交互记忆的机器人, 那就是纯粹的「金鱼」记忆, 它每走一步, 都要从零点开始去判断当下的局势, 没办法把已经积累起来的交互经验沉淀下来。
预兆式自我审视, (Predictive Introspection)。
一个机制致使Zeno - 1, 于执行动作以前, 先在其脑海之中将相关内容过一遍, 具体而言, 分成两个层面。
从搭档交互方面来讲, 某一个动作, 在局部范围去看, 或许是最为优良的, 然而, 要是这个动作致使搭档处于不利的状况之下, 就团队的整体维度而言, 那则是次一等优良的。
Zeno - 1会评定每个候选动作对对合作者接下来行为的或许影响。依据技术报告里在留存测试集上的评定数据:
「为搭档着想」不只是锦上添花,而是协作质量的关键决定因素。
于物理接触这一层面, Zeno - 1内置了一个行动条件世界模型, 即Action - Conditioned Latent World Model, 它能够对执行某一动作之后共享物理状态会朝怎样的方向演变予以预测。
它的核心功能体现为在动作开展之前, 去辨别有可能出现的失败情况, 这些情况包括抓取出现失误, 出现滑动现象, 抓握状态不稳定, 以及物体受到扰动。
研究团队进行测试, 测试是在200次真实机器人实验中, 这个世界模型在0.5秒预警窗口内, 对接触失败做出预测, 其预测的AUC达到0.94, 然而, 仅是基于当前观测来预测, 其AUC为0.81。
Zeno-1 能在接触前 0.5 秒预判即将发生的故障。
简单来讲, 它具备预防协作失误的能力。Zeno - 1能够在开展行动以前, 同步去思考「这个动作究竟对搭档有着怎样的影响好还是不好」以及「这个动作在实际物理情境当中到底是否会遭遇失败」。
1+1>2,多机器人协作的起点
机器人彼此之间的协作, 看上去好像能够进行统一控制, 然而芝诺为何要坚决维持去中心化呢, 缘由存在于两个方面。
这个特性具备很强实用性, 你并非要一次性去部署一整个完整的机器人团体, 而是能够依据需求, 一台一台地逐渐增添产能。
于现实世界当中, 大量的工作在天然层面呈现出需凭借配合方可达成的状况。腾讯云开发者社区所发布的一篇行业分析明确指出, 到2026年下半年的时候, 具身智能正迈进「柔性工站重构」的阶段: 哪怕单台机器人具备再强的工作能力, 一旦遭遇那种需要多个工位协同作业的产线, 依旧会陷入毫无办法的困局之中。
机器人之间靠什么协调?答案是:物理世界本身。
于Zeno - 1的技术路线里, “共享的那个物理世界自身就是协调接口”, 每一台机器人借由观察周遭环境以及别的机器人的行动, 判定任务进展情况、领会协作情形, 并且依据这些来调整自身接下来的动作, 协调并非再全然依靠显式通信以及统一调度, 而是于真实世界源源不断的交互当中自然生成。
学术界同样已然着手朝着相仿方向予以推进, 今年6月, 斯坦福的Chelsea Finn、Jeannette Bohg的课题组亮出一篇称作CHORUS的方法, 给出了基于单一VLA policy的去中心化多机器人协作。
产业界也已然将collaboration当作下一阶段极为关键的一种能力了。Figure的Helix 02明确展现出multi-robot collaboration, Google DeepMind的Gemini Robotics 2也着重突出了这点, 由此表明协作正逐步汇入机器人基础模型的核心能力范畴了。
由此浮现出一个趋势, 这个趋势正变得越来越清晰, 那就是机器人基础模型正从单体能力进一步迈向协作智能。
芝诺一号至少验证了一件事, 这件事是协作物理智能能够在单一去中心化策略当中最终得以实现。
一台机器人会做得出来且终将是作用受限的任务是多少得视情况论。在机器人切切实实地学会去观察旁边处的彼此, 懂得彼此的所做所想, 并且能够如同并肩共事的从业者一样, 能一起去完成工作, 这个时候, 1加上1才开始切实地大于2, 整个机器人这一行业的能力所能达到的最高界限也将会跟着被打开。
看得远一点,一个大量机器人参与的文明世界正在向我们招手。