机器人拿香蕉当扫帚:看一段视频就学会干活

在马萨诸塞州剑桥市,一家名为 Generalist AI 的机器人创业公司向《连线》(WIRED)记者威尔·奈特(Will Knight)展示了一批机械臂。这些机械臂完成堆杯子、把方块放进碗里之类的简单家务,做法却和传统机器人完全不同——它们只看了一段简短的教学视频,没有接受针对该项任务的专门训练。

刷子被拿走,它改用簸箕

最具代表性的一幕出现在清扫演示中。机器人被要求用簸箕和刷子把一个方块扫进碗里。当研究人员把刷子从场景中拿走之后,机器人没有停下,而是把簸箕当作刷子使用,直接将方块拨进了碗中。

另一次未经安排的测试里,工作人员在机器人面前放了一根香蕉。机器人选择用这根香蕉充当扫具,把物品归拢起来。Generalist AI 方面表示,这并不是预先编写好的响应逻辑。研究人员自己也多次对机器人做出的选择感到意外。

抓不住钞票就换一只手

双臂机器人的表现同样引人注意。它先观看了一段人类拉开手袋拉链、从中取出钞票的视频片段,随后被换上另一种款式的手袋,要求完成同样的任务。

机器人拉开了拉链,试图取出钞票。在右侧夹爪始终抓不稳的情况下,它切换到左侧夹爪,重新寻找角度,最终把钞票取了出来。”哈,”现场一位工程师说,”它以前从没这么干过。”

这个细节的意义在于:机器人并没有机械复刻视频中的动作序列,而是把动作迁移到了不同的物体和情境上。

Generalist AI 联合创始人、首席执行官皮特·弗洛伦斯(Pete Florence)把这种能力类比成语言模型的一次跨越。”这正是当年人们对 GPT-3 感到兴奋的那类事情,”他提到 OpenAI 2020 年发布的这一模型时说,”你可以拿着那个模型,直接提示它去做一件新任务,它真的有机会做成。”

数据从”手套”里来

传统上,训练一台 AI 驱动的机器人掌握不同任务,意味着向模型里灌入成千上万条示范数据。这种学习方式的缺陷广为人知——哪怕只是改变光照条件这样简单的变量,机器人就可能完不成任务。

Generalist AI 和另外几家机器人创业公司押注的方向是由人类来训练一个通用机器人模型。这家公司自制了一种形似机械夹爪的特殊手套,上面装有摄像头,由人戴着去完成各种家务,以此采集物理交互数据。《连线》记者在现场看到一个板条箱里堆放着几百个这样的夹爪,准备发往墨西哥等地的工作人员手中。

弗洛伦斯团队对具体的训练配方讳莫如深,但称公司已经积累了大量高质量训练数据。与部分同行不同,Generalist AI 的 AI 模型完全从零自研,没有以开源语言模型作为底座。

公司的技术路线明显指向对物理世界规律的理解,思路上受到人类幼年阶段就具备的物理直觉的启发。这或许可以解释模型为何能把一个场景中学到的东西迁移到另一个场景——现场部分演示的观感,确实接近儿童在看过一次示范后自行摸索和试验的过程。

同行评价与融资背景

熟悉 Generalist AI 工作的佐治亚理工学院机器人学者徐丹飞(Danfei Xu)认为,这家创业公司在追求通用机器人模型的一众公司中很突出。”他们把这条路推到了极致,执行得非常好。”除了采集大量高质量数据,他补充说,”他们是优秀的机器人专家,做的科研也确实过硬。”徐丹飞还表示,从已公开的演示看,这家公司的目标是把机器人部署到真实商业场景中,”他们是最接近可部署状态的。”

同样了解这家公司的斯坦福大学机器人学者刘凯伦(Karen Liu)评价道:”Generalist 的数据方法是大规模采集物理交互数据,同时不把数据过度绑定在某一种特定机器人上。他们目前最强的那些结果说明,这个赌注可能正在奏效。”

资本市场此前已经给出回应。这家 2024 年成立的公司在今年 6 月宣布完成 4 亿美元融资,由 Radical Ventures 领投,投后估值达 20 亿美元,累计融资超过 5 亿美元。英伟达旗下 NVentures、Bezos Expeditions、NFDG 等既有股东继续跟投,8VC、Union Square Ventures、Hanabi Capital、Norwest 为新进机构。天使投资人名单中出现了李飞飞、纳瓦尔·拉维坎特(Naval Ravikant)、小米联合创始人林斌等名字。公司先后在 2025 年 11 月发布 GEN-0、2026 年 4 月发布 GEN-1 两代具身基础模型。

59% 与 99% 之间的距离

值得强调的是,Generalist AI 自己也承认,模型的即时学习能力目前还远谈不上可靠。按照公司说法,机器人平均只有约 59% 的概率能完成一项刚被演示过的任务。而要真正投入实际部署,成功率需要提升到 99% 以上。这些能力究竟能在多大范围的任务和环境中泛化,同样尚无定论。

换个角度看,59% 这个数字对应的是”看一段视频、零专门训练”这一最苛刻的条件,与该公司此前宣称 GEN-1 在特定任务上经过少量数据微调后可达到的可靠性水平并非同一指标。物理智能仍是机器普遍欠缺的能力,而婴幼儿高效认识世界的方式,可能给 AI 研究者提供了值得借鉴的线索。