AI模型不说话也能互通,中国两款开源模型合体降本95%

一家名为 Mostik 的初创公司提出了一种颇为激进的做法:让不同的人工智能模型跳过文字,直接用彼此权重里的数值交流。《连线》杂志 9 月 2 日在 Will Knight 的 AI Lab 专栏中披露了这家公司的技术路线。

Mostik 在俄语中意为”桥”,这个名字直指其核心思路——在两个模型之间架一座桥。权重是决定一段提示词如何被转换成输出结果的数值参数,Mostik 的方法就是让两个模型通过权重中的数学值直接互通。落到实际效果上,大模型的能力可以被更高效地传递给小模型,从而快速抬高后者的智能水平。

演示对象是两款中国开源模型

用这套方法,Mostik 训练出的模型已经登顶 ARC-AGI 3 排行榜——这是一项以难度著称的模型能力评测。由于比赛仍在进行,团队拒绝透露更多细节。

不过为了公开演示这一思路,Mostik 另外搭了一座桥,两端接的都是中国的开源权重模型:一端是参数量 7530 亿的 GLM-5.2 最大版本,另一端是能跑在手机上的 40 亿参数版 Qwen-3.5。桥接出来的混合系统,成本仅为完整 GLM 模型的二十分之一,也就是降低约 95%,而性能恰好落在大模型与小模型的正中间。

“机器学习领域众所周知,模型集成的表现优于单个模型。”Mostik 首席执行官 Sasha Malysheva 说,这套方法正是由她开发。公司内部流传着一个说法:AI 的未来类似于猜一头猪的体重——数学圈子里有个常识,一群随机的普通人只要把各自的猜测汇总平均,往往比一位专家猜得更准。把多个 AI 模型的输出合起来用,道理相通。

省掉”生成文字”这道关

问题在于成本。传统的集成做法通常是把一个模型的输出当成提示词喂给下一个模型,这既费时间也费钱。Mostik 的做法绕开了生成文字这一步,让模型之间不出声地完成交流。

如果这条路走通,开源权重模型的价值会被明显放大,它们与 Anthropic、OpenAI 等前沿实验室的闭源专有模型竞争时也会更有底气。

Malysheva 认为,把大量不同模型组合起来,可能比一味做大单个模型更有前途。”我个人不认为未来会出现单一的整体模型,也不认为模型的能力会来自规模扩张。”她说。

“如果 Mostik 能让前沿模型与领域专用模型配对——比如生物学、物理学等等——那么会有更多专用模型被训练出来。”AI 软件公司 Lovable 的技术负责人 Vladimir Arustamian 说。他认识 Mostik 团队,”这个团队才做了几个月,就已经跑出了我原以为还要好几年才会出现的东西。”

曾在 Google DeepMind 任职的计算机科学家 Karl Tuyls 熟悉这家公司的技术。他表示,Mostik 的方法意味着”无需让大模型承担整个流程,就能接近大模型的质量;只要旁边跑一个较小的模型,就能获得可观的提升”。在他看来,对任何需要尽可能高效运行模型的人来说,这个方法几乎不必犹豫。

数学语言仍然缺位

Mostik 的首席科学家是日内瓦大学教授、2010 年菲尔兹奖得主 Stanislav Smirnov。他坦言,要在两个 AI 模型之间找到共同基础出乎意料地困难,”目前似乎还没有合适的数学语言”。在这套语言出现之前,Mostik 的方法就是一座字面意义上的桥。

Smirnov 还认为,这项工作或许能揭示 AI 模型的真实运作方式,以及它与人脑机制的异同;更深入的数学分析可能会发现,AI 模型与人类在面对难题时的推理方式存在某种共性。

Malysheva 的数学天赋则是被激出来的。她提到,哥哥当年告诉她解不出他正在做的数学奥林匹克题目,几年后她考进了圣彼得堡最好的学校之一。后来她提出权重桥接的构想时,一些同行也警告说太难、做不成,”他们说这对一个年轻女孩来说可能太难了”,她说,”我决定证明他们错了。”