Transformer 已经统治大语言模型(LLM)整整九年。从 2017 年 Google 发布论文《Attention Is All You Need》算起,这种神经网络结构几乎成为了每一款主流模型的底座。Subquadratic 公司 CEO Justin Dangel 评价说:“Transformer 是计算机科学史上最重要的创新之一,它改变了世界。”

但眼下,Transformer 正在显露疲态。推理模型的出现、超长上下文的需求、动辄数千瓦的算力消耗,本质上都只是在给同一套架构打补丁。越来越多的研究者开始追问:下一代模型的底座会是什么?《麻省理工科技评论》(MIT Technology Review)在 2026 年“10 件影响 AI 的事”中,将这批未来模型称为 LLMs+。一批初创公司正试图从四个方向发起挑战。
方向一:改造注意力机制
Transformer 的核心是“稠密注意力”(dense attention):文本中的每个词都要和每个词做乘法。一篇一万词的文档,可能要消耗 5000 万次乘法。这正是 LLM 能耗惊人的根源。
稀疏注意力(sparse attention)的思路很直观:只计算部分词之间的关系,而不是全部。但多年来,稀疏注意力的语义理解能力始终追不上稠密注意力。
迈阿密的 Subquadratic 声称打破了这一僵局。其模型 SubQ 会动态判断哪些词重要、哪些不重要,在搜索和编程等任务上已能比肩主流 LLM。公司表示已有数千人加入等待名单,并计划尽快开放。旧金山另一家初创公司 Manifest AI 走得更远:它完全用“能量保持”(power retention)机制替代了注意力,只保留与当前任务最相关的滚动摘要,声称可将现有开源编程模型 StarCoder 改造成 PowerCoder,并在 Qwen 级别任务上取得相近表现。
方向二:把模型做得更小、更灵活
MIT 衍生公司 Liquid AI 没有彻底抛弃 Transformer,而是把自己的“液态神经网络”(liquid neural networks)与之混合,推出 LFMs(liquid foundation models)。创始人 Ramin Hasani 透露,最新模型中 Transformer 仅占 20%,液态网络占 80%,且这一比例由公司自研的“设计 AI”自动搜索得出。
液态神经网络的灵感来自蠕虫大脑,优势在于运行时可以持续适应新信息,而不像 Transformer 那样训练完成后行为就固定。结果是:Liquid AI 的模型能在售价 50 美元的树莓派上运行,且体积只有竞品的四分之一,却能在 Qwen、Gemma 等基准上追平四倍大的模型。戴姆勒(Mercedes)已在车辆小芯片上部署其方案。
方向三:一次性生成整块文本
当前几乎所有 LLM 都是逐词生成。但对计算机来说,更便宜、更快的方式是整句甚至整段同时输出。这就是扩散模型(diffusion)的思路。
总部位于加州帕洛阿尔托的 Inception 正把图像/视频生成中常用的扩散技术用于文本。其 CEO Stefano Ermon 是斯坦福教授,2024 年与同事解决了扩散模型处理文本的数学难题,并在 GPT-2 级别的模型上验证:速度提升 10 倍。Inception 最新模型 Mercury 2 号称在部分任务上已接近 OpenAI GPT-4 水平,速度仍是 10 倍。Google 也在跟进,推出了原型 Diffusion Gemma。
方向四:跳出语言本身
Pathway 可能是这批新公司中最激进的一家。它的模型名为 Dragon Hatchling,用“状态空间”(state space)替代注意力,把信息压缩成更抽象的表征,而非逐词编码。
最引人注目的结果是一道刁难所有主流 LLM 的测试:超过 25 万道高难度数独。Dragon Hatchling 解开了 97% 以上,而多家顶级实验室的模型一题未解。CEO Zuzanna Stamirowska 认为,Transformer 强行用语言完成一切推理,但人类下棋、做数学时的“灵光一闪”并不发生在语言里。如果模型只能在语言中思考,就永远到不了真正的创新。
谁会笑到最后?
这四条路线未必互相排斥,也未必都能成功。但它们共同指向一个判断:规模竞赛不是 LLM 的唯一出路。在算力成本逼近万亿美元、数据中心耗电量 2030 年可能翻倍的背景下,效率、结构与推理范式的创新,或许比单纯堆参数更重要。
来源:MIT Technology Review







