AMD 买下一家怪公司:把模型刻死在芯片里

你见过把 AI 模型直接”焊死”在芯片上的做法吗?8 月 6 日,AMD 宣布收购多伦多初创公司 Taalas,这家公司专攻一种极端的 AI 推理方案——不靠通用 GPU,而是把模型权重直接蚀刻到硅片上。测试数据显示,其首代芯片运行 Llama 3.1 8B 模型的速度达到每秒 16,960 个 Token,是同期英伟达 GPU 的 48 倍。

Taalas 的技术路线在业内被称为”模型专用集成电路”(MSIC)。传统 GPU 靠高带宽内存(HBM)存储模型权重,每次推理都要从内存反复读取;Taalas 则把权重直接烧进芯片的掩模只读存储(Mask-ROM)区域,省掉了绝大部分数据搬运开销。其芯片由两个核心区域组成:掩模 ROM 存储固定权重,高速 SRAM 存储 KV 缓存和微调适配器。

说白了,这是用灵活性换极致性能的赌注。一旦芯片出厂,上面跑的模型就锁死了——想换模型就得重新流片(重新设计光罩)。不过 Taalas 称,更换模型时只需修改两层金属布线,成本和时间远低于从头设计新芯片。

这笔交易发生在英伟达以 200 亿美元收购 Groq 仅仅七个月之后。两家公司的思路有相似之处——都瞄准低延迟、高吞吐量的”高级推理”市场,也就是 AI 智能体、代码助手这类对首字延迟极其敏感的应用场景。但 Groq 走的是数据流架构路线,而 Taalas 走的是更激进的”模型固化”路线。

AMD 方面没有披露交易金额。Taalas 自 2023 年成立以来累计融资 2.19 亿美元,创始团队来自 AMD 和 Tenstorrent 的前员工。AMD 计划将 Taalas 技术整合进 Instinct GPU 产品线,采用解耦架构:复杂的前端提示处理交给 GPU,高频 Token 生成交给 Taalas 加速器。

这意味着什么?如果 Taalas 的技术能在量产中兑现承诺,AI 推理的成本结构可能被重写——不是比拼谁买了更多 GPU 卡,而是比谁能把最常用的模型”固化”下来、以最低成本持续输出 Token。对正在评估推理基础设施的企业来说,值得密切关注这条技术路线的后续进展。

来源:The Register / AMD 官方新闻稿 / 网易科技