一枚芯片出厂时,模型权重就已经被物理蚀刻在硅片里,改都改不了——听上去像是自断退路,但它跑 AI 推理的速度,是英伟达 GPU 的 48 倍。

8 月 6 日美股收盘后,AMD 宣布已与加拿大 AI 芯片初创公司 Taalas 签署最终收购协议。交易金额未披露,需通过监管审批,预计在第四季度完成交割。据 The Register 了解,这是一笔实打实的收购,而非只挖团队的「人才收购」。
不用显存,把权重直接烧进硅片
Taalas 成立于 2023 年,总部位于加拿大多伦多,累计融资约 2.19 亿美元。它的技术路线与主流方案完全不同:无论是常规 GPU,还是 Groq、Cerebras 那类数据流架构加速器,模型权重都存放在高带宽内存里,芯片运行时反复读取——数据在内存与计算单元之间来回搬运,带来功耗、延迟和封装成本。
Taalas 的做法是把权重直接蚀刻进硅片。从结构上看,它的芯片由两个区域构成:存放模型权重的掩模只读存储区,以及承载键值缓存和微调适配器的静态随机存储区。这类芯片本质上是「模型专用集成电路」,一颗芯片只服务一个模型。
这套方案并非停留在纸面。今年 2 月,Taalas 发布了首款测试芯片 HC1,采用台积电 6 纳米工艺制造。初步基准测试中,它运行 Meta 的 Llama 3.1 8B 模型达到每秒 16960 个词元——按当时的对比口径,这一速度是英伟达 GPU 的 48 倍、Cerebras 加速器的 8.5 倍。Llama 3.1 以今天的标准看已属老模型(2024 年年中发布),这枚光罩尺寸的芯片主要目的是验证概念可行。
第二代 HC2 芯片计划于今年夏季推出,单芯片参数量目标提升至 200 亿。这个数字听起来不大,但与 GPU 一样,权重可以通过流水线并行分散到多颗芯片上。按每颗 200 亿参数计算,支撑一个万亿参数模型只需 50 颗加速器——而 AMD 恰好拥有机架级计算平台和自研系统设计团队。作为对照,英伟达近期发布的 LPX 系统跑同等规模模型,需要数十颗 GPU 外加至少 2000 颗 Groq 加速卡。
AMD 的算盘:GPU 处理提示词,专用芯片吐词元
据了解,AMD 打算把基于 Instinct 的 Helios 机架与 Taalas 技术芯片配对,构成一套解耦架构:计算密集的提示词处理交给 GPU,词元生成任务卸载到 Taalas 加速器。另一种可能的模式是形成「验证—迁移」的迭代节奏,客户先在 Instinct 加速器上部署调试模型,确认效果后再迁移到 Taalas 芯片。
AMD 人工智能高级副总裁 Vamsi Boppana 在声明中表示:「AMD 正在构建全栈 AI 平台,让客户能够为每一种 AI 工作负载灵活选择合适的计算方案。」
这笔交易的背景,是行业竞争焦点正从训练转向推理。过去几年芯片厂商比拼的是谁能连接更多 GPU、提供更大显存和更高集群带宽;随着模型进入实际业务,推理变成了持续发生、反复计费的负载,客户开始追问每个词元的成本、响应延迟和数据中心功耗。这笔收购距离英伟达与 Groq 达成 200 亿美元交易仅隔约七个月,也印证了推理芯片已成新战场。
AMD 近年在这条线上动作密集:2024 年以 6.65 亿美元收购模型开发商 Silo AI、以 49 亿美元收购服务器厂商 ZT Systems 为 Helios 机柜奠基,此后又拿下推理软件公司 MK1;今年 6 月收购内存优化公司 MEXT,7 月与 Cerebras 达成合作。财务上也支撑得起:AMD 第二季度营收 115 亿美元、同比增长 50%,其中数据中心业务 67 亿美元、同比增长 107%,占总营收的 58%。
代价:芯片一旦流片,就跟这个模型绑死了
速度虽快,代价也很直白——芯片部署后就被锁死在那个模型上。任何超出 LoRA 适配器级别的改动,都需要重新流片,既贵又耗时。生成式 AI 热潮进入第四年,新模型几乎按月迭代,要享受这项技术红利,客户必须对自己的模型选择有十足把握。
不过据 Taalas 说法,情况没那么糟:换新模型虽需重新流片,但不必从零开始,只需改动两层金属,成本和周期都低得多。今年 2 月该公司曾对科技媒体 The Next Platform 表示,把模型权重蚀刻进硅片的开销,比训练一个前沿模型低 100 倍。
The Register 判断,这项技术的主要用户会集中在模型开发商、其基础设施供应商,以及少数推理服务商。AMD 在这方面有谈判优势:OpenAI、Anthropic 和 Meta 都是 Instinct 的重要客户,未来看到某个 GPT 或 Claude 跑在 Taalas 与 Instinct 的混合方案上,并不令人意外。
这项技术还可能反向影响模型开发。开发者压制幻觉的手段之一叫「测试时扩展」,做法很简单——让模型在回答前多「想」一会儿。缺点是消耗大量词元,既费钱又让用户等更久。如果 Taalas 能把单位词元成本压下来、把输出速度提升 10 倍到 20 倍,模型开发者或许会选择把推理时间拉得更长。
AMD 首席执行官苏姿丰此前多次表示,AI 芯片市场不存在「一种芯片通吃所有应用」的情况:GPU 凭通用性仍会占据大部分份额,因为它能支撑不断演进的新模型;但不同场景也需要更专业化的加速器共同构成完整生态。Taalas 补上的,正是最靠近专用计算的那一端。
来源:The Register







