当各大科技公司还在比拼谁的AI模型参数更多、能力更强时,谷歌已经把目光投向了更底层的问题——如何让大模型跑得更快、更省电。据《The Information》援引知情人士消息,谷歌母公司Alphabet正在研发一款内部代号为”Frozen v2″的服务器AI芯片,专为Gemini大模型设计,计划最早于2028年部署。工程师预计,其单位功耗所能处理的Token数量,可能达到公司最新一代自研AI芯片的6至10倍。
从通用到专用:芯片设计思路的根本转变
谷歌现有的TPU(Tensor Processing Unit)虽然是面向机器学习的专用处理器,但仍需适配不同模型,并承担训练、推理等多种任务。最新一代Ironwood单颗芯片配备192GB高带宽内存,单位功耗性能约为上一代Trillium的两倍,最多可由9216颗芯片组成Superpod。
Frozen v2的定位则更为极致。它不会取代TPU,而是作为一条更具针对性的产品线与其并行使用。根据现有报道,谷歌计划将Gemini的部分架构特征直接固化在芯片中,针对其计算路径和常用操作进行专门优化。
大模型推理不仅需要完成大量矩阵运算,还要频繁从高带宽内存读取参数。数据在内存与计算单元之间移动,会消耗时间和电力。Frozen v2希望减少这部分开销,从而提高响应速度,并在相同功耗下处理更多请求。报道所称的6至10倍效率提升,具体指每单位功耗能够处理的Token数量,并非芯片峰值算力。
1800亿美元资本开支背后的算力焦虑
谷歌为何如此激进?首要原因是应对持续增长的算力需求。据相关数据,谷歌内部的AI计算资源短缺已经引发不同团队之间的资源竞争,Google Cloud甚至因此拒绝过部分外部客户订单。
大模型的计算需求包括训练与推理两个阶段。训练先进模型需要集中投入大量算力,但随着Gemini被加入搜索、办公软件、云服务和智能终端,长期发生的推理可能形成更庞大的成本。单次生成的费用看似有限,乘以数以亿计的用户和持续增长的调用量后,电力、芯片、网络及数据中心投入都会成为重要支出。
Alphabet已将2026年资本开支预期上调至1800亿至1900亿美元,主要用于扩建AI计算能力、数据中心和相关基础设施。在这一背景下,提高每瓦电力能够生成的Token数,不仅意味着更低的能源消耗,还意味着同一座数据中心能够承载更多用户请求。
软硬件协同:一把双刃剑
专用芯片的优势显而易见,但劣势也同样突出。更深的模型与芯片绑定会降低灵活性。芯片从设计到投产通常需要数年,如果此后Gemini的基础架构发生较大变化,已经固化的设计可能难以适配。Frozen v2能否获得长期收益,既取决于实际能效,也取决于谷歌能否在快速迭代模型的同时,维持底层架构的相对稳定。
自研芯片还可以加强谷歌对供应链和产品节奏的控制,减少对英伟达等外部芯片供应商的依赖。但这种”减少依赖”并不等于完全替代。Frozen v2即使顺利投产,预计规模也将低于TPU;谷歌的数据中心仍会同时使用TPU、GPU及其他计算设备。它更像是为高频且相对稳定的Gemini任务增加一类成本更低的专用工具。
不止谷歌:AI芯片自研已成行业共识
谷歌不是唯一走向自研芯片的AI公司。2026年6月,OpenAI与博通公布首款自研推理芯片Jalapeño,围绕大语言模型推理设计,计划于2026年底开始部署。Anthropic也被曝已经开始研究自有AI芯片,并与三星电子等潜在合作方接触。
中国方面,DeepSeek和月之暗面等也有自研芯片方面的传闻。亚马逊、微软、Meta、阿里巴巴、百度和字节跳动等拥有云服务或大规模互联网业务的企业,也在不同程度上推进专用AI芯片。
这些项目共同反映出一个趋势:随着AI服务规模扩大,掌握模型的公司越来越希望同时参与芯片和计算系统设计。Frozen v2所代表的不只是谷歌扩大自研芯片投入,也是一项更激进的软硬件协同试验。答案将取决于芯片能否如期投产,也取决于到2028年时,Gemini是否仍然适合这块为它提前设计的硅片。