在全球最大的云服务商内部,工程师申请一台开发用的虚拟机,如今可能要排队等上好几天。

据《The Information》报道并经 Tom’s Hardware 转述,亚马逊云科技(AWS)今年 5 月与内部工程师开会,明确要求减少“CPU 浪费”,以保证对外客户的算力供给。多名工程师表示,过去几小时就能拿到的实例,现在要等数天;其中一人称,在亚马逊工作多年,从未等过这么久。
显卡不再是唯一瓶颈
过去几年,数据中心的紧缺叙事几乎被 GPU 垄断。但这一轮压力落到了通用处理器身上。
报道称,数据中心里 GPU 与 CPU 的配比正在改变:传统上常见的 8 比 1 或 4 比 1,如今正朝着接近 1 比 1 的方向靠拢。原因指向智能体(AI agent)这一新的工作负载形态。
训练和推理主要吃 GPU,CPU 长期只扮演“喂饱显卡”的辅助角色。智能体则不同:它要按顺序编排多步任务、根据条件分支、频繁调用外部工具、维护中间状态,这些活儿基本都跑在 CPU 上。工作负载结构一变,被长期视作廉价管道的通用处理器,突然成了瓶颈。
AWS 的 EC2 实例同时部署了 AMD、Intel 的处理器以及自研的 Graviton5。Graviton5 是该公司迄今性能最强的自研 CPU,采用 Arm 架构路线。
六成五的实例长期在空转
内部整顿的直接动因,是利用率数据太难看。
报道披露,在 30 天的观测周期内,约 65% 的 EC2 实例平均 CPU 利用率低于 20%,大量计算资源长期处于低负载状态。传统上,工程师习惯为开发环境自行开机器——Web 类基础设施对 CPU 要求本就不高,多开几台虚拟机几乎没有代价。这种习惯在算力宽裕时无伤大雅,一旦供给收紧就成了明显的浪费。
为了精准识别闲置资产,AWS 升级了计算优化工具 Compute Optimizer:自动抓取并分析虚拟机 14 天内的 CPU 占用与读写数据,对峰值 CPU 利用率低于 15%、网络流量长期低迷的实例自动打标,供工程师据此清理。
供给端也在同步扩张。过去一年,该公司新增电力配套容量达 3.8 吉瓦,按报道给出的口径,这一供电规模可满足约 280 万户家庭的日常用电。
智能体正在改写成本结构
算力紧张的另一面,是智能体带来的开销失控风险。报道提到一个案例:上个月,一个编码智能体在亚马逊内部烧掉约 180 万美元的 token 费用,超出开发预算 860%。
这类数字解释了为什么大型企业开始在内部推行算力治理。工具本身单次调用便宜,但智能体会自主发起成百上千次调用,最终账单与传统开发工具完全不在一个量级。
紧缺同样传导到了芯片厂商一侧。AMD 近期发布了面向数据中心的 Zen 6 架构“Venice”系列处理器——这是几十年来该公司首次让新架构在数据中心先于消费级产品亮相。英伟达也把对外叙事从加速卡向新推出的 Vera CPU 倾斜,试图在智能体基础设施这块扩张中的市场里占位。
不过短缺并非全面性的。报道援引一位顾问的说法称,供给紧张主要出现在竞价实例(spot instance)上,签订长期合同的预留容量并未出现短缺。
对普通开发者而言,这轮变化的现实含义相当直白:在智能体大规模进入生产环境的阶段,把 CPU 当作可以随手浪费的廉价资源,这个前提正在失效。
来源:Tom’s Hardware,原始报道来自《The Information》







