一项听上去再普通不过的数据整理工作——把作者信息与亚马逊零售网站上的商品列表做匹配——最终产生了一张 180 万美元的账单,超出原定预算 860%,而且直到问题发生约五个月后才被发现。更尴尬的是,这个项目从未上线。

这一细节出自《金融时报》援引的一份亚马逊内部演示材料。多份内部报告显示,AI 正在让这家公司在多个项目上出现超支,而 180 万美元还只是其中单个项目的数字。
“以前不值钱的错误,现在贵得吓人”
按照内部材料的说法,这类失误过去”便宜到可以忽略不计”,但 AI 模型让它们变得”代价高到灾难性”,尤其是在部署 AI 智能体之后,token 消耗量急剧攀升。
目前已知最大的一笔来自一次失败的 Claude Sonnet 部署,原本用于匹配作者信息与商品列表,最终花掉 180 万美元。除此之外,内部还浮现出另外两笔超支:一个财务审计工具项目额外产生了 54.1 万美元成本——这一点颇具讽刺意味;一套用于缩短物流网络配送时间的系统,额外支出 13.4 万美元。
从数量级上感受一下这笔钱的分量:Claude Sonnet 的公开定价约为每百万输入 token 3 美元、每百万输出 token 15 美元。仅按输入价格粗略折算,180 万美元大致对应约 6000 亿 token 的消耗量。作为参照,同一模型上一次典型的开发者编程任务,成本通常远低于 5 美元。
亚马逊的回应:不要以偏概全
针对这些数字,亚马逊在内部演示中回应称:”和任何新技术一样,我们也在实验、学习并改进使用方式,包括如何提升成本效率。”
公司还表示:”挑出一些孤立的小例子——那些团队正在相互学习的场景——并把它们描绘成常态,并不能反映亚马逊各团队使用 AI 的真实情况。”
从比例上说,这个辩解有其道理。亚马逊最新一季营收超过 1810 亿美元,这些超支的 AI 费用甚至占不到其一个月收入的 0.1%。
真正的问题在治理,不在模型
这并不是 AI 第一次在亚马逊的工作流里制造麻烦。今年早些时候,AWS 曾报告多起由 AI 编程机器人失误引发的服务中断,公司的应对方式是限制 AI 智能体的权限,而不再让它们与所绑定的资深工程师享有同等权限。
更值得注意的是激励机制层面的问题。亚马逊内部曾维护一份排行榜,展示哪些员工使用 AI 最多。在 AI 成本不断膨胀之后,公司重新审视了这一政策并取消了排行榜。这套机制催生出一个被称为”tokenmaxxing”(刷 token 量)的现象——员工为了在排行榜上排名靠前,让 AI 智能体去执行毫无意义的任务。
不少科技公司都在推动员工多用 AI,理由是能提升生产力。但优步(Uber)首席技术官表示,这类政策与能否成功交付产品之间并没有关联。
问题的根源在于计费模式的转变。随着智能体接管更多工作、AI 供应商从订阅制转向按 token 计费,成本迅速膨胀,一些企业在几周内就用光了全年预算。传统软件里那些只值几分钱的失误——低效的循环、设计糟糕的工作流、失控的批处理任务——一旦交给大模型按 token 逐步执行,就会变成毁灭性的开支。
对亚马逊、微软这样的巨头而言,这也许还不是燃眉之急;但对绝大多数其他公司来说,这样的成本结构难以持续。
这起事件给所有在内部部署 AI 智能体的企业留下了一份相当明确的反面教材:为每条工作流指定明确的费用责任人,给智能体设置硬性熔断开关,并把自主 AI 系统当作正式的生产负载来对待,而不是当成边缘实验。
一张 180 万美元的账单,挂在一个从未上线的项目上——这说明跳过治理环节的代价,已经不再是假设性问题。
来源:Tom’s Hardware(https://www.tomshardware.com/tech-industry/artificial-intelligence/amazon-accidentally-spent-usd1-8-million-using-claude-for-menial-coding-task-went-860-percent-over-budget-catastrophically-expensive-coding-blunders-discovered-in-internal-amazon-ai-usage-metrics)、《金融时报》