一次 180 万美元的智能体账单:超预算 860%,五个月后才被发现
亚马逊用 Claude Sonnet 给自家网站填充作者信息,花掉 180 万美元、超预算 860%、五个月后才被发现,而且最终没有部署成功。同期 Meta 员工 30 天消耗 73.7 万亿 token,Uber 四个月烧完全年编码预算。一项调查显示只有 26% 的企业对自身 AI 成本具备全面可见性。这不是一条价格新闻——它是「智能体安静地做错事」这个失败模式的又一种形态:不报错,只出账单。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
那笔账单的形状
据亚马逊员工透露,公司想用 Claude Sonnet 为自家网站填充详细的作者信息——一个看起来很简单的任务。结果花了 180 万美元,超出预算 860%,过了五个月才被发现,并且最终没有部署成功。
按 Claude Sonnet 当时的公开定价(每百万输入 token 3 美元、输出 15 美元)折算,180 万美元最多对应约 6000 亿 token。
值得注意的不是金额,是这次失败的形状:没有崩溃、没有报警、没有一条错误日志。智能体只是坚韧不拔地反复重试,而没有任何人告诉它「先等一下再试」。一个不知道自己该停下来的智能体,它的失败模式是账单,不是异常。
本站《完成判定与验收信号》说的是:答错了却宣称完成、把错误往下游传,是更贵的方向。这里是同一件事再往上抬一层——连「答错」都没有发生,它只是一直在试,而没有任何一层负责回答「这一步是不是已经不值得继续了」。上一条信号里微软 Agent Framework 在 40 次往返后自停、Copilot SDK 关掉宿主刹车后跑到 300 次不停,量的正是这个东西。
这不是孤例,而且指标本身先失效了
- Meta:一名员工在 4 月搭了个叫 Claudeonomics 的排行榜,聚合超过 8.5 万名员工的用量并列出 token 消耗最高的前 250 人。员工在 30 天内消耗的 token 总量攀升到 73.7 万亿,按公开定价折算约为每月 2.21 亿美元。6 月,Meta 向约 6000 名员工发出备忘录,宣布对 token 用量设限,并搭建名为「AI Gateway」的中央平台实时监控各团队用量与支出、设定预算与上限。
- 亚马逊:内部曾有一个叫「KiroRank」的非正式排行榜,导致部分员工有目的地推高个人数据;关闭后又换成「标准化部署」来衡量 AI 产出。
- Uber:2026 年头四个月就烧光了全年的 AI 编程预算,随后把每名员工、每个工具的支出上限设为每月 1500 美元。其 COO 坦言,token 支出与可衡量的产出之间的联系还未成型。
- OpenAI:Sam Altman 在 6 月 3 日表示,成本问题在年初还完全无人在意,现在已经成了一个大问题;内部用量最高的个人用户每月约 1000 亿 token,某员工曾在单周烧掉约 2100 亿 token。
排行榜那部分是古德哈特定律的教科书复现:当一个衡量指标变成目标,它就不再是一个好指标。用量榜本意是推广,结果直接生产出了刷榜行为——而刷出来的每一个 token 都是真花钱的。
最刺眼的一个数字
一项调查显示,仅有 26% 的企业对自身 AI 成本具备全面的可见性。也就是说,大多数公司在开始节流之前,甚至不清楚此前到底花了多少钱。
把这个数字和亚马逊那五个月放在一起读就很清楚:问题不是花得多,是看不见。可观测性在智能体语境下一直被当作「出错时能不能归因」,这批案例说明它还有一个更早的用途——在没有出错的时候,告诉你正在发生什么。
自动化出错时,损失也会以同样的效率被放大
来源文章用 2012 年骑士资本的事故作类比,这个类比是站得住的:一次部署误激活了一段旧代码,系统开始高频执行毫无经济逻辑的交易,且没有任何预设的止损机制或金额上限;从开盘到被手动关停约 45 分钟,在 154 只股票上执行了超过 400 万笔交易,累计买入约 70 亿美元并不想持有的头寸,平仓后亏损约 4.4 亿美元——相当于公司全年利润的三倍。两个交易日内股价蒸发 75%,数月后被收购。
自动化承诺的是更快、更便宜、更少人为差错。当它出错时,损失会以同样的速度、规模和效率被放大。智能体把这条老规律带进了一个新的地方:不是交易系统,是任何一个你交给它自己跑的任务。
对读者的实际含义
三件可以马上做的事,都不需要新技术:
- 给每个智能体任务设一个硬上限,而且上限要在循环内部生效,不能指望宿主或人工巡检。
- 把「花了多少」做成和「跑得对不对」同等级别的一等指标,而不是月底对账时才出现的数字。
- 不要把用量本身设成目标。Meta 和亚马逊的排行榜都在用行为证明这一点,代价是真金白银。
为什么是现在
为什么重要
本站此前讨论智能体失败,讲的都是「答错了却说自己做完了」。这批案例给出了更早、也更难察觉的一种:什么都没错,只是没人知道它还在跑。亚马逊那笔 180 万美元的账单五个月无人察觉、最终还没部署成功,而全行业只有 26% 的企业能看清自己的 AI 成本。对任何准备把智能体交给它自己跑的团队,这条把「循环内部要有硬上限」从工程洁癖变成了有价签的要求。
背景
技术背景
智能体与单次模型调用的成本结构完全不同:每一轮工具循环都会重发历史,重试没有天然次数上限,而失败往往表现为继续尝试而不是抛出异常。传统系统里可以忽略的小问题(一次无效重试、一段没被触发的分支)在按 token 计费时会被放大成不可忽略的支出。护栏因此需要长在循环内部——上限、超时、以及一个明确的「不再继续」判定——而不是依赖外部巡检或月度对账。
关注人群
谁该关注
下一步
学习路径
- 先读《完成判定与验收信号》,把「这一步做完了吗」扩展成「这一步是不是已经不值得继续了」
- 检查自己的智能体任务:重试有没有次数上限、有没有总支出上限,以及上限由哪一层执行
- 读《智能体可观测性与评测运维》,把成本做成和正确率同级的一等指标而不是事后账单
- 读《推理服务容量规划》,把 token 支出翻译成可以提前设定的预算而不是事后观察的结果
- 回头看《AI 试点范围界定》里那条「限制的是影响半径不是预算」——这批案例说明两者都要限
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你现在能不能在一小时内回答「上周某个智能体任务花了多少钱」?如果不能,五个月是完全可能的。
- 重试上限、超时、支出上限三者里,你的系统实际执行的是哪一个?由谁执行?
- 如果把用量从考核指标里拿掉,还有什么指标能说明 AI 投入产生了效果?
- 180 万美元这个数字来自未具名员工转述,如果换成可审计的账单数据,结论会变吗?
来源参考