工具 · 第 2026-08-09

一次 180 万美元智能账单:超预算 860%,五个月后才被发现

亚马逊用 Claude Sonnet 给自家网站填充作者信息,花掉 180 万美元、超预算 860%、五个月后才被发现,而且最终没有部署成功。同期 Meta 员工 30 天消耗 73.7 万亿 token,Uber 四个月烧完全年编码预算。一项调查显示只有 26% 的企业对自身 AI 成本具备全面可见性。这不是一条价格新闻——它是「智能体安静地做错事」这个失败模式的又一种形态:不报错,只出账单。

量子位2026-08-09值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

AI 智能体可观测性产品策略

记录

信号正文

那笔账单的形状

据亚马逊员工透露,公司想用 Claude Sonnet 为自家网站填充详细的作者信息——一个看起来很简单的任务。结果花了 180 万美元超出预算 860%过了五个月才被发现,并且最终没有部署成功

按 Claude Sonnet 当时的公开定价(每百万输入 token 3 美元、输出 15 美元)折算,180 万美元最多对应约 6000 亿 token

值得注意的不是金额,是这次失败的形状:没有崩溃、没有报警、没有一条错误日志。智能体只是坚韧不拔地反复重试,而没有任何人告诉它「先等一下再试」。一个不知道自己该停下来的智能体,它的失败模式是账单,不是异常。

本站《完成判定与验收信号》说的是:答错了却宣称完成、把错误往下游传,是更贵的方向。这里是同一件事再往上抬一层——连「答错」都没有发生,它只是一直在试,而没有任何一层负责回答「这一步是不是已经不值得继续了」。上一条信号里微软 Agent Framework 在 40 次往返后自停、Copilot SDK 关掉宿主刹车后跑到 300 次不停,量的正是这个东西。

这不是孤例,而且指标本身先失效了

  • Meta:一名员工在 4 月搭了个叫 Claudeonomics 的排行榜,聚合超过 8.5 万名员工的用量并列出 token 消耗最高的前 250 人。员工在 30 天内消耗的 token 总量攀升到 73.7 万亿,按公开定价折算约为每月 2.21 亿美元。6 月,Meta 向约 6000 名员工发出备忘录,宣布对 token 用量设限,并搭建名为「AI Gateway」的中央平台实时监控各团队用量与支出、设定预算与上限。
  • 亚马逊:内部曾有一个叫「KiroRank」的非正式排行榜,导致部分员工有目的地推高个人数据;关闭后又换成「标准化部署」来衡量 AI 产出。
  • Uber:2026 年头四个月就烧光了全年的 AI 编程预算,随后把每名员工、每个工具的支出上限设为每月 1500 美元。其 COO 坦言,token 支出与可衡量的产出之间的联系还未成型
  • OpenAI:Sam Altman 在 6 月 3 日表示,成本问题在年初还完全无人在意,现在已经成了一个大问题;内部用量最高的个人用户每月约 1000 亿 token,某员工曾在单周烧掉约 2100 亿 token。

排行榜那部分是古德哈特定律的教科书复现:当一个衡量指标变成目标,它就不再是一个好指标。用量榜本意是推广,结果直接生产出了刷榜行为——而刷出来的每一个 token 都是真花钱的。

最刺眼的一个数字

一项调查显示,仅有 26% 的企业对自身 AI 成本具备全面的可见性。也就是说,大多数公司在开始节流之前,甚至不清楚此前到底花了多少钱

把这个数字和亚马逊那五个月放在一起读就很清楚:问题不是花得多,是看不见。可观测性在智能体语境下一直被当作「出错时能不能归因」,这批案例说明它还有一个更早的用途——在没有出错的时候,告诉你正在发生什么

自动化出错时,损失也会以同样的效率被放大

来源文章用 2012 年骑士资本的事故作类比,这个类比是站得住的:一次部署误激活了一段旧代码,系统开始高频执行毫无经济逻辑的交易,且没有任何预设的止损机制或金额上限;从开盘到被手动关停约 45 分钟,在 154 只股票上执行了超过 400 万笔交易,累计买入约 70 亿美元并不想持有的头寸,平仓后亏损约 4.4 亿美元——相当于公司全年利润的三倍。两个交易日内股价蒸发 75%,数月后被收购。

自动化承诺的是更快、更便宜、更少人为差错。当它出错时,损失会以同样的速度、规模和效率被放大。智能体把这条老规律带进了一个新的地方:不是交易系统,是任何一个你交给它自己跑的任务。

对读者的实际含义

三件可以马上做的事,都不需要新技术:

  1. 给每个智能体任务设一个硬上限,而且上限要在循环内部生效,不能指望宿主或人工巡检。
  2. 把「花了多少」做成和「跑得对不对」同等级别的一等指标,而不是月底对账时才出现的数字。
  3. 不要把用量本身设成目标。Meta 和亚马逊的排行榜都在用行为证明这一点,代价是真金白银。

为什么是现在

为什么重要

本站此前讨论智能体失败,讲的都是「答错了却说自己做完了」。这批案例给出了更早、也更难察觉的一种:什么都没错,只是没人知道它还在跑。亚马逊那笔 180 万美元的账单五个月无人察觉、最终还没部署成功,而全行业只有 26% 的企业能看清自己的 AI 成本。对任何准备把智能体交给它自己跑的团队,这条把「循环内部要有硬上限」从工程洁癖变成了有价签的要求。

背景

技术背景

智能体与单次模型调用的成本结构完全不同:每一轮工具循环都会重发历史,重试没有天然次数上限,而失败往往表现为继续尝试而不是抛出异常。传统系统里可以忽略的小问题(一次无效重试、一段没被触发的分支)在按 token 计费时会被放大成不可忽略的支出。护栏因此需要长在循环内部——上限、超时、以及一个明确的「不再继续」判定——而不是依赖外部巡检或月度对账。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

准备把长时程任务交给智能体自主执行、还没设硬性支出上限的工程团队为 AI 投入做预算和归因、需要回答「这笔钱买到了什么」的技术负责人负责平台侧用量监控与配额的基础设施团队正在用「用量」当作 AI 推广指标的管理者——这条案例说明那会直接生产出刷榜行为
可能影响的领域
智能体任务的支出上限与超时设计AI 成本的可见性与实时归因把用量当作推广指标带来的反效果自动化系统的失败放大效应

下一步

学习路径

  1. 先读《完成判定与验收信号》,把「这一步做完了吗」扩展成「这一步是不是已经不值得继续了」
  2. 检查自己的智能体任务:重试有没有次数上限、有没有总支出上限,以及上限由哪一层执行
  3. 读《智能体可观测性与评测运维》,把成本做成和正确率同级的一等指标而不是事后账单
  4. 读《推理服务容量规划》,把 token 支出翻译成可以提前设定的预算而不是事后观察的结果
  5. 回头看《AI 试点范围界定》里那条「限制的是影响半径不是预算」——这批案例说明两者都要限

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你现在能不能在一小时内回答「上周某个智能体任务花了多少钱」?如果不能,五个月是完全可能的。
  • 重试上限、超时、支出上限三者里,你的系统实际执行的是哪一个?由谁执行?
  • 如果把用量从考核指标里拿掉,还有什么指标能说明 AI 投入产生了效果?
  • 180 万美元这个数字来自未具名员工转述,如果换成可审计的账单数据,结论会变吗?

来源参考

量子位

量子位媒体2026-08-09
打开原始来源https://www.qbitai.com/2026/08/469010.html