工作流 · 第 2026-09-15

平均成功率 77%,五次全对只有 53%:智能体的一致性差距

IBM Research 指出,几乎所有基准只报平均成功率:AppWorld 上一个 GPT-4.1 的 ReAct 智能体五次运行平均成功 77.4%,但五次全对的任务只有 53.0%,差 24.4 个点,难任务上达 30 个点。原因在于决策分布的形状——平坦分布里的近似平局会被 GPU 浮点、批处理等平台侧扰动翻转,几十个决策串起来就累积成很大的走偏概率,所以温度设成 0 也没用。他们用一条轨迹、无需标准答案就能找出易翻转决策点,并据此生成指引,把差距从 24.4 降到 12.0 个点,平均准确率不降。

Hugging Face Blog2026-09-15立即关注

多个信号同时成立,建议优先评估这条技术变化。

AI 智能体可观测性

记录

信号正文

一个几乎没人报的数字

你的智能体在彩排时成功了,现场演示时却走了另一条路,同一个任务失败了。台上这叫尴尬;生产里这叫可靠性问题——一个成功过一次的流程,下一次用户提出同样的请求时可能就失败。

IBM Research 给了一个具体的数:在 AppWorld 上,一个用 GPT-4.1 的 ReAct 智能体在五次重复运行中平均成功率 77.4%,但五次全部成功的任务只有 53.0%。两者之差 24.4 个百分点,他们称之为「一致性差距」;在难任务上达到 30 个百分点。几乎所有基准只报前一个数。

三个名字相近、问题相反的指标

  • Mean@k:跑 k 次取平均通过率,排行榜上的就是它,回答「平均有多好」
  • Pass@k:k 次里至少成功一次,乐观,适合能验证、能重试的场景
  • Pass^k:k 次全部成功,悲观,回答真实用户关心的那个问题——「我再问一遍,它还行吗」

三者永远满足 Pass^k ≤ Mean@k ≤ Pass@k。作者强调这不是换个更大的模型就能修的能力问题,而是一条正交的轴:一个智能体可以既能干又不稳定。

为什么温度设成 0 也没用

每一次决策——调哪个接口、传什么参数、要不要重试——都来自下一个 token 的概率分布,要紧的是分布的形状。尖锐的分布把大部分概率压在一个选项上,一次次跑出来都一样;平坦的分布让几个选项几乎打平,谁胜出接近抛硬币。

GPU 浮点运算的非结合性、请求批处理这类平台侧的微小扰动,推不动尖锐分布,却足以让平坦分布里的近似平局换个顺序。一条轨迹串着几十个决策,每步一点点翻转的概率就会累积成某次运行走偏的很大概率——24 个点的差距就是这么来的。贪心解码和固定随机种子管的是「怎样把分布变成 token」,管不到分布本身;在托管端点上,同一个提示词、同一个模型、温度为零,今天和明天也可能把同一个近似平局判成不同的结果。他们的实验本身就跑在温度 0.0 下。

诊断,再修

他们做了一个一致性分析器:只需要一条已记录的轨迹、不需要标准答案,在轨迹的每个决策点上用一次调用请求 k 个候选(默认 5 个),找出那些「差一次采样就会做别的事」的易翻转决策点,而不是把整个任务重新跑一遍。

诊断结果再被转成一类新的行为指引,注入推理时的上下文。结果:一致性差距从 24.4 个点降到 12.0 个点,减半;同任务 Pass^5 提升 16.0 个点、相似任务提升 13.0 个点,平均准确率没有任何损失

这是本站 8 月 24 日那条 IBM ALTK-Evolve 信号的续篇。那一篇说智能体记忆是需要按模型标定的剂量;作者这次自己承认,那一篇的结果也只回答了「平均情况」这一个问题。

放在这一轮里看

这一轮另外几条信号讲的都是:看一次、看一方的记录,不等于知道发生了什么。这一条是它最日常的形态——跑一次成功,不等于它会成功。平均值不会说谎,但它只报了一半;另一半要靠同一个任务多跑几遍才看得见。

为什么是现在

为什么重要

平均成功率回答的是「平均有多好」,而用户问的是「我再问一遍它还行吗」。77.4% 与 53.0% 之间的 24.4 个点,是一个几乎没有基准报告的差距。更实用的是两点:温度设成 0 挡不住它,因为平台侧的微小扰动足以翻转平坦分布里的近似平局;以及诊断只需要一条轨迹、不需要标准答案,任何在生产里跑智能体的团队都能照着做。

背景

技术背景

Mean@k 为 k 次运行的平均通过率,Pass@k 为至少一次成功,Pass^k 为全部成功,恒有 Pass^k ≤ Mean@k ≤ Pass@k。一致性分析器在已记录轨迹的每个决策点上单次调用请求 k 个候选(默认 5),定位易翻转的决策点,不需重跑整个任务、不需标准答案;由此生成的一致性指引注入推理上下文。实验在 AppWorld test_normal 上、温度 0.0 下进行,方法与完整评测见 arXiv 技术报告。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

把智能体用在对账、合同审查等需要结果稳定的任务上的团队设计智能体评测、需要决定报哪个指标的工程师以为把温度设成 0 就能得到确定结果的开发者
可能影响的领域
智能体评测可靠性生产部署

下一步

学习路径

  1. 先分清 Mean@k、Pass@k、Pass^k:同样的字母,问的是相反的问题
  2. 理解为什么温度 0 挡不住:分布的形状比解码设置更要紧
  3. 读本站 8 月 24 日那条 ALTK-Evolve:这一条是它的一致性续篇
  4. 在你自己的评测里,对同一批任务多跑几遍,报出五次全对的比例

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你的智能体在关键任务上五次全对的比例是多少?
  • 换一个托管端点或调整批处理,一致性差距会变大还是变小?
  • 一致性指引在其他基准和其他模型上是否同样能把差距减半?

来源参考

Hugging Face Blog

IBM Research大型科技公司2026-09-15
打开原始来源https://hf-mirror.com/blog/ibm-research/altk-evolve-consistency