平均成功率 77%,五次全对只有 53%:智能体的一致性差距
IBM Research 指出,几乎所有基准只报平均成功率:AppWorld 上一个 GPT-4.1 的 ReAct 智能体五次运行平均成功 77.4%,但五次全对的任务只有 53.0%,差 24.4 个点,难任务上达 30 个点。原因在于决策分布的形状——平坦分布里的近似平局会被 GPU 浮点、批处理等平台侧扰动翻转,几十个决策串起来就累积成很大的走偏概率,所以温度设成 0 也没用。他们用一条轨迹、无需标准答案就能找出易翻转决策点,并据此生成指引,把差距从 24.4 降到 12.0 个点,平均准确率不降。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
一个几乎没人报的数字
你的智能体在彩排时成功了,现场演示时却走了另一条路,同一个任务失败了。台上这叫尴尬;生产里这叫可靠性问题——一个成功过一次的流程,下一次用户提出同样的请求时可能就失败。
IBM Research 给了一个具体的数:在 AppWorld 上,一个用 GPT-4.1 的 ReAct 智能体在五次重复运行中平均成功率 77.4%,但五次全部成功的任务只有 53.0%。两者之差 24.4 个百分点,他们称之为「一致性差距」;在难任务上达到 30 个百分点。几乎所有基准只报前一个数。
三个名字相近、问题相反的指标
- Mean@k:跑 k 次取平均通过率,排行榜上的就是它,回答「平均有多好」
- Pass@k:k 次里至少成功一次,乐观,适合能验证、能重试的场景
- Pass^k:k 次全部成功,悲观,回答真实用户关心的那个问题——「我再问一遍,它还行吗」
三者永远满足 Pass^k ≤ Mean@k ≤ Pass@k。作者强调这不是换个更大的模型就能修的能力问题,而是一条正交的轴:一个智能体可以既能干又不稳定。
为什么温度设成 0 也没用
每一次决策——调哪个接口、传什么参数、要不要重试——都来自下一个 token 的概率分布,要紧的是分布的形状。尖锐的分布把大部分概率压在一个选项上,一次次跑出来都一样;平坦的分布让几个选项几乎打平,谁胜出接近抛硬币。
GPU 浮点运算的非结合性、请求批处理这类平台侧的微小扰动,推不动尖锐分布,却足以让平坦分布里的近似平局换个顺序。一条轨迹串着几十个决策,每步一点点翻转的概率就会累积成某次运行走偏的很大概率——24 个点的差距就是这么来的。贪心解码和固定随机种子管的是「怎样把分布变成 token」,管不到分布本身;在托管端点上,同一个提示词、同一个模型、温度为零,今天和明天也可能把同一个近似平局判成不同的结果。他们的实验本身就跑在温度 0.0 下。
诊断,再修
他们做了一个一致性分析器:只需要一条已记录的轨迹、不需要标准答案,在轨迹的每个决策点上用一次调用请求 k 个候选(默认 5 个),找出那些「差一次采样就会做别的事」的易翻转决策点,而不是把整个任务重新跑一遍。
诊断结果再被转成一类新的行为指引,注入推理时的上下文。结果:一致性差距从 24.4 个点降到 12.0 个点,减半;同任务 Pass^5 提升 16.0 个点、相似任务提升 13.0 个点,平均准确率没有任何损失。
这是本站 8 月 24 日那条 IBM ALTK-Evolve 信号的续篇。那一篇说智能体记忆是需要按模型标定的剂量;作者这次自己承认,那一篇的结果也只回答了「平均情况」这一个问题。
放在这一轮里看
这一轮另外几条信号讲的都是:看一次、看一方的记录,不等于知道发生了什么。这一条是它最日常的形态——跑一次成功,不等于它会成功。平均值不会说谎,但它只报了一半;另一半要靠同一个任务多跑几遍才看得见。
为什么是现在
为什么重要
平均成功率回答的是「平均有多好」,而用户问的是「我再问一遍它还行吗」。77.4% 与 53.0% 之间的 24.4 个点,是一个几乎没有基准报告的差距。更实用的是两点:温度设成 0 挡不住它,因为平台侧的微小扰动足以翻转平坦分布里的近似平局;以及诊断只需要一条轨迹、不需要标准答案,任何在生产里跑智能体的团队都能照着做。
背景
技术背景
Mean@k 为 k 次运行的平均通过率,Pass@k 为至少一次成功,Pass^k 为全部成功,恒有 Pass^k ≤ Mean@k ≤ Pass@k。一致性分析器在已记录轨迹的每个决策点上单次调用请求 k 个候选(默认 5),定位易翻转的决策点,不需重跑整个任务、不需标准答案;由此生成的一致性指引注入推理上下文。实验在 AppWorld test_normal 上、温度 0.0 下进行,方法与完整评测见 arXiv 技术报告。
关注人群
谁该关注
下一步
学习路径
- 先分清 Mean@k、Pass@k、Pass^k:同样的字母,问的是相反的问题
- 理解为什么温度 0 挡不住:分布的形状比解码设置更要紧
- 读本站 8 月 24 日那条 ALTK-Evolve:这一条是它的一致性续篇
- 在你自己的评测里,对同一批任务多跑几遍,报出五次全对的比例
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你的智能体在关键任务上五次全对的比例是多少?
- 换一个托管端点或调整批处理,一致性差距会变大还是变小?
- 一致性指引在其他基准和其他模型上是否同样能把差距减半?
来源参考