智能体复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论
一次用 AI 智能体做的系统性复现审计显示:ICML 2026 的 92 篇可验证论文中,仅 34 篇能复现超过四成结论,能复现八成以上的只有 8 篇。另一项基于 GPT-5 的检查发现,平均每篇论文有 4.7 个客观错误,99.2% 的论文至少被标出一个问题。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
审计的结果
一家研究审查公司在 7 月 22 日用 AI 智能体对 ICML 2026 的全部 168 篇口头报告论文做了系统性的结果复现审计。其中 92 篇拥有至少 5 条可供验证的结论性声明。
- 能成功复现超过四成结论的:34 篇
- 能复现八成以上的:仅 8 篇
「复现不了」不等于「造假」
失败原因大多是工程性的:代码缺少关键文件、依赖库版本断裂、运行结果与论文不符。其中 4 篇论文依赖的模型已经下线——这意味着那些实验结果永久性地无法被任何人复现,与作者是否诚实无关。
但也有错得离谱的:
- 一篇论文把「仅训练基础模型 0.77% 的参数」作为核心卖点,而它实际开源的 checkpoint 训练了 6.31% 的参数,相差约 8 倍。
- 另一篇放了一张基于某评判模型的可靠性表格,而它的开源代码里根本不包含那个评判模型,也没有任何脚本能生成表里的结果。
另一条线:客观错误的普遍程度
2025 年底另一项研究用基于 GPT-5 的系统检查已发表在顶级会议与期刊上的论文,并且明确限定只看客观错误,不评价创新性与研究价值。结果:
- 平均每篇论文 4.7 个客观错误
- 99.2% 的论文至少被标出一个问题
- 数学与公式错误占 54.0%(方程写错、推导有漏洞、证明中的错误假设)
- 约 30.8% 的 NeurIPS 论文与 23.8% 的 ICLR 论文含有至少一个可能影响结果解读的实质性错误
趋势更值得注意:NeurIPS 论文的篇均错误数从 2021 年的 3.8 升到 2025 年的 5.9,涨幅 55.3%。
为什么这是一条技术信号而不是学术八卦
真正变了的是验证的成本。 同行评审审稿人几乎没有时间从头下载数据、跑模型、复现每一个实验;而当一篇论文背后的代码、数据与参数可能涉及数百个细节时,这层验证事实上一直是空的。智能体把这层的成本降下来之后,空缺就变成了可测量的数字。
这与本站《评估闭环》里那条判据是同一件事:一次跑完却没有改变任何东西的评测是报告,不是闭环。 过去论文发表即终点,是因为没人跑得动第二遍;现在跑得动了。
这条信号的边界,需要说清楚
- 本条为二手报道(量子位),原始研究的执行方在报道中未具名(「美国某研究审查公司」),这是它最弱的一环。
- 抱抱脸与 AlphaXiv 联合发起的 Agent Reproduction Challenge 是可指名的同类工作,结论方向一致。
- 「复现率低」本身也受审计工具能力限制——审计智能体复现失败,和论文本身有问题,是两件需要分开的事,这一点原报道没有充分区分。
为什么是现在
为什么重要
智能体把复现的成本降到可以批量执行之后,一层长期空着的验证第一次变成了数字——而数字很难看。这直接影响你该如何采信一篇论文里的基准结果。
背景
技术背景
审计对象是 ICML 2026 的 168 篇口头报告论文,其中 92 篇含至少 5 条可验证声明。另一项基于 GPT-5 的检查系统只统计客观错误(数学、公式、推导、证明假设),覆盖已发表于顶级会议与期刊的论文。
关注人群
谁该关注
下一步
学习路径
- 把「这把尺子有没有量过别人」这条判据用到你引用的每一个基准数字上
- 区分「审计工具复现失败」与「论文本身有问题」,前者不足以否定后者
- 在自己的项目里试着做一次结论级的复现清单,看有多少条真的可验证
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 审计智能体自身的失败率有多高,它的结论经过人工抽样核对了吗?
- 如果模型下线导致实验永久不可复现,学术制度上该由谁承担归档责任?
- 篇均错误数逐年上升,是审查变严了还是论文确实变差了?
来源参考