工作流 · 第 2026-08-10

智能复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论

一次用 AI 智能体做的系统性复现审计显示:ICML 2026 的 92 篇可验证论文中,仅 34 篇能复现超过四成结论,能复现八成以上的只有 8 篇。另一项基于 GPT-5 的检查发现,平均每篇论文有 4.7 个客观错误,99.2% 的论文至少被标出一个问题。

量子位2026-08-10值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

工作流可观测性

记录

信号正文

审计的结果

一家研究审查公司在 7 月 22 日用 AI 智能体对 ICML 2026 的全部 168 篇口头报告论文做了系统性的结果复现审计。其中 92 篇拥有至少 5 条可供验证的结论性声明。

  • 能成功复现超过四成结论的:34 篇
  • 能复现八成以上的:仅 8 篇

「复现不了」不等于「造假」

失败原因大多是工程性的:代码缺少关键文件、依赖库版本断裂、运行结果与论文不符。其中 4 篇论文依赖的模型已经下线——这意味着那些实验结果永久性地无法被任何人复现,与作者是否诚实无关。

但也有错得离谱的:

  1. 一篇论文把「仅训练基础模型 0.77% 的参数」作为核心卖点,而它实际开源的 checkpoint 训练了 6.31% 的参数,相差约 8 倍
  2. 另一篇放了一张基于某评判模型的可靠性表格,而它的开源代码里根本不包含那个评判模型,也没有任何脚本能生成表里的结果。

另一条线:客观错误的普遍程度

2025 年底另一项研究用基于 GPT-5 的系统检查已发表在顶级会议与期刊上的论文,并且明确限定只看客观错误,不评价创新性与研究价值。结果:

  • 平均每篇论文 4.7 个客观错误
  • 99.2% 的论文至少被标出一个问题
  • 数学与公式错误占 54.0%(方程写错、推导有漏洞、证明中的错误假设)
  • 30.8% 的 NeurIPS 论文与 23.8% 的 ICLR 论文含有至少一个可能影响结果解读的实质性错误

趋势更值得注意:NeurIPS 论文的篇均错误数从 2021 年的 3.8 升到 2025 年的 5.9,涨幅 55.3%

为什么这是一条技术信号而不是学术八卦

真正变了的是验证的成本。 同行评审审稿人几乎没有时间从头下载数据、跑模型、复现每一个实验;而当一篇论文背后的代码、数据与参数可能涉及数百个细节时,这层验证事实上一直是空的。智能体把这层的成本降下来之后,空缺就变成了可测量的数字。

这与本站《评估闭环》里那条判据是同一件事:一次跑完却没有改变任何东西的评测是报告,不是闭环。 过去论文发表即终点,是因为没人跑得动第二遍;现在跑得动了。

这条信号的边界,需要说清楚

  • 本条为二手报道(量子位),原始研究的执行方在报道中未具名(「美国某研究审查公司」),这是它最弱的一环。
  • 抱抱脸与 AlphaXiv 联合发起的 Agent Reproduction Challenge 是可指名的同类工作,结论方向一致。
  • 「复现率低」本身也受审计工具能力限制——审计智能体复现失败,和论文本身有问题,是两件需要分开的事,这一点原报道没有充分区分。

为什么是现在

为什么重要

智能体把复现的成本降到可以批量执行之后,一层长期空着的验证第一次变成了数字——而数字很难看。这直接影响你该如何采信一篇论文里的基准结果。

背景

技术背景

审计对象是 ICML 2026 的 168 篇口头报告论文,其中 92 篇含至少 5 条可验证声明。另一项基于 GPT-5 的检查系统只统计客观错误(数学、公式、推导、证明假设),覆盖已发表于顶级会议与期刊的论文。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

依据论文基准结果做技术选型的工程团队设计评测体系、需要判断外部数字可信度的人研究者与审稿人
可能影响的领域
论文基准的可信度评估体系设计智能体在科研流程中的角色技术选型依据

下一步

学习路径

  1. 把「这把尺子有没有量过别人」这条判据用到你引用的每一个基准数字上
  2. 区分「审计工具复现失败」与「论文本身有问题」,前者不足以否定后者
  3. 在自己的项目里试着做一次结论级的复现清单,看有多少条真的可验证

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 审计智能体自身的失败率有多高,它的结论经过人工抽样核对了吗?
  • 如果模型下线导致实验永久不可复现,学术制度上该由谁承担归档责任?
  • 篇均错误数逐年上升,是审查变严了还是论文确实变差了?

来源参考

量子位

量子位媒体2026-08-10
打开原始来源https://www.qbitai.com/2026/08/469795.html