两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
1,221 名社区成员用编码智能体重跑了 ICML 2026 三分之一的论文:6,816 份实验记录、35,908 条被判定的论断。51% 的论文至少有一条论断被独立验证,23% 至少有一条被证伪,而最值得记的是 242 篇——不同团队对同一条论断给出了相反结论。多个「已验证」之所以出现,只是因为检查停得太早。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
ICML 2026 收到 23,918 篇投稿、接收 6,352 篇,大约是上一年的两倍——这个指数趋势本身就有一部分是智能体让做实验和写论文变快带来的。评审能力没有跟着翻倍。报告开头引了一篇被接收为 spotlight 的论文的评审原话:「我给的置信度低,是因为我没有仔细核对全部证明。」
于是问题变成:如果真的把一整届会议重新检查一遍,会看到什么。
这场活动怎么跑的
2026-07-15 到 08-02,Hugging Face 把这件事开放给整个社区做:
- 挑论文。 组织方索引了全部 6,341 篇接收论文,抽出每篇的核心科学论断,让智能体从一个具体、可核对的目标开始,而不是从一份 40 页的 PDF 开始。鼓励多人重复同一篇。
- 自带智能体。 参与者用 Claude Code、Codex、Cursor、orx 等等,组织方只提供一条命令拉取论文、论断与说明。
- 复现并公开一切。 每次运行产出一份 Trackio 实验记录:静态 Space,含结论、跑过的代码、产生的工件,以及可选的完整智能体执行轨迹。审计过程本身必须可审计。
- 接受判定。 一个自动判定器重读每份记录,逐条论断给出已验证 / 已证伪 / 玩具规模 / 无法判定,并被明确要求把每份记录的自我评价当作不可信。判定器跑的是开源权重模型 GLM-5.2。
规模:1,221 名社区成员、6,816 份实验记录、2,226 篇论文被尝试(占整届 34%)、35,908 条论断被判定、2,962 个云上作业、274 份完整轨迹数据集。每人 20 美元计算额度。
结果不是一个通过率
- 51%(1,103 篇)至少有一条论断被独立验证。 其中 266 篇全部论断被验证,另有 632 篇部分验证且没有任何一条被证伪,累计 3,978 条论断有真实实验支撑。
- 23%(496 篇)至少有一条论断被证伪或存疑。 其中 49 篇全部论断被证伪,另有 242 篇是不同复现团队对同一条论断给出了相反结论。
- 其余落在中间:502 篇只拿到玩具规模的证据,280 篇什么都没能确立——最常见的原因是工件缺失。
可复现性不是一个是非题,它是对抗性的。 242 这个数字比 51% 和 23% 都更值得记。
「已验证」说的是检查,不是论文
35 位参与者正式声称自己证伪了某篇。组织方对每一条都做了对抗性复核:重读论文、重读记录、从论文自己的文字重新推导数学或重新实现实验。几个被确认的例子:
- 开头那篇分页论文。 那位没有仔细核对证明的评审给了它 spotlight。论文声称算法的鲁棒性是 H_k + O(1);一份记录测出附加项按 0.38 ln k 增长,并定位到证明中出问题的那一步。组织方自己把扫描扩展到 k = 1,024,在约九个标准差上确认了这一增长。真实结果是 H_k + Θ(log k)。
- 一个在第 224 步之后才倒下的定理。 某篇证明「只要原点落在凸包内,token 粒子就会坍缩到原点」。三支独立团队各自找到反例,违反分别首次出现在第 224、约 3,800 和 6,416 步——这恰好解释了为什么别人都「验证」了它:有限步长的检查停得太早。 最干净的那个反例用精确有理数算术给出,没有浮点误差可以躲。作者当天确认,正在修。
- 理论写的是一种损失,结果用的是另一种。 某篇的核心公式与整个理论章节分析的是反向 KL 散度,而作者自己说产出全部结果的那份代码,默认计算的是正向 KL。抓到这一点的记录同时也没能在作者自己的代码与数据上复现出论文宣称的 4 个百分点提升。
- 被填充稀释的评测。 某篇里约 66% 的被评估标签位置是训练到接近零损失的结束符填充,把困惑度压低了大约三倍。摘要里「用 3.1% 的质量代价换 50% 的缓存缩减」,修正后大约是 9.4%。
- 也有假的证伪。 一份记录戏剧性地宣称「论文方法比基线慢一倍」,实际是复现里的算术错误:把单条轨迹的时间和一批 50 条的时间放在一起比。正确归一之后,这位参与者自己的数据反而确认了论文宣称的 8 倍加速。
跑得好的也有:《Flat Minima and Generalization》被 20 支独立团队复现,其中 12 支验证了全部论断;《A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness》17 份记录里有 14 份验证了全部论断——一篇讲评判模型不可靠的论文,在被评判智能体审视时站住了。
人还剩下什么
组织方给出的答案是「还剩不少」,而理由具体:
- 纯智能体执行有真实上限。 智能体会卡在局部循环里、会误读随规模变化的行为(分页论文那几个「已验证」正是停在 log k 增长显现之前)、偶尔会把整套证伪建在一个单位不匹配上。这场活动里最可靠的结果,来自有人在旁边掌舵的流程:重新指方向、质疑一个假设、或者在烧掉一周算力之前判断某个实验的前提就是错的。
组织方已经开始给每一条被确认的发现写信给作者,问的是「我们发现了这些,证据都在,你同意还是我们分析错了」。目前已有多篇论文的作者确认,两份 arXiv 更正在路上,还有一例是作者早在活动发现前一个月就悄悄修好了——被算作独立收敛。
边界
判定器本身是模型,跑的是 GLM-5.2;它被要求不信任记录的自我评价,但它自己的判定没有第二道人工全量复核——只有被正式声称的 35 条证伪走了对抗性复核。2,226 篇是 34% 的样本而不是全体,参与者自选论文,因此不能当作整届会议的可复现率。
为什么是现在
为什么重要
它把一句抽象的话变成了可计数的东西:242 篇论文上,不同团队对同一条论断给出了相反结论。更重要的是「已验证」这个判定被拆开了——分页论文的多个已验证,只是因为检查停在了问题显现之前。这与本站反复遇到的同一形状完全一致:一个从不触发的限制等于没有限制,一次只走成功路径的探针分不清成功与不需要。检查的边界必须和被检查对象的边界一起报告,否则通过什么也不说明。
背景
技术背景
全部 6,341 篇接收论文被索引并抽出核心论断,使参与者的智能体从可核对目标而非整篇 PDF 起步。每次运行产出一份 Trackio 实验记录(静态 Space,含结论、代码、工件,可选完整执行轨迹数据集)。自动判定器由开源权重模型 GLM-5.2 驱动,逐条论断给出已验证 / 已证伪 / 玩具规模 / 无法判定,并被指示不信任记录的自我评价;全部判定在活动结束时冻结进公开数据集。当论文数据集私有或检查点未发布时,参与者在模拟原始性质的合成数据上做玩具规模复现。
关注人群
谁该关注
下一步
学习路径
- 先读分页论文那一段,把「多个已验证只是因为检查停得太早」记成一条通用陷阱
- 再读那条假证伪(单条轨迹时间对一批 50 条),确认自己的对照实验里归一化口径是不是写下来了
- 把 242 篇结论相反当作方法要求:一次复现不构成结论,重复次数本身要报告
- 读《评估闭环》与《完成判定与验收信号》,把「谁来判定判定器」补进自己的评测设计
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你最近一次说某件事「验证过了」,那次检查的停止条件是什么?换一个更长的范围还成立吗?
- 判定器自己跑的是模型,谁来复核它?这场活动只对 35 条声称的证伪做了对抗性复核。
- 2,226 篇是参与者自选的,选择偏差往哪个方向偏——更容易复现的,还是更可疑的?
- 如果一篇论文的工件缺失就无法判定,那么「无法判定」的 280 篇该被算作哪一类?
来源参考