工作流 · 第 2026-08-13

668 阶哈达玛矩阵构造出来:三个人加 Claude,清掉 2000 阶以下所有未决阶数

Anthropic 研究员、数学家 Levent Alpöge 报告:由三名人类与 Claude 组成的团队构造出 668 阶哈达玛矩阵——2005 年以来最小的未知阶数,人类卡了三十年。他一次放出 12 张矩阵,清掉 2000 阶以下所有悬而未决的阶数。EpochAI 已在 FrontierMath 上暂标为「由 AI 解决」。

量子位2026-08-13值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

前沿模型工作流可观测性

记录

信号正文

这道题是什么

哈达玛矩阵只有加减乘除:一个方阵,元素只能是 +1 和 −1,任意两行对应相乘再相加必须正好等于 0

问题简单,但 668 阶自 2005 年构造出 428 阶之后,就成了最小的未知阶数——此后二十多年,人类能造出大得多的矩阵,偏偏卡在这里。它的分解式是 4×167,依赖模 4 余 3 素数的佩利有限域高阶构造,长期只能生成模意义下的近似解;去年有人做出「模 64 版本」,差临门一脚。

正因为如此,它被收进了 FrontierMath——由陶哲轩等三位菲尔兹奖得主与 IMO 顶级教练等六十余人联合出题的高阶数学推理基准。

结果

Anthropic 研究员、数学家 Levent Alpöge 报告,由三名人类与 Claude 组成的团队解决了它。

  • EpochAI 已把这道开放题暂标为「由 AI 解决」
  • 若确认,这是 FrontierMath 50 个开放问题中被 AI 解决的第 4 个
  • 而且他一次放出的是 12 张矩阵——668、716、892、1132、1244、1388、1436、1676、1772… 2000 阶以下所有未决阶数一次清空

为什么这条值得记,而不只是一条趣闻

它是「基准被解决」这件事第一次带着可复核的过程发生。 Alpöge 的公布方式本身就是一次可验证性演示:他发了一条只有 23828 个加减号的推文,回复区藏着一段混淆过的 Shell 脚本作为解码器;随后独立数学成果数据库 VibeMathed 复现了整个解码过程并还原出那 12 组符号。

也就是说,这个结果不依赖你相信任何人的说法——矩阵在那里,验证条件(任意两行内积为 0)是可机械检查的。这与本站反复出现的那条判据是同一件事:一个能被独立跑第二遍的结论,和一个只能被采信的结论,是两种东西。

三个需要说清楚的限定

  1. 不是 AI 独立完成。原文写明是三名人类加 Claude 的团队。「AI 解决了三十年难题」这种说法会丢掉最关键的信息——人在哪一步,公开材料没有说明。
  2. EpochAI 的标记是「暂标」。确认与否尚未定论。
  3. 本条为二手报道(量子位)。原始信息来自 Alpöge 本人的社交媒体发布与 EpochAI 的基准页面。

一个有节目效果、但也说明问题的细节

那条只有加减号的推文,有人拿去让 Claude Fable 解码,Fable 拒绝解读;最后换用 GPT-5.6 Sol 才看懂谜面。同一家公司的研究员用 Claude 做出了结果,而另一款模型不肯解自己同门的谜题——模型的拒绝策略和它的能力是两回事,这一点在把模型放进自动化流程时经常被忽略。

为什么是现在

为什么重要

它是「AI 解决了开放数学问题」这类主张里少见的可独立复核的一次:结果是一个矩阵,验证条件是机械可查的,而且解码过程被第三方复现了。

背景

技术背景

哈达玛矩阵为元素取 ±1、任意两行内积为 0 的方阵。668 = 4×167 自 2005 年起是最小未知阶数,依赖模 4 余 3 素数的佩利构造。FrontierMath 收录了它作为 50 个开放问题之一;EpochAI 已暂标为由 AI 解决,为该基准的第 4 例。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

关心基准被解决意味着什么的人在设计需要可独立复核结论的评估体系的人把模型放进自动化流程、需要考虑拒绝策略的工程团队
可能影响的领域
数学基准与开放问题结论的可复核性人机协作的分工模型拒绝策略

下一步

学习路径

  1. 先看它的验证方式:结果可被机械检查,这是它与「模型说它做到了」的根本区别
  2. 再看「三名人类加 Claude」这个措辞,判断人机分工在公开材料里说清楚了没有
  3. 最后注意暂标与确认的区别,基准状态不等于定论

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 人类在这次构造里承担了哪一步,AI 承担了哪一步?
  • EpochAI 的确认流程是什么,暂标到确认要经过什么?
  • 同样的方法能否推广到 2000 阶以上,还是止于这一批?

来源参考

量子位

Anthropic大型科技公司2026-08-13
打开原始来源https://www.qbitai.com/2026/08/472016.html