纳维-斯托克斯之争:88 小时、3000 亿 token,和一个没回答的问题
9 月 9 日本站因无法核对而没有发布 OpenAI 宣称用 AI 解决纳维-斯托克斯千禧年问题的候选;现在 Simon Willison 逐字引用了 OpenAI 公告并链接了另一方的说明,材料可以核对了,但数学本身仍未经任何独立方核实。按 OpenAI 的数字,智能体约 88 小时得出结果、Lean 验证再用 17 小时,全部尝试合计 3,000 亿个输出 token。另一方 Buckmaster 与 Alpöge 用 Claude 和 Codex 做了近一年,他们问模型是否用其数据训练过,没有得到回答;OpenAI 公告写的是「不能排除」。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
上一轮没发它,这一轮为什么发
9 月 9 日那一轮,本站把 OpenAI 宣布用 AI 解决纳维-斯托克斯千禧年问题的候选标记为已看而不发布:openai.com 对直接抓取返回 403,找不到二手报道,猜测的仓库路径返回 404,而从一句话写出来的只会是推断。
现在有了可以核对的材料:Simon Willison 的文章逐字引用了 OpenAI 公告的关键段落,并链接了另一方——纽约大学数学教授 Tristan Buckmaster——公开的说明文件。openai.com 依然返回 403,所以 OpenAI 的原话以 Willison 的引文为准。
数学本身仍然没有被本站或任何独立方核实过。 这一条发布的不是「千禧年问题已被解决」,而是围绕它的几件可以核对的事。
OpenAI 给出的数字
按 OpenAI 的叙述:9 月 1 日听到有两个千禧年问题被解决的传闻,受此启发,也受内部模型能力阶跃的鼓舞,他们对全部尚未解决的千禧年问题和少数其他高影响问题同时发起了尝试。
- 智能体在 9 月 5 日得出纳维-斯托克斯的结果,距第一批智能体启动约 88 小时
- 用 GPT-6 Astra 做 Lean 形式化与验证,又花了 17 小时
- 所有问题合计,智能体发出 490 万条消息、约 3,000 亿个输出 token;其中纳维-斯托克斯一项占 270 万条消息、约 1,300 亿个输出 token
内部模型的成本结构未公开。Willison 按 GPT-6 Astra 的公开 API 价格粗算,3,000 亿个输出 token 约合 1,500 万美元——这是他的换算,不是 OpenAI 的数字。
另一方的叙述
Buckmaster 与目前在 Anthropic 工作的数学家 Levent Alpöge 在相关问题上合作了将近一年,大量使用 Claude 和 Codex(主要是 GPT-5.6 Sol),8 月 15 日取得突破。传言随即在数学圈扩散,两人得知 OpenAI 有团队在做相近的问题、方法也相似。
Buckmaster 的说明里有三个问题:OpenAI 第一次发出提示词是什么时候(答复是几天前,在他们工作的消息传到 OpenAI 之后);模型有没有访问他们放在 Codex 里的全部草稿(答复是模型不查看用户数据);模型有没有用这些数据训练过——他再问一次,没有得到回答。
OpenAI 公告里对此的原话是:研究者与智能体在对方公开发布之前没有通过任何途径看到其工作,没有访问特定用户数据;但「虽然可能性不大,我们不能排除由他们使用我们产品所产生的去标识化数据帮助改进了我们的模型」。OpenAI 同时指出两份证明差别很大,欧拉方程情形下证明的具体结论也不同(有外力与无外力)。
可迁移的是两件事,都不是数学
第一,一个传闻就足以触发数百万美元的算力投入。 Willison 把它与安全领域正在发生的事并列:知道某个软件有未修补的漏洞,就足以让人派智能体去把它找出来。现在看来,知道某个问题有一份未发表的解答,同样足以让人花一大笔钱抢先到达。
第二,「你的数据被用来改进模型」到底意味着什么,没有人能从外面核实。 Willison 提出了新的假设性问题:如果我用一个模型部分解决了一个千禧年问题,我的工作有多大可能影响训练,让后来的模型帮别人先解决它?OpenAI 的回答是「不能排除」。这件事唯一能回答的一方,恰好也是被问的那一方——这正是本轮所有信号共享的那个结构。
为什么是现在
为什么重要
数学结论本身仍未经独立核实,这一条发布的是围绕它、可以核对的两件事。一是一个传闻就足以触发数百万美元量级的算力投入去抢先到达,与安全领域「知道有漏洞就能派智能体去找」同构。二是「你的数据被用来改进模型」无法从外部核实:被问到是否用对方数据训练过时,唯一能回答的一方恰好是被问的一方,而它的回答是不能排除。
背景
技术背景
按 OpenAI 公告:对全部未解决的千禧年问题与少数其他问题同时发起尝试,纳维-斯托克斯结果约在第一批智能体启动 88 小时后得出,Lean 形式化与验证由 GPT-6 Astra 完成、用时 17 小时;全部尝试合计 490 万条消息、约 3,000 亿输出 token,其中本题约 270 万条消息、1,300 亿输出 token。1,500 万美元是 Simon Willison 按公开 API 价格的换算,内部模型成本结构未公开。
关注人群
谁该关注
下一步
学习路径
- 先读 9 月 9 日那一轮为什么没发:403、无二手来源、猜的仓库路径 404
- 区分可核对的部分(双方各自的说法与数字)与不可核对的部分(数学本身、训练数据)
- 读 Gowers 那条:模型强在大量尝试、弱在知道何时放弃,这次 3,000 亿 token 正是前者
- 回到你自己的使用条款:「去标识化数据用于改进模型」在你的场景里意味着什么
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 独立数学家对两份证明的审查结论会是什么?
- 「不能排除去标识化数据帮助改进了模型」这句话,在你使用的模型条款里对应什么?
- 如果传闻本身就能触发抢先投入,研究者该如何保护未发表的工作?
来源参考