工具 · 第 2026-08-09

BigBang-v1:把数据生产系统本身当成优化对象以及一处对不上口径

上海交大人工智能学院、深势科技与上海算法创新研究院组成的无尽前沿团队发布 BigBang-v1:35B 参数、推理时约 3B 激活、262K 上下文,后训练数据称 100% 由 AI 自主合成,Apache-2.0 开源。可复用的不是跑分,而是它对任务的两个硬条件——必须同时前沿且可验证;缺一,合成数据都会迅速贬值。附一条核对:报道称它是「首个 RSI 原生训练的基座模型」,而 Hugging Face 上的元数据把它标为 Qwen3.6-35B-A3B 的微调。

量子位2026-08-09值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

前沿模型工作流

记录

信号正文

它主张的是什么

上海交大人工智能学院、深势科技与上海算法创新研究院组成的无尽前沿团队发布 BigBang-v1:35B 参数、推理时约 3B 激活、262K 上下文,后训练数据称 100% 由 AI 自主合成,以科学前沿任务为核心,出题、解题、验证全部交给 AI,不需要人类逐题参与。模型与技术报告同步公开。

厂商给出的成绩:在长程搜索、代码、科学研究、AI 研究等评测中拿下全部 35B 模型里的 10 项第一;在 FrontierScience Research、PaperBench 等高难度科研任务上超过 1T 级的 DeepSeek V4 Pro Preview;BrowseComp 76.5,SWE-Bench Pro 54.2。

这些数字全部是厂商自报的,来源文章本身也带明显的推介口吻(含作者自己的上手演示、无对照、无批评视角)。所以下面只取那个不依赖跑分也成立的部分。

真正可复用的是对任务的两个条件

它把问题从「如何收集更多科学数据」换成了「如何让数据生产系统随着模型能力一起进化」——也就是让数据生产系统本身成为被优化的对象。

要让这样一套系统持续跑下去,任务必须同时满足两条:

  1. 前沿性——任务位于当前知识或模型能力的边界,甚至没有已知最优答案。静态题库会被模型迅速耗尽,而科学前沿会持续产生新问题。
  2. 可验证性——候选方案能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具做客观检查。

缺一,数据都会快速贬值:只前沿而无法验证,系统拿不到可靠训练信号;只可验证而没有难度,任务很快落后于模型能力。这两条比任何跑分都更值得记住,因为它给「合成数据到底该合成什么」提供了一个可以照着筛的判据。

报告顺带否掉了两类常见做法,理由都具体:一类只给模型套一层外壳(比如 harness)让它自己调工具改提示词,底层训练管线原封不动;另一类用大模型给生成数据打分筛选,但评判标准是人类预先写死的规则,不会跟着模型能力一起演化——模型变强之后旧尺子失效,仍然源源不断产出低价值样本。第二条正是本站《评估闭环》里那句「尺子变了没有」的反面:这里的问题不是尺子变了,而是尺子不会变。

一处对不上的口径

报道称 BigBang-v1 是「首个基于 recursive self-improving 原生方式训练出的基座模型」。而 Hugging Face 上的制品(endless-frontier/BigBang-v1,Apache-2.0)元数据把它标为 Qwen/Qwen3.6-35B-A3B 的微调;35B 总参、约 3B 激活与该基座的规格一致。

同一篇报道另一处写的是「后训练数据 100% 由 AI 自主合成」——这句与「微调」自洽,与「基座模型」不自洽。合理的读法是:RSI 发生在后训练阶段,底座是别人的。这不削弱那套数据管线的价值,但把主张的范围收窄了不少。

值得记下来的是这次核对本身只花了一次查询。开放权重的附带好处,是宣传口径可以被制品当场校对——闭源发布连这一步都做不了。

放在这条线上看

本站已发布的 GPT-Red 是自博弈让闭环自己产出下一轮输入,NVIDIA Nemotron 开放数据是把合成数据当作可分发的公共品,TutorMoments 则量出了模型在笼统目标下的行为偏差。这一条补的是中间那一段:当出题的速度成为瓶颈时,被优化的对象应该是出题的系统

它同时是一个提醒——本站 08-10 的信源盘点已经指出,中文信源里产业 PR 的比例明显更高。这条之所以还是被留下,是因为它有可核对的开放制品,而不是因为它的跑分好看。

为什么是现在

为什么重要

模型越强,能给它出题、解题、验证的人越少——高质量训练数据的瓶颈正在从「收集」转移到「出题」。这条信号给出的可复用判据是:能撑起自我进化的任务必须同时具备前沿性与可验证性,缺一数据都会快速贬值。附带一个方法上的收获:它的开放权重让「首个 RSI 原生基座模型」这个宣传口径当场就能被制品校对出偏差。

背景

技术背景

Recursive self-improving 指让 AI 参与迭代自身的模型、算法、数据与研发流程。目前多数落地停在两种形态:给模型套工具外壳,或用大模型对生成数据打分筛选——前者不触动训练管线,后者的评判规则由人预先写死、不随模型能力演化。BigBang 的做法是把数据生产系统本身纳入优化对象,并用「前沿且可验证」这两个条件筛选任务载体,因而选择了科学领域作为训练场:它天然组合了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析与结果写作。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在做合成数据管线、正在纠结「该合成什么」而不是「合成多少」的训练团队评估开源模型时习惯先看跑分、想补一套核对制品与口径的工程负责人关注 recursive self-improving 这条路线落地形态的研究与战略角色需要为领域任务设计可自动验证信号的评测负责人
可能影响的领域
合成数据的任务选型判据自我进化的数据生产管线开放权重带来的宣传口径可核对性科研与工程任务上的评测设计

下一步

学习路径

  1. 先把「前沿性 + 可验证性」这两条拿去筛一遍你现有的合成数据任务,看哪些其实只满足一条
  2. 读《评估闭环》,对照「尺子不会变」这个失败模式——它与「尺子变了」同样致命,但更难察觉
  3. 读《合成数据与数据配方》,把数据质量从「洗出来的」重新理解成「任务属性决定的」
  4. 自己去 Hugging Face 上核对一次模型元数据与报道口径,把这一步变成读任何开源发布的默认动作
  5. 读《模型选型与约束匹配》,判断 35B 总参、约 3B 激活这个规格对你的约束是不是合适

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你的领域里有哪些任务是真正可自动验证的?如果一条都举不出来,这套方法就用不上。
  • 「后训练数据 100% 由 AI 合成」中,用来做验证的那一环是否也完全无人参与?报道没有说清这一点。
  • 技术报告是否给出了数据管线自身迭代的消融实验?没有的话,收益归因于 RSI 还是归因于基座,无法区分。
  • 如果底座是 Qwen3.6-35B-A3B,那么与同底座的其他后训练版本对比,才是能说明问题的对照组——这组数据在哪里?

来源参考

量子位

无尽前沿团队研究实验室2026-08-09
打开原始来源https://www.qbitai.com/2026/08/468782.html