BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
上海交大人工智能学院、深势科技与上海算法创新研究院组成的无尽前沿团队发布 BigBang-v1:35B 参数、推理时约 3B 激活、262K 上下文,后训练数据称 100% 由 AI 自主合成,Apache-2.0 开源。可复用的不是跑分,而是它对任务的两个硬条件——必须同时前沿且可验证;缺一,合成数据都会迅速贬值。附一条核对:报道称它是「首个 RSI 原生训练的基座模型」,而 Hugging Face 上的元数据把它标为 Qwen3.6-35B-A3B 的微调。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
它主张的是什么
上海交大人工智能学院、深势科技与上海算法创新研究院组成的无尽前沿团队发布 BigBang-v1:35B 参数、推理时约 3B 激活、262K 上下文,后训练数据称 100% 由 AI 自主合成,以科学前沿任务为核心,出题、解题、验证全部交给 AI,不需要人类逐题参与。模型与技术报告同步公开。
厂商给出的成绩:在长程搜索、代码、科学研究、AI 研究等评测中拿下全部 35B 模型里的 10 项第一;在 FrontierScience Research、PaperBench 等高难度科研任务上超过 1T 级的 DeepSeek V4 Pro Preview;BrowseComp 76.5,SWE-Bench Pro 54.2。
这些数字全部是厂商自报的,来源文章本身也带明显的推介口吻(含作者自己的上手演示、无对照、无批评视角)。所以下面只取那个不依赖跑分也成立的部分。
真正可复用的是对任务的两个条件
它把问题从「如何收集更多科学数据」换成了「如何让数据生产系统随着模型能力一起进化」——也就是让数据生产系统本身成为被优化的对象。
要让这样一套系统持续跑下去,任务必须同时满足两条:
- 前沿性——任务位于当前知识或模型能力的边界,甚至没有已知最优答案。静态题库会被模型迅速耗尽,而科学前沿会持续产生新问题。
- 可验证性——候选方案能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具做客观检查。
缺一,数据都会快速贬值:只前沿而无法验证,系统拿不到可靠训练信号;只可验证而没有难度,任务很快落后于模型能力。这两条比任何跑分都更值得记住,因为它给「合成数据到底该合成什么」提供了一个可以照着筛的判据。
报告顺带否掉了两类常见做法,理由都具体:一类只给模型套一层外壳(比如 harness)让它自己调工具改提示词,底层训练管线原封不动;另一类用大模型给生成数据打分筛选,但评判标准是人类预先写死的规则,不会跟着模型能力一起演化——模型变强之后旧尺子失效,仍然源源不断产出低价值样本。第二条正是本站《评估闭环》里那句「尺子变了没有」的反面:这里的问题不是尺子变了,而是尺子不会变。
一处对不上的口径
报道称 BigBang-v1 是「首个基于 recursive self-improving 原生方式训练出的基座模型」。而 Hugging Face 上的制品(endless-frontier/BigBang-v1,Apache-2.0)元数据把它标为 Qwen/Qwen3.6-35B-A3B 的微调;35B 总参、约 3B 激活与该基座的规格一致。
同一篇报道另一处写的是「后训练数据 100% 由 AI 自主合成」——这句与「微调」自洽,与「基座模型」不自洽。合理的读法是:RSI 发生在后训练阶段,底座是别人的。这不削弱那套数据管线的价值,但把主张的范围收窄了不少。
值得记下来的是这次核对本身只花了一次查询。开放权重的附带好处,是宣传口径可以被制品当场校对——闭源发布连这一步都做不了。
放在这条线上看
本站已发布的 GPT-Red 是自博弈让闭环自己产出下一轮输入,NVIDIA Nemotron 开放数据是把合成数据当作可分发的公共品,TutorMoments 则量出了模型在笼统目标下的行为偏差。这一条补的是中间那一段:当出题的速度成为瓶颈时,被优化的对象应该是出题的系统。
它同时是一个提醒——本站 08-10 的信源盘点已经指出,中文信源里产业 PR 的比例明显更高。这条之所以还是被留下,是因为它有可核对的开放制品,而不是因为它的跑分好看。
为什么是现在
为什么重要
模型越强,能给它出题、解题、验证的人越少——高质量训练数据的瓶颈正在从「收集」转移到「出题」。这条信号给出的可复用判据是:能撑起自我进化的任务必须同时具备前沿性与可验证性,缺一数据都会快速贬值。附带一个方法上的收获:它的开放权重让「首个 RSI 原生基座模型」这个宣传口径当场就能被制品校对出偏差。
背景
技术背景
Recursive self-improving 指让 AI 参与迭代自身的模型、算法、数据与研发流程。目前多数落地停在两种形态:给模型套工具外壳,或用大模型对生成数据打分筛选——前者不触动训练管线,后者的评判规则由人预先写死、不随模型能力演化。BigBang 的做法是把数据生产系统本身纳入优化对象,并用「前沿且可验证」这两个条件筛选任务载体,因而选择了科学领域作为训练场:它天然组合了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析与结果写作。
关注人群
谁该关注
下一步
学习路径
- 先把「前沿性 + 可验证性」这两条拿去筛一遍你现有的合成数据任务,看哪些其实只满足一条
- 读《评估闭环》,对照「尺子不会变」这个失败模式——它与「尺子变了」同样致命,但更难察觉
- 读《合成数据与数据配方》,把数据质量从「洗出来的」重新理解成「任务属性决定的」
- 自己去 Hugging Face 上核对一次模型元数据与报道口径,把这一步变成读任何开源发布的默认动作
- 读《模型选型与约束匹配》,判断 35B 总参、约 3B 激活这个规格对你的约束是不是合适
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你的领域里有哪些任务是真正可自动验证的?如果一条都举不出来,这套方法就用不上。
- 「后训练数据 100% 由 AI 合成」中,用来做验证的那一环是否也完全无人参与?报道没有说清这一点。
- 技术报告是否给出了数据管线自身迭代的消融实验?没有的话,收益归因于 RSI 还是归因于基座,无法区分。
- 如果底座是 Qwen3.6-35B-A3B,那么与同底座的其他后训练版本对比,才是能说明问题的对照组——这组数据在哪里?
来源参考