工作流 · 第 2026-09-06

每个研究员配 3.1 个智能体,而一半仍要插手

OpenAI 公布内部数据:截至 8 月中旬,按 8 小时工作日折算,每个研究员身边约有 3.1 个智能体工作日在并行跑,中位数研究员每天消耗的智能体推理资源超过 600 美元,并据此宣布达成「自动化 AI 研究实习生」。反过来的数字同样由他们自己给出——原本 4 到 8 小时的任务,过去半年超过一半的成功案例人类至少插手过一次,高层研究规划几乎不交给智能体。作者的主张不是提速而是可见性:递归式自我改进默认只发生在少数几家实验室内部,外界看不见它走到了哪一步。同日首席科学家发长文,主张我们并不理解这个被提速的东西。

OpenAI News2026-09-06立即关注

多个信号同时成立,建议优先评估这条技术变化。

AI 智能体前沿模型工作流

记录

信号正文

公布的数字

截至 2026 年 8 月中旬,按 8 小时工作日折算,OpenAI 每个研究员每工作一天,身边约有 3.1 个智能体工作日在并行运转。按 API 价格计算,中位数研究员每天消耗的智能体推理资源超过 600 美元

这些智能体在做的事列得很具体:写研究代码、写基础设施代码、搭训练环境、跑评估实验、排查工具与环境故障、分析实验结果、盯训练任务,以及整理和沟通研究结论。

一个可观察的连带变化:以前实验环境挂了,研究员要去内部频道喊人;现在这类事越来越多由智能体处理,人工答疑量下降,有的团队直接取消了固定的技术答疑时间。2026 年 8 月,人均实验数创下 2025 年 1 月有统计以来的新高。

据此 OpenAI 宣布已达成自动化 AI 研究实习生——一个能在人类指导下独立完成边界清晰的研究任务的研发节点,其中一些任务原本熟练研究员要做好几天。下一个目标是 2028 年 3 月前实现「自动化 AI 研究员」,区别在于能扛更开放的目标、自己推进更长周期的项目。

反过来的那个数字,同样是他们自己给的

原本需要 4 到 8 小时的任务,过去半年里超过一半的成功案例,人类至少插手过一次。 高层研究规划几乎不交给智能体。研究员依然负责决定研究什么、哪些结果值得继续,以及什么时候扩大训练、暂停实验或部署模型。

这两组数字必须并排读。前者说明产能变了,后者说明被替换掉的是执行而不是判断——这与本站已发布的 Rootly 与 Willison 两条是同一层:能力涨很多倍时,团队存在的理由从分摊打字变成分摊审阅。

真正的主张不是提速,是可见性

这篇文章的作者 Kevin Liu 把它放进了更大的背景:递归式自我改进很可能是未来几年推动能力跃迁的最重要因素之一,而按目前的趋势,这种能力默认只会出现在少数几家前沿实验室内部,外界很难看见它进展到了哪一步

因此他的结论是透明披露比任何时候都更紧迫——模型在多快地变强、研发节奏要不要踩刹车,不该只由几家公司关起门来决定。他并且喊话其他 AI 公司也公开类似数据。

这是一家前沿实验室第一次公布这类内部研发提速数据,而公布它的人同时在论证公布本身是必要的。 那个论证能不能站住,取决于是否有第二家跟进——目前没有。

同一天的另一半:首席科学家在劝减速

首席科学家 Jakub Pachocki 同日发表长文《外星思维》,主张两点:

  1. AI 不是人类照着设计图一块芯片一条规则拼出来的,它更像在海量数据和算力里自己长出来的。你能拆开看明白其中一些零件,但整个系统为什么突然具备某种能力、换个环境又会怎么行动,没人说得清
  2. AI 用不着全方位碾压人类才会出问题,只要在足够多的关键能力上比人强,它就既能帮大忙也能捅大娄子。

把这两篇放在一起读才完整:一篇说我们把研发速度提上去了,另一篇说我们并不理解被提速的这个东西。

一个口径说明

openai.com 对本站的直接抓取返回 403,所以以上事实来自量子位对这两篇文章的二手报道,而不是公告原文。英伟达方面的说法(Astra 用约 10 万套 Grace Blackwell NVLink72 训练、后续还有 40 万套 GPU 上线)同样来自该报道,未经一手核对。

为什么是现在

为什么重要

这是一家前沿实验室第一次公布自己研发被智能体提速了多少,而且两个方向的数字都给了:3.1 个并行智能体工作日、每天 600 美元,对上「超过一半的成功案例仍需人至少插手一次」。更重要的是作者自己给出的理由——递归式自我改进默认只发生在几家公司内部,外界看不见进度,所以披露比任何时候都紧迫。这条主张能不能站住,取决于有没有第二家跟进。

背景

技术背景

智能体承担的是边界清晰的执行类任务:研究代码、基础设施代码、训练环境、评估实验、故障排查、结果分析、训练任务监控。被明确保留在人这一侧的是决定研究什么、判断哪些结果值得继续,以及何时扩大训练、暂停实验或部署模型。所谓「实习生」到「研究员」的差别,按 OpenAI 自己的定义是能不能扛开放目标和更长周期的项目。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在估算智能体对自己团队产能影响的技术负责人关心前沿能力增长速度是否可被外部观察的研究者与政策相关人员需要为智能体推理预算定上限的工程管理者
可能影响的领域
研发流程递归式自我改进披露与可见性

下一步

学习路径

  1. 把 3.1 与「超过一半仍需插手」并排记住:产能变了,判断没有被替换
  2. 读《反馈闭环与团队学习》:人均实验数创新高,衡量的是团队学习速度而不是模型能力
  3. 算你自己的账:每天 600 美元是按 API 价格折算的,换成你的用量和单价再看一遍
  4. 读《人在回路的审查》:这条信号里保留在人手上的三件事,恰好都是不可逆或对外的决定
  5. 把它与本站的双盲评测、BenchMIRT 并读——三条都在处理同一个问题:外界能看见什么

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 会有第二家实验室公布同类数据吗?没有的话这条主张就只是一次单方面披露。
  • 每天 600 美元是中位数,分布的尾巴在哪里?
  • 那「超过一半需要插手」的比例,半年里是在下降还是稳定?

来源参考

OpenAI News

OpenAI大型科技公司2026-09-06
打开原始来源https://openai.com/index/research-acceleration-view-inside-openai