每个研究员配 3.1 个智能体,而一半仍要人插手
OpenAI 公布内部数据:截至 8 月中旬,按 8 小时工作日折算,每个研究员身边约有 3.1 个智能体工作日在并行跑,中位数研究员每天消耗的智能体推理资源超过 600 美元,并据此宣布达成「自动化 AI 研究实习生」。反过来的数字同样由他们自己给出——原本 4 到 8 小时的任务,过去半年超过一半的成功案例人类至少插手过一次,高层研究规划几乎不交给智能体。作者的主张不是提速而是可见性:递归式自我改进默认只发生在少数几家实验室内部,外界看不见它走到了哪一步。同日首席科学家发长文,主张我们并不理解这个被提速的东西。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
公布的数字
截至 2026 年 8 月中旬,按 8 小时工作日折算,OpenAI 每个研究员每工作一天,身边约有 3.1 个智能体工作日在并行运转。按 API 价格计算,中位数研究员每天消耗的智能体推理资源超过 600 美元。
这些智能体在做的事列得很具体:写研究代码、写基础设施代码、搭训练环境、跑评估实验、排查工具与环境故障、分析实验结果、盯训练任务,以及整理和沟通研究结论。
一个可观察的连带变化:以前实验环境挂了,研究员要去内部频道喊人;现在这类事越来越多由智能体处理,人工答疑量下降,有的团队直接取消了固定的技术答疑时间。2026 年 8 月,人均实验数创下 2025 年 1 月有统计以来的新高。
据此 OpenAI 宣布已达成自动化 AI 研究实习生——一个能在人类指导下独立完成边界清晰的研究任务的研发节点,其中一些任务原本熟练研究员要做好几天。下一个目标是 2028 年 3 月前实现「自动化 AI 研究员」,区别在于能扛更开放的目标、自己推进更长周期的项目。
反过来的那个数字,同样是他们自己给的
原本需要 4 到 8 小时的任务,过去半年里超过一半的成功案例,人类至少插手过一次。 高层研究规划几乎不交给智能体。研究员依然负责决定研究什么、哪些结果值得继续,以及什么时候扩大训练、暂停实验或部署模型。
这两组数字必须并排读。前者说明产能变了,后者说明被替换掉的是执行而不是判断——这与本站已发布的 Rootly 与 Willison 两条是同一层:能力涨很多倍时,团队存在的理由从分摊打字变成分摊审阅。
真正的主张不是提速,是可见性
这篇文章的作者 Kevin Liu 把它放进了更大的背景:递归式自我改进很可能是未来几年推动能力跃迁的最重要因素之一,而按目前的趋势,这种能力默认只会出现在少数几家前沿实验室内部,外界很难看见它进展到了哪一步。
因此他的结论是透明披露比任何时候都更紧迫——模型在多快地变强、研发节奏要不要踩刹车,不该只由几家公司关起门来决定。他并且喊话其他 AI 公司也公开类似数据。
这是一家前沿实验室第一次公布这类内部研发提速数据,而公布它的人同时在论证公布本身是必要的。 那个论证能不能站住,取决于是否有第二家跟进——目前没有。
同一天的另一半:首席科学家在劝减速
首席科学家 Jakub Pachocki 同日发表长文《外星思维》,主张两点:
- AI 不是人类照着设计图一块芯片一条规则拼出来的,它更像在海量数据和算力里自己长出来的。你能拆开看明白其中一些零件,但整个系统为什么突然具备某种能力、换个环境又会怎么行动,没人说得清。
- AI 用不着全方位碾压人类才会出问题,只要在足够多的关键能力上比人强,它就既能帮大忙也能捅大娄子。
把这两篇放在一起读才完整:一篇说我们把研发速度提上去了,另一篇说我们并不理解被提速的这个东西。
一个口径说明
openai.com 对本站的直接抓取返回 403,所以以上事实来自量子位对这两篇文章的二手报道,而不是公告原文。英伟达方面的说法(Astra 用约 10 万套 Grace Blackwell NVLink72 训练、后续还有 40 万套 GPU 上线)同样来自该报道,未经一手核对。
为什么是现在
为什么重要
这是一家前沿实验室第一次公布自己研发被智能体提速了多少,而且两个方向的数字都给了:3.1 个并行智能体工作日、每天 600 美元,对上「超过一半的成功案例仍需人至少插手一次」。更重要的是作者自己给出的理由——递归式自我改进默认只发生在几家公司内部,外界看不见进度,所以披露比任何时候都紧迫。这条主张能不能站住,取决于有没有第二家跟进。
背景
技术背景
智能体承担的是边界清晰的执行类任务:研究代码、基础设施代码、训练环境、评估实验、故障排查、结果分析、训练任务监控。被明确保留在人这一侧的是决定研究什么、判断哪些结果值得继续,以及何时扩大训练、暂停实验或部署模型。所谓「实习生」到「研究员」的差别,按 OpenAI 自己的定义是能不能扛开放目标和更长周期的项目。
关注人群
谁该关注
下一步
学习路径
- 把 3.1 与「超过一半仍需插手」并排记住:产能变了,判断没有被替换
- 读《反馈闭环与团队学习》:人均实验数创新高,衡量的是团队学习速度而不是模型能力
- 算你自己的账:每天 600 美元是按 API 价格折算的,换成你的用量和单价再看一遍
- 读《人在回路的审查》:这条信号里保留在人手上的三件事,恰好都是不可逆或对外的决定
- 把它与本站的双盲评测、BenchMIRT 并读——三条都在处理同一个问题:外界能看见什么
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 会有第二家实验室公布同类数据吗?没有的话这条主张就只是一次单方面披露。
- 每天 600 美元是中位数,分布的尾巴在哪里?
- 那「超过一半需要插手」的比例,半年里是在下降还是稳定?
来源参考