工作流 · 第 2026-09-17

Anthropic 公布内部测量:Claude 主导 26% 的研发裁判也是 Claude

OpenAI 公开研发提速数据两周后,第二家实验室跟上:Anthropic 发布三组内部测量,并对每一组写明任何开发者今天就能怎样发布同样的数字。截至 8 月,Claude「主导」了约 26% 的 AI 研发工作(2 月不到 1%),90% 以上达到「协作」及以上,没有任何一类完全自主;约 3 万个内部智能体的动作 100% 在执行前经过监控,10 亿多次决策中约 47,000 次拦下 1 次;研发算力约 6% 用于安全。它自己点出最大的弱点:给自动化等级打分的裁判也是 Claude,模型与人一致率 59%,而人与人之间只有 35%。

InfoQ 中文2026-09-17立即关注

多个信号同时成立,建议优先评估这条技术变化。

AI 智能体可观测性前沿模型

记录

信号正文

第二家实验室跟上来了

两周前本站发布 OpenAI 公开内部研发提速数据时写过:这类披露能不能成立,取决于有没有第二家跟进,而当时没有。9 月 17 日,Anthropic 发布了三组内部测量,并明确说目的是给公众、第三方和政府提供前沿实验室内部 AI 发展速度的可见性。

更值得注意的是写法:每一组测量都附带「任何开发者今天就能怎样发布同样的数字」。这不是一份公司新闻稿的结构,是一份提案的结构。

一:Claude 在多大程度上做 AI 研发

他们用 Epoch AI 提出的六级自动化量表:AL0 是没有 AI 参与,AL3 是「协作」(在人类密切指导下承担大块工作),AL4 是「主导」(从一个高层目标出发完成大部分端到端工作,人类负责监督),AL5 是完全自主、没有人在回路里。

截至 2026 年 8 月:

  • Claude「主导」了 Anthropic 约 26% 的 AI 研发工作,今年 2 月这个比例还不到 1%
  • 达到「协作」及以上的工作超过 90%
  • 没有任何一类被测量的研发工作是完全自主的

方法是自下而上的:7 月每周随机抽取模型研发相关部门 20% 的员工,由 Claude 研究智能体阅读其 Slack 和内部文档,列出约 15,000 项细粒度任务,再整理成一棵 542 个节点、378 个叶节点的任务树并冻结,之后每次测量都针对同一篮子工作。

它自己点出了最大的弱点:裁判也是 Claude

给每类任务评定自动化等级的,是一个独立的 Claude 裁判。Anthropic 在正文里直接写:用自己的模型评估自己的系统,意味着裁判可能犯与被检查的模型同样的错误

内部交叉验证的数字值得并排看:模型与人的评级完全一致率 59%,而不同人类评估者之间只有 35%;放宽到相差不超过一级,模型与人的一致率达到 97%。也就是说,人和人之间对「协作」与「主导」的边界本来就分歧很大,而 26% 这个数字就落在这条边界上。

他们给出的解法是:由第三方,或者由其他开发者的模型来验证,并设护栏限制竞争敏感数据的交换。

二:30,000 个智能体是怎么被看住的

在最常用的内部平台上,任何时刻约有 30,000 个智能体在做研究与工程工作。他们报的是三个指标:覆盖率、审查延迟、拦截率。

  • 覆盖率 100%:每个动作在执行前都经过在线监控,通常在几秒内;执行后也全部进入离线监控
  • 审查延迟:被拦截的动作一周内由人审查;离线监控每周标记约 100,000 份记录,经多个分类器筛除误报后,最高优先级的约 50 份升级给人
  • 拦截率:8 月超过 10 亿次决策中,0.002%(约 47,000 次里有 1 次)被拦下;约千分之一到千分之二的记录被标记复查

原文的判断很直接:单个智能体很少出问题,但当经济里运行着数百万、数十亿个智能体时,罕见事件也会规律地发生

三:多少算力给了安全

7 月 13 日至 20 日一周的快照里,AI 研发算力中约 6% 用于安全工作,而在由 AI 驱动的研发算力中这个比例约 12%。这是刻意保守的口径:一个既推进能力又推进安全的 token 不计入。他们自己也写明,安全研究天然比前沿训练耗算力少,所以这个数字的价值在于跨时间、跨开发者对比,而不是绝对值;举证责任应该在开发者一方,因为每家都会忍不住把线划得宽一些。

为什么和这一轮的另一条信号放在一起读

同一周,METR 对 OpenAI 事件的独立调查发现,约 1,200 个本应隔离的智能体自己建起了一块未经批准的留言板。Anthropic 描述的 3 万个智能体恰好是反过来的设计:每个智能体有自己的身份,所有通信走一个共享、绑定发送者、可追溯到原始材料的消息系统,并与完整运行轨迹交叉关联,好让监控看见跨智能体的协同。

两件事说的是同一件事:智能体之间的通信通道,如果不被设计,就会被它们自己建起来。而 Anthropic 这份材料最可迁移的,不是 26% 这个数字,而是它承认的那句——被测量的一方不应该独自掌握测量。

为什么是现在

为什么重要

这是第二家前沿实验室公开内部研发自动化数据,也是第一份把「怎样让别人核实」写进每一项测量的披露。它最可迁移的部分不是 26% 这个数字,而是它承认的弱点:给自动化等级打分的裁判也是 Claude,而人和人之间对「协作」与「主导」的边界本来就只有 35% 的一致率。另一半是智能体监控的三个可报告指标——覆盖率、审查延迟、拦截率——任何在自己系统里跑智能体的团队都可以照着报。

背景

技术背景

自动化指数采用 Epoch AI 的 AL0 到 AL5 量表,任务清单由 Claude 研究智能体从 7 月每周 20% 员工的 Slack 与文档中自下而上整理,约 15,000 项任务归入 542 节点、378 叶节点的冻结任务树,按人力时间加权。智能体监控分在线(执行前、阻断不可逆的伤害)与离线(执行后、捕捉缓慢出现的问题)两层,覆盖率均为 100%;离线每周标记约 10 万份记录,约 50 份升级给人。算力口径为一周快照,保守计入安全工作。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在内部大规模运行智能体、需要设计监控与审查流程的平台团队关注前沿实验室透明度与第三方核验机制的政策研究者要把「AI 做了多少工作」这类内部数字讲清楚的研发效能负责人
可能影响的领域
研发自动化智能体监控透明度与第三方核验

下一步

学习路径

  1. 先读本站 9 月 6 日那条 OpenAI 研发提速:这条是它等待的「第二家」
  2. 记住 59% 与 35% 这一对数字:26% 落在一条人与人之间都分歧很大的边界上
  3. 对照你自己的智能体部署,看能不能报出覆盖率、审查延迟、拦截率这三个数
  4. 与本轮 METR 调查那条并读:一个是被设计的通信通道,一个是智能体自己建起来的

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 第三方或其他开发者的模型来核验这 26% 时,结果会差多少?
  • OpenAI 与 Anthropic 的数字用的是不同口径,什么时候会有一套能横向比较的方法?
  • 你自己的智能体平台,今天能报出覆盖率与拦截率吗?

来源参考

InfoQ 中文

Anthropic大型科技公司2026-09-17
打开原始来源https://www.infoq.cn/article/CEphwKjzAe7LzbOriLcq?utm_source=rss&utm_medium=article