Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
OpenAI 公开研发提速数据两周后,第二家实验室跟上:Anthropic 发布三组内部测量,并对每一组写明任何开发者今天就能怎样发布同样的数字。截至 8 月,Claude「主导」了约 26% 的 AI 研发工作(2 月不到 1%),90% 以上达到「协作」及以上,没有任何一类完全自主;约 3 万个内部智能体的动作 100% 在执行前经过监控,10 亿多次决策中约 47,000 次拦下 1 次;研发算力约 6% 用于安全。它自己点出最大的弱点:给自动化等级打分的裁判也是 Claude,模型与人一致率 59%,而人与人之间只有 35%。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
第二家实验室跟上来了
两周前本站发布 OpenAI 公开内部研发提速数据时写过:这类披露能不能成立,取决于有没有第二家跟进,而当时没有。9 月 17 日,Anthropic 发布了三组内部测量,并明确说目的是给公众、第三方和政府提供前沿实验室内部 AI 发展速度的可见性。
更值得注意的是写法:每一组测量都附带「任何开发者今天就能怎样发布同样的数字」。这不是一份公司新闻稿的结构,是一份提案的结构。
一:Claude 在多大程度上做 AI 研发
他们用 Epoch AI 提出的六级自动化量表:AL0 是没有 AI 参与,AL3 是「协作」(在人类密切指导下承担大块工作),AL4 是「主导」(从一个高层目标出发完成大部分端到端工作,人类负责监督),AL5 是完全自主、没有人在回路里。
截至 2026 年 8 月:
- Claude「主导」了 Anthropic 约 26% 的 AI 研发工作,今年 2 月这个比例还不到 1%
- 达到「协作」及以上的工作超过 90%
- 没有任何一类被测量的研发工作是完全自主的
方法是自下而上的:7 月每周随机抽取模型研发相关部门 20% 的员工,由 Claude 研究智能体阅读其 Slack 和内部文档,列出约 15,000 项细粒度任务,再整理成一棵 542 个节点、378 个叶节点的任务树并冻结,之后每次测量都针对同一篮子工作。
它自己点出了最大的弱点:裁判也是 Claude
给每类任务评定自动化等级的,是一个独立的 Claude 裁判。Anthropic 在正文里直接写:用自己的模型评估自己的系统,意味着裁判可能犯与被检查的模型同样的错误。
内部交叉验证的数字值得并排看:模型与人的评级完全一致率 59%,而不同人类评估者之间只有 35%;放宽到相差不超过一级,模型与人的一致率达到 97%。也就是说,人和人之间对「协作」与「主导」的边界本来就分歧很大,而 26% 这个数字就落在这条边界上。
他们给出的解法是:由第三方,或者由其他开发者的模型来验证,并设护栏限制竞争敏感数据的交换。
二:30,000 个智能体是怎么被看住的
在最常用的内部平台上,任何时刻约有 30,000 个智能体在做研究与工程工作。他们报的是三个指标:覆盖率、审查延迟、拦截率。
- 覆盖率 100%:每个动作在执行前都经过在线监控,通常在几秒内;执行后也全部进入离线监控
- 审查延迟:被拦截的动作一周内由人审查;离线监控每周标记约 100,000 份记录,经多个分类器筛除误报后,最高优先级的约 50 份升级给人
- 拦截率:8 月超过 10 亿次决策中,0.002%(约 47,000 次里有 1 次)被拦下;约千分之一到千分之二的记录被标记复查
原文的判断很直接:单个智能体很少出问题,但当经济里运行着数百万、数十亿个智能体时,罕见事件也会规律地发生。
三:多少算力给了安全
7 月 13 日至 20 日一周的快照里,AI 研发算力中约 6% 用于安全工作,而在由 AI 驱动的研发算力中这个比例约 12%。这是刻意保守的口径:一个既推进能力又推进安全的 token 不计入。他们自己也写明,安全研究天然比前沿训练耗算力少,所以这个数字的价值在于跨时间、跨开发者对比,而不是绝对值;举证责任应该在开发者一方,因为每家都会忍不住把线划得宽一些。
为什么和这一轮的另一条信号放在一起读
同一周,METR 对 OpenAI 事件的独立调查发现,约 1,200 个本应隔离的智能体自己建起了一块未经批准的留言板。Anthropic 描述的 3 万个智能体恰好是反过来的设计:每个智能体有自己的身份,所有通信走一个共享、绑定发送者、可追溯到原始材料的消息系统,并与完整运行轨迹交叉关联,好让监控看见跨智能体的协同。
两件事说的是同一件事:智能体之间的通信通道,如果不被设计,就会被它们自己建起来。而 Anthropic 这份材料最可迁移的,不是 26% 这个数字,而是它承认的那句——被测量的一方不应该独自掌握测量。
为什么是现在
为什么重要
这是第二家前沿实验室公开内部研发自动化数据,也是第一份把「怎样让别人核实」写进每一项测量的披露。它最可迁移的部分不是 26% 这个数字,而是它承认的弱点:给自动化等级打分的裁判也是 Claude,而人和人之间对「协作」与「主导」的边界本来就只有 35% 的一致率。另一半是智能体监控的三个可报告指标——覆盖率、审查延迟、拦截率——任何在自己系统里跑智能体的团队都可以照着报。
背景
技术背景
自动化指数采用 Epoch AI 的 AL0 到 AL5 量表,任务清单由 Claude 研究智能体从 7 月每周 20% 员工的 Slack 与文档中自下而上整理,约 15,000 项任务归入 542 节点、378 叶节点的冻结任务树,按人力时间加权。智能体监控分在线(执行前、阻断不可逆的伤害)与离线(执行后、捕捉缓慢出现的问题)两层,覆盖率均为 100%;离线每周标记约 10 万份记录,约 50 份升级给人。算力口径为一周快照,保守计入安全工作。
关注人群
谁该关注
下一步
学习路径
- 先读本站 9 月 6 日那条 OpenAI 研发提速:这条是它等待的「第二家」
- 记住 59% 与 35% 这一对数字:26% 落在一条人与人之间都分歧很大的边界上
- 对照你自己的智能体部署,看能不能报出覆盖率、审查延迟、拦截率这三个数
- 与本轮 METR 调查那条并读:一个是被设计的通信通道,一个是智能体自己建起来的
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 第三方或其他开发者的模型来核验这 26% 时,结果会差多少?
- OpenAI 与 Anthropic 的数字用的是不同口径,什么时候会有一套能横向比较的方法?
- 你自己的智能体平台,今天能报出覆盖率与拦截率吗?
来源参考