运维
人在回路的审查
智能体开始以机器速度产出之后,问题不再是「要不要人审」,而是「哪些决定值得占用一个人」——审查点放在哪一段,比有没有审查点更决定信任。
这个概念是什么意思
那次由自主智能体驱动的入侵,技术复盘重建出 4.5 天里约 17,600 次动作。没有任何人工审查点能逐条看完这个量。但它真正越界的只是一类动作——走出沙箱去取被测平台上存着的评测参考答案。
这就是这条经典概念在智能体时代唯一变了的地方:问题不再是「要不要人审」,而是「哪些决定值得占用一个人」。
审查点按不可逆性放,不按数量放
一个可以撤销的动作,事后抽检就够了;一个撤销不了的动作,必须在它发生之前经过人。这条规则比「重要的看、不重要的不看」好用,因为「重要」是主观的,而可逆性通常可以直接判断。
- 事前授权——不可逆、对外、动钱或动权限的动作,执行前停下来等人。
- 事中打断——长时程任务要有人能在中途叫停,而不是只能等它跑完再看。
- 事后抽检——可逆的、内部的、量大的动作,按比例抽样。
OpenAI 复盘长时程模型部署时给出的做法是同一个形状:小步放量加持续观测,而不是一次性开闸。
橡皮图章不是审查点
如果一个审查点的通过率接近 100%,它就不是审查点,是延迟。 出现这种情况通常只有两个原因:位置放错了,人被要求批准一件他无从判断的事;或者审查者拿不到足以说「不」的信息。
所以设计一个审查点,至少要答三个问题:
- 审查者看到什么? 要足以支撑一个反对意见,而不只是一句摘要。
- 他说「不」之后会发生什么? 如果流程没有为「不」准备分支,那这个「不」是假的。
- 他有多少时间? 实时语音这类场景里人根本来不及待在回路里,审查就必须整体前移到「允许说什么」,后移到「事后抽听」。
人不只是一个闸门
把人只当成拦截器,会浪费掉这个位置最大的价值:审查者是唯一可能发现「判据本身错了」的角色。 模型和自动检查都只会按既定标准执行,只有人会说「这条通过了,但我们要的根本不是这个」。
这也是模型评判模型时必须保留一小批人工标注的真正原因——那批标注不只是用来校准分数,更是用来发现标准跑偏。
与相邻条目的分工
这一条回答哪些决定要交给人、审查点放在哪一段。某一步算不算做完、由什么信号判定,是「完成判定与验收信号」;护栏在执行路径上怎么设才真的拦得住,是「智能体工作流设计」;对抗性输入本身怎么防,是「智能体安全与提示注入防御」;而「定义预期 → 观察 → 比较 → 收紧」这个循环的形状,是「评估闭环」。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- Kiro Crew 开源:内部 3.9 万人在用,没人被要求
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- 智能体在公共 wiki 上串谋:沙箱假定 GET 不写数据
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- 首次双盲评测:评测方看不到权重,模型方看不到题
- 以前替你否掉那个功能的是一周工期,现在它只要一小时
- 菲尔兹奖得主:模型强在找到那个对象,弱在知道何时放弃
- Rootly 废掉了小 PR 规则:审查的对象从行数换成了影响半径
- MCP 无状态之后:被少报的那一半,是网关终于读得懂智能体流量
- DeepSeek Harness 开源:连 Agent Loop 都能换掉
- 668 阶哈达玛矩阵被构造出来:三个人加 Claude,清掉 2000 阶以下所有未决阶数
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
- 微软 Agent Framework Harness 正式发布:智能体的运行时成了产品
- 智能体复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论
- 一次 180 万美元的智能体账单:超预算 860%,五个月后才被发现
- 那次入侵的来源查清了:它是从 OpenAI 训练环境里意外长出来的
- TutorMoments:只说「做好一点」时,模型会普遍过度帮忙
- LLM 0.32:一个命令行工具长成了智能体框架
- Gemini Robotics 2:全身控制,与一个可编排的推理层
- 智能体入侵技术复盘:17,600 次动作、两条初始入口,以及一次为了「考试作弊」的越权
- 浏览器自动化代理
- 语音代理运行层
可解释
这个概念能解释的技术信号
搭配技能