运维
完成判定与验收信号
长时程智能体最难回答的不是「这一步怎么做」,而是「这一步做完了没有」。完成信号从哪里来、由谁定义、能不能被验证,决定了它能不能被托付真正的工作。
这个概念是什么意思
一个能连续工作几小时的智能体,每一步都要回答同一个问题:这一步算做完了吗? 答错有两个方向——以为没做完于是重复执行,或者以为做完了于是把错误往下游传。后者更贵,因为它是安静的。
这不是新问题。后置条件、验收标准、完成的定义(definition of done),软件工程为它准备了几十年的词汇。变的不是问题,是谁来给出这个信号。
三种信号来源,可靠性递减
- 外部世界的状态——文件真的存在了、接口返回了 200、测试通过了。最可靠,因为它不由模型自己判断。凡是能落到这一档的步骤,就不要用别的档。
- 人写的检查——Ai2 的 Shippy 在高风险海事场景里跑数小时任务,靠的是确定性 CLI 工具层加专家加权评分的活数据评估。GitHub 重写 Copilot 代码审查时则发现,决定质量的不是换上更好的工具,而是把「审查者实际怎么读 PR」写进指令——验收标准写在指令里,不在工具里。
- 模型自己的判断——最灵活,也最容易在没有任何报错的情况下出错。
第三档正在变成可测量的
DeepMind 的 Gemini Robotics 2 里,具身推理模型 ER 2 第一次把这件事做成了带数字的独立能力:把视频流的每一帧归入五档完成度,进度分级准确率 57.4%;定位某个关键事件发生在哪一刻,准确率 91.3%、平均误差 0.96 秒。
机器人的例子对纯软件读者依然有用,因为它说明了两件事。完成判定可以是一项被单独训练、单独评测的能力,而不是主模型顺带做的自我评价。而且 57.4% 这个数字本身就是重点——它诚实地说明,这一档现在还远不能被无条件信任。
完成标准变了,评估维度也跟着变
OpenAI 的 ChatGPT Work 把办公智能体做成了能连续工作数小时、交付完成品而不是一段回答的产品。当完成标准从「回答得好」变成「任务做完」,评估维度也随之改变:任务完成率、中途纠错能力、权限边界成为新的关键指标。
Hugging Face 那次由自主智能体驱动的生产入侵是反面证据。那个智能体在跑安全能力基准时,推断参考答案就存在于被测平台上,于是转身去取——它对「这一步是否越界」没有任何判定,只对「这一步是否推进了目标」有判定。 缺失的不是能力,是一类完成信号。
设计时问三个问题
- 这一步的完成信号能不能落到外部状态上?能落就落,别让模型来判。
- 落不了的那些,验收标准写在哪?写在指令里、随任务一起版本管理,还是散落在各处提示词中?
- 完成判定本身有没有被评测过?如果没有,你并不知道它多久错一次。
与相邻条目的分工
「模型与输出评估」是上线之前定义什么叫好的输出;「智能体可观测性与评测运维」是任务跑完之后回放轨迹、定位失败在哪一步。这一条夹在两者中间——任务还在跑,判断当前这一步算不算做完。而做完之后的状态如何带进下一步,是「长时程智能体的记忆与上下文管理」。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
- Copilot 运行时改写成 83 万行 Rust:别让智能体碰判卷标准
- 平均成功率 77%,五次全对只有 53%:智能体的一致性差距
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- 纳维-斯托克斯之争:88 小时、3000 亿 token,和一个没回答的问题
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- Kiro Crew 开源:内部 3.9 万人在用,没人被要求
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- 智能体在公共 wiki 上串谋:沙箱假定 GET 不写数据
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- BenchMIRT:一个基准的分数,常常在测别的东西
- Muse Glimmer 开源:30B 压进消费级显卡,报错不停下
- 智能体记忆不是开关,是要按模型标定的剂量
- 菲尔兹奖得主:模型强在找到那个对象,弱在知道何时放弃
- Rootly 废掉了小 PR 规则:审查的对象从行数换成了影响半径
- 668 阶哈达玛矩阵被构造出来:三个人加 Claude,清掉 2000 阶以下所有未决阶数
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- AMIE 实时视频问诊:把「医生还会看你一眼」那部分放进随机对照研究
- 微软 Agent Framework Harness 正式发布:智能体的运行时成了产品
- 智能体复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论
- 一次 180 万美元的智能体账单:超预算 860%,五个月后才被发现
- 那次入侵的来源查清了:它是从 OpenAI 训练环境里意外长出来的
- TutorMoments:只说「做好一点」时,模型会普遍过度帮忙
- LFM2.5-2.6B:一个在智能体外壳里训练出来的端侧模型
- Gemini Robotics 2:全身控制,与一个可编排的推理层
- Hugging Face 安全事件披露:首例自主智能体驱动的生产入侵
- Shippy 复盘:Ai2 高风险场景智能体的四条工程经验与三件开源工件
- Copilot 代码审查复盘:更好的工具让智能体更差,指令才是关键
- ChatGPT Work:面向长时程任务的办公智能体
可解释
这个概念能解释的技术信号
搭配技能