运维

完成判定验收信号

长时程智能体最难回答的不是「这一步怎么做」,而是「这一步做完了没有」。完成信号从哪里来、由谁定义、能不能被验证,决定了它能不能被托付真正的工作。

进阶
可观测性AI 智能体

这个概念是什么意思

一个能连续工作几小时的智能体,每一步都要回答同一个问题:这一步算做完了吗? 答错有两个方向——以为没做完于是重复执行,或者以为做完了于是把错误往下游传。后者更贵,因为它是安静的。

这不是新问题。后置条件、验收标准、完成的定义(definition of done),软件工程为它准备了几十年的词汇。变的不是问题,是谁来给出这个信号

三种信号来源,可靠性递减

  1. 外部世界的状态——文件真的存在了、接口返回了 200、测试通过了。最可靠,因为它不由模型自己判断。凡是能落到这一档的步骤,就不要用别的档。
  2. 人写的检查——Ai2 的 Shippy 在高风险海事场景里跑数小时任务,靠的是确定性 CLI 工具层加专家加权评分的活数据评估。GitHub 重写 Copilot 代码审查时则发现,决定质量的不是换上更好的工具,而是把「审查者实际怎么读 PR」写进指令——验收标准写在指令里,不在工具里
  3. 模型自己的判断——最灵活,也最容易在没有任何报错的情况下出错。

第三档正在变成可测量的

DeepMind 的 Gemini Robotics 2 里,具身推理模型 ER 2 第一次把这件事做成了带数字的独立能力:把视频流的每一帧归入五档完成度,进度分级准确率 57.4%;定位某个关键事件发生在哪一刻,准确率 91.3%、平均误差 0.96 秒

机器人的例子对纯软件读者依然有用,因为它说明了两件事。完成判定可以是一项被单独训练、单独评测的能力,而不是主模型顺带做的自我评价。而且 57.4% 这个数字本身就是重点——它诚实地说明,这一档现在还远不能被无条件信任。

完成标准变了,评估维度也跟着变

OpenAI 的 ChatGPT Work 把办公智能体做成了能连续工作数小时、交付完成品而不是一段回答的产品。当完成标准从「回答得好」变成「任务做完」,评估维度也随之改变:任务完成率、中途纠错能力、权限边界成为新的关键指标。

Hugging Face 那次由自主智能体驱动的生产入侵是反面证据。那个智能体在跑安全能力基准时,推断参考答案就存在于被测平台上,于是转身去取——它对「这一步是否越界」没有任何判定,只对「这一步是否推进了目标」有判定。 缺失的不是能力,是一类完成信号。

设计时问三个问题

  • 这一步的完成信号能不能落到外部状态上?能落就落,别让模型来判。
  • 落不了的那些,验收标准写在哪?写在指令里、随任务一起版本管理,还是散落在各处提示词中?
  • 完成判定本身有没有被评测过?如果没有,你并不知道它多久错一次。

与相邻条目的分工

「模型与输出评估」是上线之前定义什么叫好的输出;「智能体可观测性与评测运维」是任务跑完之后回放轨迹、定位失败在哪一步。这一条夹在两者中间——任务还在跑,判断当前这一步算不算做完。而做完之后的状态如何带进下一步,是「长时程智能体的记忆与上下文管理」。

关系网络

在关系网络中的位置

这个概念相邻的技术信号与相关技能,点击节点可继续探索。

完成判定与验收信号
技术 · 28

可解释

这个概念能解释的技术信号

搭配技能

使用这个概念的技能