运维

评估闭环

定义预期、观察实际、比较、收紧——评测的价值不在跑出一个数字,而在这个循环是不是真的在转。

进阶
可观测性

这个概念是什么意思

Ai2 的 Shippy 不用静态基准,而是在活数据上由领域专家定义加权评分表。这个选择本身就说明了这条概念的重点:评测的价值不在某一次跑出的数字,而在它是不是一个真的在转的循环。

评估闭环并不是 AI 特有的东西——它是控制论、统计过程控制、事故复盘、SLO 共用的同一个形状。正因为不是 AI 特有,它才是把新模型的行为从「无法理解的魔法」拉回工程范畴的那根绳子。

四步,缺一步就不成环

  1. 定义预期——在看到结果之前,先写下什么算对。
  2. 观察实际——用同一把尺子去量。
  3. 比较——差异要能被指出来,而不是停在「感觉不太行」。
  4. 收紧——把这次的差异变成下一次的检查。

第 4 步是唯一能把它变成「环」的一步。跑了却没有改变任何东西的评测不是闭环,是报告。 所以判断一个团队有没有闭环,看的不是他们有没有做评测,而是最近一次评测结果改变了什么

定义预期是最贵的那一步

Hume AI 的 Real World VoiceEQ 为了衡量语音交互的「人性质量」,铺了 40 多个语音模型、15 个以上维度、100 万条以上人工评分。这些成本几乎全部花在第 1 步上——观察和比较是便宜的,写下「什么算好」是贵的。

跳过第 1 步的闭环会以一种很特定的方式失败:你能看到数字在动,却说不出它是变好还是变坏。

环可以套在环上

闭环的对象不必是模型的输出。Gemini Robotics 2 里那个判断「这一步做完了没有」的能力,本身被单独评测到 57.4%——被评的是那个做判断的东西。GPT-Red 则用自博弈让攻击方持续生成新的对抗输入,相当于让闭环自己产出下一轮的输入。

一个成熟的系统里通常有好几个环同时在不同频率上转:每次提交跑的回归、每周看的看板、每次事故之后的复盘。它们共用的是同一个形状。

三种让环断掉的情况

  • 没有基线。 分不出漂移和噪声,于是每次波动都要重新争论一遍。
  • 尺子换了。 前后两次量的不是同一件事,比较本身就失去了意义。
  • 没有人负责收紧。 第 4 步不属于任何人,环就在第 3 步断掉。

谁在用这个形状

同一个循环被好几条实践各自套用,只是对象不同:上线之前定义并测量输出好坏,是「模型与输出评估」;视觉任务用反事实图和 OCR 基线做核验,是「视觉输入的组织与核验」;把对抗性输入纳入常规回归而不是年度审计,是「智能体安全与提示注入防御」;任务跑完之后回放轨迹、归因失败,是「智能体可观测性与评测运维」;读别人公告里的数字并决定要不要换代,是「旗舰模型发布解读与换代判断」。

而任务进行中判断某一步算不算做完,是「完成判定与验收信号」——那是这个环缩到一步之内的样子。

关系网络

在关系网络中的位置

这个概念相邻的技术信号与相关技能,点击节点可继续探索。

评估闭环
技术 · 27

可解释

这个概念能解释的技术信号

搭配技能

使用这个概念的技能