运维
评估闭环
定义预期、观察实际、比较、收紧——评测的价值不在跑出一个数字,而在这个循环是不是真的在转。
这个概念是什么意思
Ai2 的 Shippy 不用静态基准,而是在活数据上由领域专家定义加权评分表。这个选择本身就说明了这条概念的重点:评测的价值不在某一次跑出的数字,而在它是不是一个真的在转的循环。
评估闭环并不是 AI 特有的东西——它是控制论、统计过程控制、事故复盘、SLO 共用的同一个形状。正因为不是 AI 特有,它才是把新模型的行为从「无法理解的魔法」拉回工程范畴的那根绳子。
四步,缺一步就不成环
- 定义预期——在看到结果之前,先写下什么算对。
- 观察实际——用同一把尺子去量。
- 比较——差异要能被指出来,而不是停在「感觉不太行」。
- 收紧——把这次的差异变成下一次的检查。
第 4 步是唯一能把它变成「环」的一步。跑了却没有改变任何东西的评测不是闭环,是报告。 所以判断一个团队有没有闭环,看的不是他们有没有做评测,而是最近一次评测结果改变了什么。
定义预期是最贵的那一步
Hume AI 的 Real World VoiceEQ 为了衡量语音交互的「人性质量」,铺了 40 多个语音模型、15 个以上维度、100 万条以上人工评分。这些成本几乎全部花在第 1 步上——观察和比较是便宜的,写下「什么算好」是贵的。
跳过第 1 步的闭环会以一种很特定的方式失败:你能看到数字在动,却说不出它是变好还是变坏。
环可以套在环上
闭环的对象不必是模型的输出。Gemini Robotics 2 里那个判断「这一步做完了没有」的能力,本身被单独评测到 57.4%——被评的是那个做判断的东西。GPT-Red 则用自博弈让攻击方持续生成新的对抗输入,相当于让闭环自己产出下一轮的输入。
一个成熟的系统里通常有好几个环同时在不同频率上转:每次提交跑的回归、每周看的看板、每次事故之后的复盘。它们共用的是同一个形状。
三种让环断掉的情况
- 没有基线。 分不出漂移和噪声,于是每次波动都要重新争论一遍。
- 尺子换了。 前后两次量的不是同一件事,比较本身就失去了意义。
- 没有人负责收紧。 第 4 步不属于任何人,环就在第 3 步断掉。
谁在用这个形状
同一个循环被好几条实践各自套用,只是对象不同:上线之前定义并测量输出好坏,是「模型与输出评估」;视觉任务用反事实图和 OCR 基线做核验,是「视觉输入的组织与核验」;把对抗性输入纳入常规回归而不是年度审计,是「智能体安全与提示注入防御」;任务跑完之后回放轨迹、归因失败,是「智能体可观测性与评测运维」;读别人公告里的数字并决定要不要换代,是「旗舰模型发布解读与换代判断」。
而任务进行中判断某一步算不算做完,是「完成判定与验收信号」——那是这个环缩到一步之内的样子。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- Copilot 运行时改写成 83 万行 Rust:别让智能体碰判卷标准
- 平均成功率 77%,五次全对只有 53%:智能体的一致性差距
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- 纳维-斯托克斯之争:88 小时、3000 亿 token,和一个没回答的问题
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- 90 亿个变异预先算好:把模型变成一份资源
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- BenchMIRT:一个基准的分数,常常在测别的东西
- 首次双盲评测:评测方看不到权重,模型方看不到题
- 智能体记忆不是开关,是要按模型标定的剂量
- 菲尔兹奖得主:模型强在找到那个对象,弱在知道何时放弃
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- 668 阶哈达玛矩阵被构造出来:三个人加 Claude,清掉 2000 阶以下所有未决阶数
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- Gemini 3.7 Flash:主力档三周一迭代,价格砍半
- 生产要持久、评估要轻量——把编排从运行时里拆出来
- AMIE 实时视频问诊:把「医生还会看你一眼」那部分放进随机对照研究
- 智能体复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论
- ARA:把论文从 PDF 改成智能体能直接操作的知识包
- 一次 180 万美元的智能体账单:超预算 860%,五个月后才被发现
- BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
- TutorMoments:只说「做好一点」时,模型会普遍过度帮忙
- Gemini Robotics 2:全身控制,与一个可编排的推理层
- RAG 评测看板
- 代理工作台平台
可解释
这个概念能解释的技术信号
搭配技能