评估与分析

模型输出评估

在上线前把「什么算好」写成能判错的检查,并让这些检查小到每次改动都能重跑。

活跃学习成本中等
可观测性产品策略

这项技能能帮你做什么

Hume AI 为了衡量语音交互的「人性质量」,做了 40 多个语音模型、15 个以上维度、60 多项指标,底层压着 100 万条以上的人工评分。一家公司需要一百万条人工标注,才敢定义一个形容词。这就是这项技能真正的起点:难的从来不是把评测跑起来,而是在看到输出之前,先把「好」写成一句能判错的话。

先把「好」写成能判错的话

一条无法失败的标准不是标准。「回答要准确、有帮助」通不过这一关,因为任何输出都能被辩解成符合。动笔写检查之前,先固定三件事:

  1. 输入分布——你要它在什么样的输入上好?是真实流量的抽样,还是顺手想到的几个例子?
  2. 什么算失败——不只是答错。拒答、超时、格式崩坏、内容对但结构不可解析,在生产里往往比「答错」更常见。
  3. 谁来裁决——出现分歧时由谁定,判据写在哪里。

供应商的指标和第三方的指标不是一回事

GPT-5.6 主打「单位算力智能密度」,这个指标由发布方自己定义、自己测量,没有第二家用同一把尺子量过别人。Kimi K3 拿到的第三方长时程知识工作 Elo 则不同:同一套测试被跑在所有参赛模型上,所以它可以横比。

判断一个数字能不能横比,只问一句:这把尺子有没有量过别人。

小而可复现,胜过大而一次性

评测的价值在于第二次跑它。固定输入集、进版本库、随事故增长——改一版提示词就能立刻重跑,才叫回归;跑完写进文档、之后再没人碰的,是一次性报告。

GPT-Red 把这件事推向了另一个方向:攻击方模型持续生成对抗输入、防守方迭代修复,评测集自己会长大。NVIDIA 的 Nemotron 开放数据则说明,评测数据本身正在变成可复用的公共资产——工程轨迹、工具调用失败、多步推理这些数据,过去每家自己攒,现在开始有公开来源。

三种最常见的自欺

  • 只测成功路径。 通过率 95% 的评测集,如果里面没有一条是模型本应拒答的,它证明不了任何事。
  • 用模型给模型打分却不校准。 模型裁判可以规模化,但必须留一小批人工标注作锚,定期核对裁判本身有没有漂。
  • 把评测当成发布前的一道关卡。 RAG 评测看板这类产品存在的理由,正是评测应该是常设的仪表盘,而不是一次性的验收。

与相邻能力的分工

这一条回答的是:上线之前,「好」是什么、怎么量。 读别人发布公告里的数字并决定要不要换代,是「旗舰模型发布解读与换代判断」;任务跑完之后回放轨迹、定位它在哪一步为什么失败,是「智能体可观测性与评测运维」;而任务还在跑、要判断当前这一步算不算做完,是「完成判定与验收信号」。

关系网络

在关系网络中的位置

这项技能相邻的技术信号与背景概念,点击节点可继续探索。

模型与输出评估
技术 · 29

用已发布信号练习

这项技能有助于评估的技术信号

背景概念

与这项技能搭配的知识