TutorMoments:只说「做好一点」时,模型会普遍过度帮忙
Ai2 用真实一对一数学辅导记录做了一套回放式评测,量模型在「该出手还是该忍住」上的判断。结论有两层:只说「好好辅导」时模型普遍过度帮忙,很少推学生自己想;把这个取舍明写进提示词能改善,但补不上与人类的差距。数据集、回放流水线代码与技术报告一并开源。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
它量的是一个「什么都不做」的能力
大多数评测量的是模型做了什么。TutorMoments 量的是它该不该做——在辅导场景里,直接给出提示会让学生失去自己推理的机会,而完全不给又会让人卡死。Ai2 把这件事做成了可测量的对象。
方法值得单独记住,因为它不限于教育:回放式评测。取真实的一对一辅导记录,由有经验的数学老师标出「这里辅导者必须在降低难度和推学生多想之间选一个」的时刻;把记录截到该决策点交给模型,让它接手当辅导者,学生一方由另一个语言模型扮演,然后看它怎么做。
换个领域,这就是:取真实轨迹、切在决策点、让模型接手、与真人的选择对照。任何「需要判断此刻该不该行动」的智能体任务都能套用。
两层结论,第二层更有用
第一层:只告诉模型「好好辅导」时,它们普遍过度帮忙——给太多支持,很少推学生做更深的思考。
第二层才是关键:把「何时帮、何时忍」这个取舍明写进提示词,表现会改善,但补不上与人类辅导者的差距,而且不同模型在这个判断上的稳定程度差异很大。
第二层之所以更有用,是因为它把「写清楚判据」的收益和上限同时给了出来。写下来有效,但不足以解决问题——这与站里 Copilot 代码审查复盘的结论互为补充:那一条说明写下判据比换更好的工具有效,这一条说明写下来之后还剩多少差距。
为什么这条对不做教育的人也有用
因为「过度帮忙」在智能体产品里是同一种失败,只是换了名字:该问的时候直接替用户决定、该报错的时候自己兜住、该停下来等确认的时候继续往下做。模型倾向于产出而不是克制,而绝大多数评测只奖励产出。
这也说明为什么「好好做」这类指令不构成标准:它无法失败。TutorMoments 的价值不在那个分数,而在它把一个原本只能凭感觉说的东西,变成了可以复现、可以对照的判断题。
边界
这是 preview 阶段的初步结果,样本来自一个美国辅导项目的真实记录。它开源了去标识化的记录数据集、回放流水线代码、以及被评测关键时刻的模型回放,可复现。要把它当成方法样本,而不是一张模型排行榜。
为什么是现在
为什么重要
它把「该不该出手」做成了可测量的对象,而这正是智能体产品里最常见、也最难被现有评测捕捉的一类失败——模型倾向于产出而不是克制,而绝大多数评测只奖励产出。回放式评测这个方法本身可以直接搬到任何需要判断「此刻该不该行动」的任务上。
背景
技术背景
回放式评测:取真实一对一数学辅导记录,由有经验的数学老师标出辅导者必须在「降低难度」和「推学生多想」之间取舍的时刻;把记录截到决策点交给被测模型接手,学生一方由另一个语言模型扮演。开源内容包括去标识化的辅导记录数据集、回放流水线代码、被评测关键时刻的模型回放,以及技术报告。结果为 preview 阶段初步结果。
关注人群
谁该关注
下一步
学习路径
- 先读《模型与输出评估》:难的不是把评测跑起来,而是在看到输出之前把「好」写成一句能判错的话——「好好辅导」正是通不过这一关的例子
- 再读《完成判定与验收信号》:判断「此刻该不该出手」和判断「这一步做完了没有」是同一类能力,都需要被单独设计
- 对照 Copilot 代码审查复盘:那条说明写下判据比换工具有效,这条说明写下来之后还剩多少差距
- 最后读《评估闭环》:这套回放数据集的价值在于它可以反复量同一件事,而不是给出一次分数
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你的评测里有没有一项奖励「什么都不做」?如果没有,你测不出过度帮忙
- 把判据写进提示词之后,剩下的差距是模型能力问题还是判据本身写得不够具体?这条没有回答,但它把这个问题变成可测的
- 回放式评测搬到你的领域,决策点由谁来标?这一步的成本是整套方法里最贵的
来源参考