智能体记忆不是开关,是要按模型标定的剂量
IBM Research 把 ALTK-Evolve 铺到八个模型上评测:智能体从自己的历史轨迹里蒸馏出可复用的行为指引,推理时注入回上下文,不更新任何权重、不需要人工标注。结论反直觉——同一套指引在不同模型上的最佳用量完全不同,而决定用量的不是参数规模:745B 的 GLM-5 一分没涨,117B 的 gpt-oss-120b 用最省的策略涨了 16.1 个点,代价只有 5% 的 token。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
学习发生在模型外面,不在模型里面
这里的「记忆」不是回放一段历史对话,而是一套行为指引:从智能体自己过去的成功与失败轨迹里蒸馏出来的策略、要避开的错误和边界情况。循环很短——智能体做任务产生轨迹,ALTK-Evolve 从成功和失败的运行里提取指引,合并成一套可复用的集合,推理时把全部或按任务挑选的一部分交回给它。
没有任何权重被更新。 改变的是智能体可用的指引,不是底下那个模型——这也正是它便宜、且能横跨八个模型移植的原因。
三档剂量,而参数量不预测你在哪一档
八个模型从 30B 稠密一路铺到闭源前沿,落成三种反复出现的形态:
- 有余量的强模型要全量。 每一条指引都要,包括罕见的边界情况,因为它们吃得下也用得上。DeepSeek-V3.2(671B MoE)拿到自己挖出的全套指引后,任务完成度涨了 9.5 个百分点。
- 弱一些的模型会被大指引集淹掉。 它们最适合一个高置信的紧凑核心,加上每个任务现取的少量相关条目。gpt-oss-120b(117B MoE)用这种选择性策略涨了 16.1 个百分点——而全量策略涨得更少、token 还多花约 50%。
- 已经饱和的模型一分不涨。 GLM-5(745B MoE)在这轮里就是如此:0.0 / 0.0。
745B 的那个没涨,117B 的那个涨得最多。 决定你在哪一档的不是参数量,而是基准上的剩余空间、上下文窗口、架构、指引质量和任务分布——研究者明确说,把这些因素分开仍是进行中的工作。
值得单独表扬的是措辞:作者写明「饱和」这个标签描述的是观察到的现象,不是已证明的原因,并列出三种都还成立的解释——模型可能本来就接近这批任务的天花板,指引可能没打中它剩下的失败模式,也可能是它没有有效地应用这些指引。本站《模型与输出评估》里那条判据在这里被作者自己执行了:一个数字说明什么,取决于它排除了什么。
最省的策略可以同时是最好的
这一点最容易被跳过,因为它违反「更多即更好」的直觉。
每一步都注入全套指引会让每个 ReAct 步骤的输入都变胖,因为指引每一轮都要重发。而 gpt-oss-120b 上,按任务检索的策略拿到 +16.1 个百分点,token 只多了 5%。
也就是说:最准的那一档和最便宜的那一档,在这个模型上是同一档。 这不是普遍规律——强模型确实要全量——但它足以说明「先上全量再说」是一个会同时输掉准确率和成本的默认值。
越严格的尺子动得越多
两种打分方式的差距本身就是发现。SGC 要求一个场景的每一个变体都通过,比 TGC 严格得多,而它普遍涨得更多:
- DeepSeek-V3.2:TGC +9.5,SGC +16.1
- Claude Opus 4.6:TGC +4.1,SGC +7.1(基线已是 90.5 / 87.5)
- GPT-5.5:TGC +2.9,SGC +7.2
原因说得通:好的指引尤其帮助智能体清掉一个场景的所有变体,而不只是把平均情况做对。而且在天花板附近它并没有消失——只要模型还剩一个可被指引打中的失败模式,记忆就还在付钱。
这条信号的边界
- 全部结果来自 AppWorld 一个基准,9 个模拟应用,不是真实生产环境。
- 指引只从训练集挖掘,测试集数据没有进入构建过程——这一点作者写明了,是这组数字可信的前提。
- 「饱和」只观察到一个样本(GLM-5),且作者自己拒绝把它当成结论。
- 该团队在上一篇里比较的是指引怎么投递,这一篇回答的是该给多少;两个问题都还没有跨基准的复现。
为什么是现在
为什么重要
「给智能体加记忆」通常被当成一个开关:把过去的经验塞回上下文,经验越多表现越好。这项评测把它证伪了,而且给出了可执行的替代做法——按模型的剩余空间决定注入多少。更要紧的是它顺手推翻了一个省事的代理指标:参数量不预测该给多少记忆。
背景
技术背景
评测在 AppWorld 上进行:9 个模拟应用(日历、消息、支付等)里的 585 个多步任务,其中 168 个 test_normal、417 个 test_challenge。两种打分方式——TGC 看单个任务是否完整完成,SGC 更严格,要求一个场景的每个变体都通过。三种配置共用同一套指引,区别只在投递方式:不注入(基线)、每一步都注入全部指引(full guideline set)、固定高置信核心加上按任务检索的少量条目(curated retrieval)。指引只从训练集挖掘,测试集数据从未进入构建过程。
关注人群
谁该关注
下一步
学习路径
- 先记住那句判据:记忆是剂量不是开关——先问你的模型还剩多少空间,再决定注入多少
- 读《长时程智能体的记忆与上下文管理》:这条研究给它补上了量化证据
- 把你自己的评测拆成宽松与严格两档,看严格那档动得是不是更多——这项研究里它普遍更大
- 算一次 token 账:每一步重复注入全部指引的成本,和按任务检索少量的成本,差了约十倍
- 读《评估闭环》第 4 步:一次没有改变任何配置的评测是报告,不是闭环
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 你的模型落在哪一档,是靠实测还是靠参数量猜的?
- 指引集是从你自己的任务轨迹里挖的,还是借来的?后者还成立吗?
- 「饱和」在你这里是模型到顶了,还是指引没打中它真正的失败模式?
来源参考