根据Beatling 动察 的监测,伊利诺伊大学计算机科学博士生 Dylan Zhang 进行了一项 Agent 记忆实验,结果表明一个异常的结论:让模型反复总结经验,可能会导致它记忆能力的下降。
最引人注目的结果之一来自 ARC-AGI:研究人员挑选出 19 道 GPT-5.4 在无记忆状态下全部答对的问题,然后将这些问题的真实解法输入给模型,让其在观察的同时进行「经验总结」。理论上,这相当于开卷考试;然而经过多轮记忆压缩后,同一模型的准确率从 100% 降至 54%。原始路径是正确的,真正出现问题的是模型将正确路径改写为通用经验的那一步。
更糟糕的是,这种记忆退化并非个案。在 WebShop 网购任务中,AWM 记忆方法在输入了 8 条专家路径后的得分为 0.64,但当路径增加到 128 条时,得分下降至 0.20,恰好回到了无记忆的基准线。换言之,随着记忆堆积越来越厚,收益反而受到抑制。
问题不在于「经验不足」,而在于「总结过于频繁」。大模型所记录的经验并非客观事实记录,每次总结都是重新生成的过程。在写作的过程中,具体的前提条件被删除,不同任务的规则被混淆在一起,原本可指导操作的细节被转化为看似正确但实际无益的废话,如「优先采取最直接行动」、「使用正确工具」。原文展示的一个极端例子是,50 条结构化记忆被合并为1条,多个任务的差异被压缩为同一个通用流程,下一轮评估直接丢弃了 6 到 13 个成功样本。
作者提出了一些建议:不要急于让 Agent 每轮都记录「错题本」。更为稳妥的做法是保留经过筛选的原始操作路径,只在确实需要时进行抽象总结。在这项实验中,只保留原始 episode 并关闭抽象总结的方案,在多个 Agent 基准测试中达到或超过了经过测试的压缩式记忆方法。对开发人员而言,这一结论非常明显:让模型看到真实的行为比让其背诵一堆抽象规则更为有效。
