01 记忆系统一直是 LLM Agent 的“烧钱大户”
要让一个 AI Agent 在长对话里保持连贯,它必须记住之前说过什么、做过什么。但传统做法往往依赖大模型本身来整理记忆:把对话压缩成摘要、提取实体关系、判断该记住什么、该忘掉什么。每一步都要调用 LLM,每一调用都要消耗 token 和时间。

arXiv 上一篇刚提交的论文提出了一个反直觉的思路:记忆操作能不能完全不消耗 LLM token? 这篇名为 *Zero-Mem: Zero-Token Memory Operations for LLM Agents* 的研究给出的答案是:可以。
02 Zero-Mem 的核心思路:别让大模型干“图书馆管理员”的活
研究团队认为,过去的方法之所以昂贵,是因为它们在记忆读取、写入和检索阶段都调用了 LLM。Zero-Mem 的设计原则很直接:除了最终回答问题那一次,记忆相关操作不再调用任何 LLM,也不消耗任何输入或输出 token。
具体怎么做?它把原始交互记录保留下来,并用两种互补的方式组织这些记录。
第一种是实体—上下文图。它用非生成式的命名实体识别,从对话里抽出实体,再基于共现关系构建图。查询时,先对齐实体,再通过 Personalized PageRank 传播相关度,找到与问题相关的上下文片段。整个过程不需要 LLM 生成摘要或关系三元组。
第二种是时间层次结构。它把对话按粒度分成多个层级:原子轮次、短窗口、事件段、局部上下文。检索时从粗到细定位,既保留了会话的时序局部性,也能快速锁定关键片段。
对于一个查询,Zero-Mem 会综合这两个视图,从图结构和时序结构中分别检索,再把结果喂给最终的问答模型。只有最后这一步才调用 LLM。
03 实验结果:性能不降,速度更快
研究在 LoCoMo 和 HotpotQA 两个基准上做了测试。LoCoMo 是专门评估长期会话记忆的基准,包含单跳、多跳、时间推理和开放域四类任务;HotpotQA 则被改造成了 56K、224K、448K 三种上下文长度设置。
在 LoCoMo 上,Zero-Mem 在 GPT-4o-mini 后端取得平均 F1 59.15,BLEU-1 52.96;相比最强基线 GAM 分别高出 5.40 和 5.46。在 Qwen2.5-14B 后端同样领先。
在 HotpotQA 上,三种长度设置中 Zero-Mem 均取得最高 F1,平均领先最强基线 5.52。
更令人意外的是效率。由于记忆操作零 LLM token,对比当前最快的基线 LightMem,Zero-Mem 把记忆操作的总时间从 788.76 秒压到 334.77 秒,延迟降低 57.6%;每查询耗时从 0.51 秒降到 0.22 秒。
04 为什么这值得关注
当前很多 Agent 框架把“记忆”做成了又一个需要反复调用大模型的环节,成本随交互轮数线性上涨。Zero-Mem 提供了一条不同的路径:用结构化索引替代生成式压缩,在保留原始证据的同时,把昂贵的大模型调用留到真正需要推理的地方。
如果这条路径被后续研究和产品验证,未来长记忆 Agent 的部署成本可能会出现明显下降。
研究团队表示,论文经过同行评审后,代码将在 GitHub 上的 Zero-Mem 仓库公开。
来源:arXiv:2607.29377 / *Zero-Mem: Zero-Token Memory Operations for LLM Agents*







