<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>记忆系统 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e8%ae%b0%e5%bf%86%e7%b3%bb%e7%bb%9f/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 11:42:44 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>LLM Agent 的记忆，可能根本不用消耗 token</title>
		<link>https://mylogs.cn/zeromem-zero-token-memory-llm-agents/</link>
					<comments>https://mylogs.cn/zeromem-zero-token-memory-llm-agents/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 11:42:31 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[记忆系统]]></category>
		<category><![CDATA[论文解读]]></category>
		<category><![CDATA[长上下文]]></category>
		<guid isPermaLink="false">https://mylogs.cn/zeromem-zero-token-memory-llm-agents/</guid>

					<description><![CDATA[01 记忆系统一直是 LLM Agent 的“烧钱大户” 要让一个 AI Agent 在长对话里保持连贯，它必 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">01 记忆系统一直是 LLM Agent 的“烧钱大户”</h2>



<p class="wp-block-paragraph">要让一个 AI Agent 在长对话里保持连贯，它必须记住之前说过什么、做过什么。但传统做法往往依赖大模型本身来整理记忆：把对话压缩成摘要、提取实体关系、判断该记住什么、该忘掉什么。每一步都要调用 LLM，每一调用都要消耗 token 和时间。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a734798f191b&quot;}" data-wp-interactive="core/image" data-wp-key="6a734798f191b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/a2494e925b7039352b13c7337e76654e_header.webp" alt="LLM Agent 的记忆，可能根本不用消耗 token" class="wp-image-3670" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/a2494e925b7039352b13c7337e76654e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/a2494e925b7039352b13c7337e76654e_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/a2494e925b7039352b13c7337e76654e_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/a2494e925b7039352b13c7337e76654e_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / Zero-Mem 项目页</figcaption></figure>





<p class="wp-block-paragraph">arXiv 上一篇刚提交的论文提出了一个反直觉的思路：<strong>记忆操作能不能完全不消耗 LLM token？</strong> 这篇名为 *Zero-Mem: Zero-Token Memory Operations for LLM Agents* 的研究给出的答案是：可以。</p>



<h2 class="wp-block-heading">02 Zero-Mem 的核心思路：别让大模型干“图书馆管理员”的活</h2>



<p class="wp-block-paragraph">研究团队认为，过去的方法之所以昂贵，是因为它们在记忆读取、写入和检索阶段都调用了 LLM。Zero-Mem 的设计原则很直接：<strong>除了最终回答问题那一次，记忆相关操作不再调用任何 LLM，也不消耗任何输入或输出 token。</strong></p>



<p class="wp-block-paragraph">具体怎么做？它把原始交互记录保留下来，并用两种互补的方式组织这些记录。</p>



<p class="wp-block-paragraph">第一种是<strong>实体—上下文图</strong>。它用非生成式的命名实体识别，从对话里抽出实体，再基于共现关系构建图。查询时，先对齐实体，再通过 Personalized PageRank 传播相关度，找到与问题相关的上下文片段。整个过程不需要 LLM 生成摘要或关系三元组。</p>



<p class="wp-block-paragraph">第二种是<strong>时间层次结构</strong>。它把对话按粒度分成多个层级：原子轮次、短窗口、事件段、局部上下文。检索时从粗到细定位，既保留了会话的时序局部性，也能快速锁定关键片段。</p>



<p class="wp-block-paragraph">对于一个查询，Zero-Mem 会综合这两个视图，从图结构和时序结构中分别检索，再把结果喂给最终的问答模型。只有最后这一步才调用 LLM。</p>



<h2 class="wp-block-heading">03 实验结果：性能不降，速度更快</h2>



<p class="wp-block-paragraph">研究在 LoCoMo 和 HotpotQA 两个基准上做了测试。LoCoMo 是专门评估长期会话记忆的基准，包含单跳、多跳、时间推理和开放域四类任务；HotpotQA 则被改造成了 56K、224K、448K 三种上下文长度设置。</p>



<p class="wp-block-paragraph">在 LoCoMo 上，Zero-Mem 在 GPT-4o-mini 后端取得平均 F1 59.15，BLEU-1 52.96；相比最强基线 GAM 分别高出 5.40 和 5.46。在 Qwen2.5-14B 后端同样领先。</p>



<p class="wp-block-paragraph">在 HotpotQA 上，三种长度设置中 Zero-Mem 均取得最高 F1，平均领先最强基线 5.52。</p>



<p class="wp-block-paragraph">更令人意外的是效率。由于记忆操作零 LLM token，对比当前最快的基线 LightMem，Zero-Mem 把记忆操作的总时间从 788.76 秒压到 334.77 秒，<strong>延迟降低 57.6%</strong>；每查询耗时从 0.51 秒降到 0.22 秒。</p>



<h2 class="wp-block-heading">04 为什么这值得关注</h2>



<p class="wp-block-paragraph">当前很多 Agent 框架把“记忆”做成了又一个需要反复调用大模型的环节，成本随交互轮数线性上涨。Zero-Mem 提供了一条不同的路径：<strong>用结构化索引替代生成式压缩</strong>，在保留原始证据的同时，把昂贵的大模型调用留到真正需要推理的地方。</p>



<p class="wp-block-paragraph">如果这条路径被后续研究和产品验证，未来长记忆 Agent 的部署成本可能会出现明显下降。</p>



<p class="wp-block-paragraph">研究团队表示，论文经过同行评审后，代码将在 GitHub 上的 Zero-Mem 仓库公开。</p>



<p class="has-small-font-size wp-block-paragraph">来源：arXiv:2607.29377 / *Zero-Mem: Zero-Token Memory Operations for LLM Agents*</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/zeromem-zero-token-memory-llm-agents/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
