<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>KV 缓存 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/kv-%e7%bc%93%e5%ad%98/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 09 Aug 2026 13:42:04 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>16GB 显存曾被认为过剩，如今跑本地 AI 刚好被吃满</title>
		<link>https://mylogs.cn/16gb-vram-local-llm-automation/</link>
					<comments>https://mylogs.cn/16gb-vram-local-llm-automation/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 13:41:49 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 硬件]]></category>
		<category><![CDATA[KV 缓存]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[显存]]></category>
		<category><![CDATA[本地大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/16gb-vram-local-llm-automation/</guid>

					<description><![CDATA[你给显卡买了 16GB 显存，朋友说「根本用不完」。等你在本地跑起 AI 工作流，这句话可能就该改口了。 Ho [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你给显卡买了 16GB 显存，朋友说「根本用不完」。等你在本地跑起 AI 工作流，这句话可能就该改口了。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7883c1f40fe&quot;}" data-wp-interactive="core/image" data-wp-key="6a7883c1f40fe" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header.webp" alt="16GB 显存曾被认为过剩，如今跑本地 AI 刚好被吃满" class="wp-image-4198" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<p class="wp-block-paragraph">How-To Geek 作者 Nick Lewis 用自己的经历给出了对照：8GB 显存大致只能跑 70 亿参数（7B）模型，12GB 能跑 140 亿（14B），到了 16GB 才够跑 240 亿（24B）量级；而一个 270 亿（27B）的 Q4_K_M 量化模型，单是权重就要吃掉约 16GB 显存。</p>



<p class="wp-block-paragraph">这还没算注意力缓存（KV cache）。它是模型记住上下文的临时内存，会额外占用显存的 25%（在 8K 上下文下）到翻倍（32K 上下文）。很多工具的默认上下文很短，比如 Ollama 默认只有 4096，所以小测试里显得很省，一旦把上下文拉长，显存立刻见底。</p>



<p class="wp-block-paragraph">更关键的是，真实场景往往是好几个模型一起跑：主对话模型、负责向量检索的嵌入模型、再做一遍重排序的模型……一条典型的自动化流水线里同时跑 4 到 5 个模型并不稀奇。</p>



<p class="wp-block-paragraph">混合专家模型（MoE）是个出路。这类模型只在每次推理时激活其中一部分参数，一个 200 亿级量化模型配 6 万上下文，在 RTX 5070 Ti 这样的显卡上能跑出每秒 100 个词以上的速度。优化手段还包括：把注意力缓存量化到 8 位或 4 位（一行配置即可）、主动限制上下文长度、用 MoE 替代稠密模型、把放不下的层卸载到 32GB 或 64GB 的系统内存。</p>



<p class="wp-block-paragraph">说白了，16GB 不是「过剩」，而是「刚好及格」。想同时舒服地跑多个模型、留足上下文，24GB 才是真正的甜点档。打算本地玩 AI 的人，买卡时显存容量比核心频率更该排在前头。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek（作者 Nick Lewis，2026-08-09）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/16gb-vram-local-llm-automation/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
