<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>显存 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E6%98%BE%E5%AD%98/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 10 Aug 2026 07:35:53 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>9B 小模型跑赢 35B？先看显存够不够</title>
		<link>https://mylogs.cn/9b-%e5%b0%8f%e6%a8%a1%e5%9e%8b%e8%b7%91%e8%b5%a2-35b%ef%bc%9f%e5%85%88%e7%9c%8b%e6%98%be%e5%ad%98%e5%a4%9f%e4%b8%8d%e5%a4%9f/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 10 Aug 2026 07:35:53 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[LM Studio]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[显存]]></category>
		<category><![CDATA[本地大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/9b-%e5%b0%8f%e6%a8%a1%e5%9e%8b%e8%b7%91%e8%b5%a2-35b%ef%bc%9f%e5%85%88%e7%9c%8b%e6%98%be%e5%ad%98%e5%a4%9f%e4%b8%8d%e5%a4%9f/</guid>

					<description><![CDATA[想在自己电脑上跑大模型，最常见的劝退理由是硬件。参数量往上走，显存需求跟着涨，一台 16GB 内存的普通笔记本 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">想在自己电脑上跑大模型，最常见的劝退理由是硬件。参数量往上走，显存需求跟着涨，一台 16GB 内存的普通笔记本似乎只配跑最小号的模型，回答质量也就那样。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7bcde3a3cfa&quot;}" data-wp-interactive="core/image" data-wp-key="6a7bcde3a3cfa" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/1e9b147b890ff9d5ca34f2d5986faf4f_header.webp" alt="9B 小模型跑赢 35B？先看显存够不够" class="wp-image-4287" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/1e9b147b890ff9d5ca34f2d5986faf4f_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/1e9b147b890ff9d5ca34f2d5986faf4f_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/1e9b147b890ff9d5ca34f2d5986faf4f_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/1e9b147b890ff9d5ca34f2d5986faf4f_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MakeUseOf</figcaption></figure>





<p class="wp-block-paragraph">MakeUseOf 撰稿人 Yadullah Abidi 分享了一个反例。DeepReinforce 的 Ornith 1.0 家族中体积最小的 Ornith 9B，在他 16GB 内存的笔记本上给出了接近 35B 级别的回答，换个版本还能读图。要复现这个结果，第一步是把硬件账算清楚。</p>



<h2 class="wp-block-heading">一、先分清内存和显存</h2>



<ol class="wp-block-list"><li>全精度 bf16 运行 Ornith 9B 大约需要 19GB 内存，官方建议用 80GB 显存的 GPU 做非量化部署，个人机器基本无缘。</li><li>量化版本才是可行路径。Q4_K_M 量化后模型体积压到约 5.6GB，扣掉系统占用和一个合理的上下文窗口，16GB 内存放得下。</li><li>这里的 16GB 指系统内存，不是苹果芯片 Mac 那种 GPU 可以直接调用的统一内存。Abidi 的机器是 16GB 内存搭配 RTX 4060，显存 8GB。</li><li>在装了独立显卡的机器上，决定速度的是显存而非总内存。5.6GB 的量化模型若塞不进显存，Ollama 会把一部分交给 CPU 处理，速度立刻掉下来。这与显卡品牌无关，显存只有几 GB 就会撞上同一堵墙。Mac 的内存和 GPU 共用一个池子，在这件事上反而占便宜。</li></ol>



<h2 class="wp-block-heading">二、想要读图能力，别拉错版本</h2>



<ol class="wp-block-list"><li>Ornith-1.0-9B 的官方模型卡把文本列为主要模态。直接拉默认的 GGUF 或标准权重，是没有图像能力的。</li><li>视觉能力来自单独导出的版本，在 Ollama 上以社区标签 <code>robit/ornith-vision:9b</code> 分发，并非 DeepReinforce 官方发布，它在同一套推理骨干上叠加了视觉和工具调用。</li><li>另有至少一个量化 MLX 版本在模型卡上同时标注了文本和图像两种模态。也就是说多模态是特定构建的附加项，并非所有 Ornith 9B 文件都具备。</li><li>结论很直接：按命名空间拉带 vision 标签的那一个，别随手拉搜索结果里第一个 Ornith 9B 量化包。Ollama 和 LM Studio 目前对多模态模型的支持都已经比较顺畅。</li></ol>



<h2 class="wp-block-heading">三、它强在哪，弱在哪</h2>



<p class="wp-block-paragraph">这个家族的特别之处在训练方式。Ornith 1.0 以 Qwen 3.5 为底座做后训练，采用自我改进的强化学习配方，让模型自行搭建并打磨解题脚手架，而不是依赖人工写死的智能体流程。体积小却能打，靠的是这一点，不是参数量。家族里还有 31B 稠密版、35B 混合专家版和一个 397B 混合专家版。</p>



<p class="wp-block-paragraph">成绩方面，Ornith 9B 在 SWE-bench Verified 拿到 69.4%，Terminal-Bench 2.1 得 43.1，对手是 Gemma 4-31B、Qwen 3.6-35B 这类三到四倍体积的模型。不过同门的 35B 混合专家版在相同基准上仍明显更强。</p>



<p class="wp-block-paragraph">短板也很明确：面对很长的多步智能体任务，9B 版本容易打转或卡住，大一号的兄弟处理得从容得多；如果模型有一部分跑在 CPU 上，这种情况来得更早。它的优势集中在编程和终端类任务，通用推理不要按 35B 的水准去期待。</p>



<p class="wp-block-paragraph">来源：MakeUseOf</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>16GB 显存曾被认为过剩，如今跑本地 AI 刚好被吃满</title>
		<link>https://mylogs.cn/16gb-vram-local-llm-automation/</link>
					<comments>https://mylogs.cn/16gb-vram-local-llm-automation/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 13:41:49 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 硬件]]></category>
		<category><![CDATA[KV 缓存]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[显存]]></category>
		<category><![CDATA[本地大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/16gb-vram-local-llm-automation/</guid>

					<description><![CDATA[你给显卡买了 16GB 显存，朋友说「根本用不完」。等你在本地跑起 AI 工作流，这句话可能就该改口了。 Ho [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你给显卡买了 16GB 显存，朋友说「根本用不完」。等你在本地跑起 AI 工作流，这句话可能就该改口了。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7bcde3a47ad&quot;}" data-wp-interactive="core/image" data-wp-key="6a7bcde3a47ad" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header.webp" alt="16GB 显存曾被认为过剩，如今跑本地 AI 刚好被吃满" class="wp-image-4198" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/fd179d468910b07a897814fcb101f0da_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<p class="wp-block-paragraph">How-To Geek 作者 Nick Lewis 用自己的经历给出了对照：8GB 显存大致只能跑 70 亿参数（7B）模型，12GB 能跑 140 亿（14B），到了 16GB 才够跑 240 亿（24B）量级；而一个 270 亿（27B）的 Q4_K_M 量化模型，单是权重就要吃掉约 16GB 显存。</p>



<p class="wp-block-paragraph">这还没算注意力缓存（KV cache）。它是模型记住上下文的临时内存，会额外占用显存的 25%（在 8K 上下文下）到翻倍（32K 上下文）。很多工具的默认上下文很短，比如 Ollama 默认只有 4096，所以小测试里显得很省，一旦把上下文拉长，显存立刻见底。</p>



<p class="wp-block-paragraph">更关键的是，真实场景往往是好几个模型一起跑：主对话模型、负责向量检索的嵌入模型、再做一遍重排序的模型……一条典型的自动化流水线里同时跑 4 到 5 个模型并不稀奇。</p>



<p class="wp-block-paragraph">混合专家模型（MoE）是个出路。这类模型只在每次推理时激活其中一部分参数，一个 200 亿级量化模型配 6 万上下文，在 RTX 5070 Ti 这样的显卡上能跑出每秒 100 个词以上的速度。优化手段还包括：把注意力缓存量化到 8 位或 4 位（一行配置即可）、主动限制上下文长度、用 MoE 替代稠密模型、把放不下的层卸载到 32GB 或 64GB 的系统内存。</p>



<p class="wp-block-paragraph">说白了，16GB 不是「过剩」，而是「刚好及格」。想同时舒服地跑多个模型、留足上下文，24GB 才是真正的甜点档。打算本地玩 AI 的人，买卡时显存容量比核心频率更该排在前头。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek（作者 Nick Lewis，2026-08-09）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/16gb-vram-local-llm-automation/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>8GB显卡终于被挤下去了，代价不小</title>
		<link>https://mylogs.cn/8gb%e6%98%be%e5%8d%a1%e7%bb%88%e4%ba%8e%e8%a2%ab%e6%8c%a4%e4%b8%8b%e5%8e%bb%e4%ba%86%ef%bc%8c%e4%bb%a3%e4%bb%b7%e4%b8%8d%e5%b0%8f/</link>
					<comments>https://mylogs.cn/8gb%e6%98%be%e5%8d%a1%e7%bb%88%e4%ba%8e%e8%a2%ab%e6%8c%a4%e4%b8%8b%e5%8e%bb%e4%ba%86%ef%bc%8c%e4%bb%a3%e4%bb%b7%e4%b8%8d%e5%b0%8f/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 10:04:36 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[PC硬件]]></category>
		<category><![CDATA[RTX 5060 Ti]]></category>
		<category><![CDATA[Steam]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[显存]]></category>
		<category><![CDATA[游戏硬件]]></category>
		<guid isPermaLink="false">https://mylogs.cn/8gb%e6%98%be%e5%8d%a1%e7%bb%88%e4%ba%8e%e8%a2%ab%e6%8c%a4%e4%b8%8b%e5%8e%bb%e4%ba%86%ef%bc%8c%e4%bb%a3%e4%bb%b7%e4%b8%8d%e5%b0%8f/</guid>

					<description><![CDATA[你要是这两年一直被人劝「别买 8GB 显卡」，现在有数据撑腰了。Steam 七月硬件调查里，16GB 显存的显 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是这两年一直被人劝「别买 8GB 显卡」，现在有数据撑腰了。Steam 七月硬件调查里，16GB 显存的显卡占比 25.9%，环比涨 1.4%，第一次把 8GB 的 25.32% 压了下去——这个变化最先被 TweakTown 注意到。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7bcde3a5178&quot;}" data-wp-interactive="core/image" data-wp-key="6a7bcde3a5178" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/4ffaea210ac57351cf526665ef50fc8b_header.webp" alt="8GB显卡终于被挤下去了，代价不小" class="wp-image-3661" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/4ffaea210ac57351cf526665ef50fc8b_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/4ffaea210ac57351cf526665ef50fc8b_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/4ffaea210ac57351cf526665ef50fc8b_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/4ffaea210ac57351cf526665ef50fc8b_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Shutterstock</figcaption></figure>





<h2 class="wp-block-heading">一年翻了近四倍</h2>



<p class="wp-block-paragraph">2025 年 8 月，Steam 上用 16GB 显存显卡的玩家只有 6.8%。不到一年，这个数字接近翻了四倍。</p>



<p class="wp-block-paragraph">推力来自 RTX 5060 Ti 16GB、RX 9060 XT 16GB 和 9070 系列这批中端卡，加上英伟达高端型号的常规贡献；RTX 5070 冲到显卡榜第三，但它只有 12GB。另外 Valve 今年修好了一个统计漏洞——此前部分 AMD Radeon 显卡识别不出来，被塞进「通用 Radeon」类别，修完之后这部分也回到了 16GB 阵营。</p>



<p class="wp-block-paragraph">别急着乐观：36% 的玩家手里是 16GB 或更高，反过来说近三分之二仍在 16GB 以下，47% 还停在 8GB 及以下。</p>



<h2 class="wp-block-heading">想升级的，赶上了最坏的时候</h2>



<p class="wp-block-paragraph">我的判断是，这波「觉醒」来得有点晚。显存涨价正把大显存型号打得最狠：英伟达已经通知板卡厂，GDDR6 和 GDDR7 的供货价要涨；Tom&#8217;s Hardware 的报道称韩国市场 RTX 5000 本月起提价，Blackwell 一线最高可能涨 30%，其他地区大概率跟进。AMD 那边也预告了 Radeon 涨价，并直言 2026 下半年对 PC 玩家不会好过。</p>



<p class="wp-block-paragraph">换句话说，大家终于认清 8GB 不够用的时候，16GB 正在变贵。手上是 8GB 又暂时够用的，不妨再扛一阵；真到非换不可，盯紧渠道实际成交价而不是首发价，比死等新卡实在。</p>



<p class="wp-block-paragraph">来源：TechRadar</p>
]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/8gb%e6%98%be%e5%8d%a1%e7%bb%88%e4%ba%8e%e8%a2%ab%e6%8c%a4%e4%b8%8b%e5%8e%bb%e4%ba%86%ef%bc%8c%e4%bb%a3%e4%bb%b7%e4%b8%8d%e5%b0%8f/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
