<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>本地部署 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%9c%ac%e5%9c%b0%e9%83%a8%e7%bd%b2/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Thu, 13 Aug 2026 06:27:32 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署</title>
		<link>https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 06:27:05 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</guid>

					<description><![CDATA[阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwe [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwen3.8-2.4T-A95B。这是千问历史上第一次向社区开放「Max 级」旗舰权重——过去这类顶级模型通常只以云端 API 形式提供，如今任何人都能下载、修改、自行部署。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8929186b16f&quot;}" data-wp-interactive="core/image" data-wp-key="6a8929186b16f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp" alt="千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署" class="wp-image-4671" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-768x415.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Qwen / 阿里巴巴（Hugging Face 模型页）</figcaption></figure>





<h2 class="wp-block-heading">2.4 万亿参数，每步只激活 950 亿</h2>



<p class="wp-block-paragraph">这组数字的命名已经写明了规格：「2.4T」代表模型总参数量达到 2.4 万亿；「A95B」代表每次前向计算只为单个词元激活 950 亿参数。实现这一点的，是混合专家（MoE）结构：模型共 92 层，每层拥有 512 个专家，每个词元只路由到其中 10 个路由专家加 1 个共享专家。底层采用 Qwen3.5 架构，并混合了门控 DeltaNet 与门控注意力机制。</p>



<p class="wp-block-paragraph">相比训练一个 2.4 万亿参数的稠密模型，MoE 让「模型很大、跑起来却只需算一小部分」成为可能，大幅压低了推理成本。原生上下文长度为 262144 个词元，最长可扩展至约 101 万词元，足以覆盖长文档与长周期智能体任务。</p>



<h2 class="wp-block-heading">和云端 Max 版不是一回事</h2>



<p class="wp-block-paragraph">需要区分的是，放权的开源版与早先上线的云端版 Qwen3.8-Max 并不完全相同。云端 Max 于 8 月初发布，额外支持视觉输入、可关闭的思考模式、默认 100 万词元上下文，以及官方内置工具；而开源版 Qwen3.8-2.4T-A95B 目前只有文本输入，且思考模式默认开启、无法关闭——模型在给出最终回答前会先生成推理过程，并通过 preserve_thinking 标记在多次对话间保留推理上下文，适合需要跨步骤保持「草稿」的智能体循环。</p>



<p class="wp-block-paragraph">在官方公布的基准中，同架构的云端版本 Qwen3.8-Max 在论文复现基准 PaperBench 取得 93.0 分、在计算机操作基准 OSWorld-Verified 取得 86.1 分、在参数化 CAD 基准取得 91.5 分，均居参评模型前列；不过在 TerminalBench 2.1（86.6）与 SWE-bench Pro（67.7）上仍略低于部分对手。整体定位被千问团队形容为「除 Fable 5 外最强的模型之一」。</p>



<h2 class="wp-block-heading">自己跑起来要多少硬件</h2>



<p class="wp-block-paragraph">开源权重意味着可以本地部署。官方支持通过 Hugging Face Transformers、SGLang、vLLM、TokenSpeed 等推理框架加载，正式部署时需使用各框架针对 Qwen3.8 的最新配方，并按权重精度与 GPU 数量选择并行策略。</p>



<p class="wp-block-paragraph">全精度权重体积可观，但开源社区已经给出了瘦身方案。Unsloth 团队用动态 1-bit 分层选择性量化技术，把原始约 4.9TB 的模型压到 397GB，存储空间缩减约 91%；借助其 Unsloth-Desktop 工具，只要设备的内存与显存合计达到 410GB 以上，就能在本地把模型跑起来。对没有数据中心的中小团队而言，这意味着前沿级能力第一次能以自托管的形式落在自己手里。</p>



<h2 class="wp-block-heading">许可证与价格</h2>



<p class="wp-block-paragraph">开放不等于完全自由。Qwen3.8-2.4T-A95B 采用千问自定义许可证，而非早先常见的 Apache 2.0：个人下载、修改、部署不受限，但大规模商业使用需要另行取得授权。配套发布的还有一颗约 270 亿参数的稠密伴随模型 Qwen3.8-27B，面向算力有限的场景，不过在开源权重放出时尚未同步上线。</p>



<p class="wp-block-paragraph">云端 Qwen3.8-Max 的国内 API 定价为每百万词元输入 12 元、输出 36 元，海外为每百万词元输入 2 美元、输出 6 美元。</p>



<h2 class="wp-block-heading">为什么这件事值得关注</h2>



<p class="wp-block-paragraph">把旗舰级权重交到社区手中，意义不只在「又大了一点」。过去一年，西方实验室谈开源时往往只放出 200 亿到 300 亿参数量级的中等模型，而阿里这次直接把自家最强旗舰摆上了桌面。无论动机如何，实际效果是：当前能完全自托管、可离线运行的最强模型之一，来自于中国的开源阵营，且差距明显。</p>



<p class="wp-block-paragraph">对开发者与研究者来说，这意味着不必再为前沿能力向专有 API 持续付费，也能在本地做微调、评测与私有化部署；对下游应用，则把竞争拉回了「在模型之上能做出什么」这一层。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hugging Face 模型页 / 千问团队（经 Hacker News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>15MB 单文件编码智能体：断网可跑，内存省七分之一</title>
		<link>https://mylogs.cn/ante-single-binary-offline-coding-agent/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 10 Aug 2026 19:50:51 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[Rust]]></category>
		<category><![CDATA[开源工具]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[离线AI]]></category>
		<category><![CDATA[编码智能体]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ante-single-binary-offline-coding-agent/</guid>

					<description><![CDATA[终端里的 AI 编码工具已经不算稀奇，但大多数都背着一身包袱：要装运行时、要配账号、要联网调用云端模型，跑起来 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">终端里的 AI 编码工具已经不算稀奇，但大多数都背着一身包袱：要装运行时、要配账号、要联网调用云端模型，跑起来还相当占资源。一个名为 Ante 的开源项目选择了完全相反的路线——把整套编码智能体压进一个约 15MB 的可执行文件，不依赖任何外部运行时，甚至可以在完全断网的机器上工作。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8929186c4a4&quot;}" data-wp-interactive="core/image" data-wp-key="6a8929186c4a4" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/bc519a11fd36435f53233f73352b467a_header.webp" alt="15MB 单文件编码智能体：断网可跑，内存省七分之一" class="wp-image-4351" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/bc519a11fd36435f53233f73352b467a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/bc519a11fd36435f53233f73352b467a_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/bc519a11fd36435f53233f73352b467a_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/bc519a11fd36435f53233f73352b467a_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／AntigmaLabs/ante 项目页</figcaption></figure>





<p class="wp-block-paragraph">该项目由 Antigma Labs 开发，以 Apache 2.0 协议开源，近日出现在 Hacker News 首页并获得 90 分推荐。开发方给它的定位相当直白：功能对标 Claude Code 与 Codex，但不带这两者的依赖负担和模型限制。</p>



<h2 class="wp-block-heading">跑分公开可查，资源占用只有零头</h2>



<p class="wp-block-paragraph">多数智能体项目都会自称性能优秀，Ante 的做法是把评测过程直接摊开。项目在官方排行榜约束条件下持续运行 Terminal-Bench 2.1 基准测试——89 项任务，每项跑 5 次。最新一轮完整测试的成绩为 82.7%，共 368 次通过、总计 445 次试验，使用的模型是开源权重的 DeepSeek V4 Flash 0731，对应版本为 Ante 0.preview.71，整轮推理开销约 68 美元。作为交叉印证，DeepSeek 官方用其尚未公开的 Harness 在最简模式下测试同一模型，给出的分数同样是 82.7。</p>



<p class="wp-block-paragraph">每条评测结果都会锁定可下载的具体构建版本，并附上原始运行记录的链接，供外部独立复核，而不是只丢出一个数字。</p>



<p class="wp-block-paragraph">资源开销的差距更为直观。在 Docker 环境中执行同样的 20 项并行任务，Ante 的峰值内存占用约为 Claude Code 的七分之一，平均 CPU 占用约为九分之一，磁盘读写量约为五分之一。</p>



<p class="wp-block-paragraph">这套数字背后是一个具体的工程取舍：整个程序用 Rust 手写，把 <code>Grep</code>（经过完全重写和定制）与 <code>git</code> 这类高频组件直接嵌进同一个二进制、同一个进程内运行，不再向外调起子进程，也就不存在资源泄漏的问题。本地推理则交给一个版本固定、由项目自行管理的 llama.cpp。</p>



<h2 class="wp-block-heading">断网跑完整流程，不需要 API 密钥</h2>



<p class="wp-block-paragraph">原生离线是 Ante 最有辨识度的一点。内置推理引擎让整个工作循环可以完全留在本地：指向一个 GGUF 格式的模型文件，不需要 API 密钥，不需要注册账号，也不需要网络连接。</p>



<pre class="wp-block-code"><code>ante --offline-model ~/.ante/models/Qwen3.5-9B-Q4_K_M.gguf \
  -p "add error handling to src/main.rs"</code></pre>



<p class="wp-block-paragraph">联网使用时，Ante 开箱支持 12 家以上的模型供应商，包括 Anthropic 的 Claude Sonnet 4.5 与 Opus 4.6、OpenAI 的 GPT-5 系列、谷歌 Gemini 3 系列、xAI 的 Grok 4、OpenRouter，以及 Vertex AI 等兼容 OpenAI 接口的服务。切换供应商没有绑定成本，自带密钥、订阅账号或本地模型均可，官方明确表示不要求注册任何账号。</p>



<p class="wp-block-paragraph">运行方式分为四种：<code>ante</code> 进入交互式终端界面处理日常工作；<code>ante -p</code> 以无头模式执行一次性任务，适合脚本与持续集成流程；<code>ante serve</code> 通过 JSONL 协议对外提供服务，供编辑器插件调用；<code>ante gateway</code> 则可以把它挂成 Slack 或 Discord 机器人。多智能体编排、自定义技能、MCP 支持与跨会话记忆也都在功能清单内。</p>



<h2 class="wp-block-heading">开源了哪些部分，又有哪些没开</h2>



<p class="wp-block-paragraph">需要说清楚的是，Ante 目前处于 Alpha 预览阶段，官方提示会有破坏性变更和功能缺失，且仅支持 macOS 与 Linux，Windows 用户建议通过 WSL 使用。</p>



<p class="wp-block-paragraph">仓库开源的内容包括：完整文档站、<code>ante serve</code> 使用的协议定义与 Rust SDK、支撑 Terminal-Bench 成绩的评测适配器（任何一轮结果都可据此复现），以及已经稳定的核心库如独立进程执行模块。核心的 harness 本身在 Alpha 期间仍在私有仓库开发，以预编译二进制形式随版本发布，稳定一块开放一块。</p>



<p class="wp-block-paragraph">项目名字本身是个双关：既是「Another Terminal agent」的缩写，也指牌桌上入局要先押的底注。开发方给出的长期设想是所谓「细胞原生」智能体——像生物体内的细胞那样微小、可随时丢弃、能大规模复制。按这个思路，可验证、够便宜、随处能跑三件事其实是同一个设计决策：只有轻到能成千上万地铺开，智能体才谈得上自组织。</p>



<p class="wp-block-paragraph">对于关注本地化部署、注重数据不出机器，或者单纯受够了动辄数百 MB 客户端的开发者，这个只有 15MB 的选项值得关注一下。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hacker News / GitHub（AntigmaLabs/ante）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Gemma 4 与千问 3.6 根本不在一条赛道</title>
		<link>https://mylogs.cn/gemma-4-vs-qwen-3-6-different-jobs/</link>
					<comments>https://mylogs.cn/gemma-4-vs-qwen-3-6-different-jobs/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 17:59:57 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Gemma 4]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[上下文窗口]]></category>
		<category><![CDATA[大模型选型]]></category>
		<category><![CDATA[开放权重模型]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[通义千问]]></category>
		<guid isPermaLink="false">https://mylogs.cn/gemma-4-vs-qwen-3-6-different-jobs/</guid>

					<description><![CDATA[Gemma 4 与千问 3.6 根本不在一条赛道 开放权重模型一多，围观者就习惯把它们摆成一场赛马：谁排名靠前 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">Gemma 4 与千问 3.6 根本不在一条赛道</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8929186d6f2&quot;}" data-wp-interactive="core/image" data-wp-key="6a8929186d6f2" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/70d6a205fe63012208905280b49dc015_header.webp" alt="Gemma 4 与千问 3.6 根本不在一条赛道" class="wp-image-4220" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/70d6a205fe63012208905280b49dc015_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/70d6a205fe63012208905280b49dc015_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/70d6a205fe63012208905280b49dc015_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/70d6a205fe63012208905280b49dc015_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Jorge Aguilar / How-To Geek</figcaption></figure>





<p class="wp-block-paragraph">开放权重模型一多，围观者就习惯把它们摆成一场赛马：谁排名靠前谁就该用，落后的那个自动被归为“慢”或者“不能用”。How-To Geek 编辑 Jorge A. Aguilar 在 8 月 9 日发表的一篇文章里指出，这套逻辑一旦落到真实使用场景中就会立刻散架——因为有些模型压根不是为同一份工作而生的。</p>



<p class="wp-block-paragraph">谷歌 DeepMind 的 Gemma 4 和阿里巴巴的通义千问 3.6，恰好是最典型的一对例子。</p>



<h2 class="wp-block-heading">一个装进设备，一个住在云上</h2>



<p class="wp-block-paragraph">Gemma 4 的设计目标是在尽可能多的终端上高效运行：手机、笔记本、台式机。它的 12B 变体可以直接吃进原始音频和图像数据，不需要额外挂载独立的编码器模型。</p>



<p class="wp-block-paragraph">千问 3.6 则是奔着云端基础设施和长链条分析任务去的。它采用混合注意力结构，能在不撑爆内存的前提下吞下巨量文本。用一句话概括这组差异：前者想当一个快速、私密、跑在本机上的助手；后者想当一个坐在云端、有耐心跟难题死磕的工程师。</p>



<p class="wp-block-paragraph">两个模型的档位划分也印证了各自的取向。Gemma 4 于 4 月 2 日发布，提供从端侧优化的 E2B、E4B，到 12B、26B 混合专家、31B 稠密模型在内的多个尺寸。千问 3.6 的开放权重版本走的是另一条路线：35B-A3B 混合专家模型每个词元只激活约 30 亿参数，另有一款 27B 稠密模型，原生上下文达到 262144 个词元。两个家族目前都采用 Apache 2.0 许可，这一项上并不构成差异。</p>



<h2 class="wp-block-heading">上下文窗口决定了能干什么活</h2>



<p class="wp-block-paragraph">真正把两者拉开距离的，是上下文容量和推理方式。</p>



<p class="wp-block-paragraph">云端的千问 3.6 Plus 拥有 100 万词元的上下文窗口，并且搭配一个常驻运行的推理模式——模型会先把问题想一遍再作答。在部分会话中它还会启用思考保留模式，记住此前几轮的推演过程，从上一次的结论继续往下走，而不是每次都从零开始、重复踩同一个坑。</p>



<p class="wp-block-paragraph">这个能力在特定场景里价值极高。调试一个庞大的代码库时，100 万词元的窗口可以一次性装下整个仓库、接口文档和错误日志，让模型在几百个文件之间追踪同一个缺陷而不丢线索。</p>



<p class="wp-block-paragraph">Gemma 4 的上下文上限则视变体而定，落在 128K 到 256K 之间，装不下那么多东西。在较长的会话里，它还容易丢失被指定的角色设定，陷入需要整段重启才能跳出的重复循环。</p>



<h2 class="wp-block-heading">成本与隐私的账要分开算</h2>



<p class="wp-block-paragraph">许可与账单的差异同样值得留意。千问 3.6 的部分本地变体以免费开放许可发布，企业可以自行部署而无需申请授权；但更高端的云端版本跑在付费租用的算力上，用得越狠账单越长。</p>



<p class="wp-block-paragraph">Gemma 4 走的是相反的路径：拿到一份副本部署在自己的硬件上，一次配置完成后没有持续开销，输入的任何内容都不必离开本机——对隐私敏感的场景，这一点的分量远大于跑分。想先试一试的用户可以在 AI Studio 上体验 Gemma 4，本地部署则通常经由 Ollama 完成。Gemma 早期版本曾附带较多使用限制，如今这一层顾虑已经解除，小团队和独立开发者不必再为许可条款专门请教律师。</p>



<h2 class="wp-block-heading">别再评“史上最强”了</h2>



<p class="wp-block-paragraph">Aguilar 在文章结尾给出了一个明确判断：把 Gemma 4 和千问 3.6 当成争夺同一顶王冠的对手，本身就理解错了题目。依据排行榜名次或品牌认知度二选一，大概率会选错——因为它们要解决的根本是两类问题。同样的道理也适用于 ChatGPT、DeepSeek 背后的模型。</p>



<p class="wp-block-paragraph">会不会有一天出现一个足够大的模型，把端侧任务和深度仓库分析统统吃下？他认为这个设想并不离谱，但短期内看不到。一个能在 100 万词元的代码里做推理的模型，放到本地跑必然带来明显延迟；能撑起这种上下文窗口的云端模型，背后需要真金白银的服务器集群，还要面对网络延迟、隐私顾虑和运维成本——对普通用户来说很难承受。</p>



<p class="wp-block-paragraph">所以结论不是“哪个更好”，而是“哪个不适合当前这项任务”。把它们当成两把用途不同的工具对待，两者都会变得更好用。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/gemma-4-vs-qwen-3-6-different-jobs/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>不想交月费的 AI 搭档，能装自己电脑上</title>
		<link>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/</link>
					<comments>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 15:51:43 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AI 助手]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[效率工具]]></category>
		<category><![CDATA[本地部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/</guid>

					<description><![CDATA[这两年，AI 协作类应用成了不少人的日常工具。Claude Cowork、Codex、Antigravity  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">这两年，AI 协作类应用成了不少人的日常工具。Claude Cowork、Codex、Antigravity 这类产品都要登录账号、按月付费，还会读取用户的使用行为。当越来越多的工作流迁到这些平台，订阅成本和隐私顾虑就会叠加在一起。开源项目 Eigent 打出了&#8221;免费的本地替代&#8221;旗号——安装即用，模型还能在本地和云端之间随便换，正好切中这两点痛点。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8929186e70b&quot;}" data-wp-interactive="core/image" data-wp-key="6a8929186e70b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header.webp" alt="不想交月费的 AI 搭档，能装自己电脑上" class="wp-image-4202" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-768x512.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：XDA Developers</figcaption></figure>





<h2 class="wp-block-heading">一、下载安装并选择模型</h2>



<ol class="wp-block-list"><li>到 GitHub 的 eigent-ai/eigent 仓库下载安装包，按提示完成安装。它采用 Electron 前端加 Python 后端的架构，开箱即用，无需自己搭环境。</li><li>打开设置页选模型：本地方案可选 Ollama、LM Studio、vLLM、SGLang、LLaMA.cpp；云端则填入自备密钥，支持 Gemini、Anthropic、OpenAI、Grok、Qwen、DeepSeek、Moonshot 等。切换只是下拉框里选一下，小显卡跑本地模型卡顿时也能随时退回云端。</li></ol>



<h2 class="wp-block-heading">二、用内置智能体与技能干活</h2>



<ol class="wp-block-list"><li>开箱自带五类专用智能体：Developer（拥有终端、代码执行、文件操作）、Search、Document、Multi-Modal、Social Media，各自带着工具箱，不必从零搭工作流。</li><li>系统内置 200 多个 MCP 工具（Notion、Google Calendar、Slack、GitHub 等），也能自行接入更多。</li><li>用 Skills 沉淀个人流程：新建一个文件夹，写入 SKILL.md 描述触发条件与行为（结构与 Claude Skills 一致），之后一条命令就能触发。例如写一个读取心愿单、比价本地零售商并生成带日期报告的任务。</li></ol>



<h2 class="wp-block-heading">三、隔离浏览器与访问本机文件</h2>



<ol class="wp-block-list"><li>浏览器工具会在应用内通过 Playwright 拉起独立的 Chromium 实例，每次任务都从全新无痕会话开始，不携带本机浏览器的 Cookie、登录态和历史，避免身份泄露。</li><li>默认每个任务被沙箱到自己工作目录；若要操作目录外的文件夹，在应用里新建一个指向该文件夹的 Space（下拉一次即可），否则会拒绝访问。</li></ol>



<p class="wp-block-paragraph">注意事项：Eigent 基于 CAMEL-AI 多代理框架，适合做知识管理、调研和自动化，并非只给开发者用。首次访问沙箱外目录记得先建 Space，否则任务会被拒。</p>



<p class="wp-block-paragraph">来源：XDA Developers</p>
]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>4GB 显卡微调 8B 模型，只要一行命令</title>
		<link>https://mylogs.cn/soup-finetune-8b-llm-on-4gb-laptop-gpu/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 15:55:07 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[LoRA]]></category>
		<category><![CDATA[大模型微调]]></category>
		<category><![CDATA[开源项目]]></category>
		<category><![CDATA[显存优化]]></category>
		<category><![CDATA[本地部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/soup-finetune-8b-llm-on-4gb-laptop-gpu/</guid>

					<description><![CDATA[你要是因为显卡只有 4GB 就放弃了本地微调大模型，这个开源项目值得看一眼。 它叫 Soup，最近登上 Hac [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是因为显卡只有 4GB 就放弃了本地微调大模型，这个开源项目值得看一眼。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8929186f4e5&quot;}" data-wp-interactive="core/image" data-wp-key="6a8929186f4e5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/soup_header.webp" alt="4GB 显卡微调 8B 模型，只要一行命令" class="wp-image-3555" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/soup_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/soup_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/soup_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/soup_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / Soup 项目页</figcaption></figure>





<p class="wp-block-paragraph">它叫 Soup，最近登上 Hacker News 首页，标题很直白：在 4GB 笔记本显卡上微调 80 亿参数模型。项目采用 Apache-2.0 开源协议，目前在 GitHub 上有 147 颗星、23 个分支，累计 605 次提交。</p>



<h2 class="wp-block-heading">一个配置文件，一条命令</h2>



<p class="wp-block-paragraph">Soup 想解决的是老问题。项目自述里写道，即便是有经验的团队，也要把 30% 到 50% 的时间花在跟基础设施较劲上，而不是改进模型。它的做法是把整套流程压成一个配置文件加一条命令：安装 `pip install &#8220;soup-cli[train]&#8221;`，然后 `soup init &#8211;template chat` 生成配置、`soup train` 开跑。批大小、显卡识别、量化全部自动处理，不需要远程登录服务器，也不需要云端资源。</p>



<p class="wp-block-paragraph">真正让它能在 4GB 显卡上跑起来的是「层流式加载」：冻结的基座模型不常驻显存，而是按解码层逐层喂给显卡，配合 4bit NF4 量化把模型体积压到约四分之一，80 亿参数模型就能塞进 4GB 显卡。</p>



<h2 class="wp-block-heading">新版本把偏好训练也拉了进来</h2>



<p class="wp-block-paragraph">最新的 v0.72.4 版本把这套机制扩展到了偏好对齐训练——也就是让模型学会「这个回答比那个好」的调优阶段。以往层流式加载只支持监督微调，现在直接偏好优化（DPO）以及 ORPO、SimPO、KTO 三种方法也能跑。</p>



<p class="wp-block-paragraph">其中 DPO 需要一个参考模型做对照，常规做法要再加载一份权重、内存直接翻倍，那样省显存的意义就没了。Soup 的处理是复用同一份流式基座、把适配器关掉，等于一份权重、一条数据流。在 RTX 3050 4GB 显卡上实测，流式 DPO 的显存峰值是监督微调峰值的 0.914 倍；而强行加载真正的第二份模型，同样测试下多吃 730MB，正好是一份权重的大小。</p>



<h2 class="wp-block-heading">难得的是把代价也写清楚了</h2>



<p class="wp-block-paragraph">这个项目最值得留意的地方，不是省显存，而是它把账算给你看。文档明确写出：参考模型省的是内存不是时间，DPO 每步读取层栈的次数是监督微调的 1.52 倍；GRPO 和 PPO 两种强化学习方法被有意排除在外，因为生成阶段每输出一个词都要重读所有层，流式加载省不出来。作者还标注训练结果与非流式版本逐位一致（差异为 0），并说明整个项目是在一台 4GB 笔记本上开发维护的，因此多显卡、更大模型和苹果芯片的支持都还没验证，相关功能都挂着明确的前置条件说明。该特性目前仍标注为测试版。</p>



<p class="wp-block-paragraph">官方给出的显存对照是：8GB 约能带 70 亿参数、16GB 约 140 亿、24GB 约 340 亿、48GB 约 700 亿。项目内置 100 多个现成配方，覆盖通义千问、Llama 3、Gemma 3、Mistral、DeepSeek R1/V3、Phi-4 等模型，模板涵盖对话、代码、工具调用、推理、视觉、长上下文等场景。</p>



<p class="wp-block-paragraph">我的判断是，这类工具的价值在于把「能不能跑」变成「值不值得跑」。手上这块小显卡，你打算拿它微调点什么？</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub / Soup 项目页，Hacker News</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>2.8万亿参数跑进笔记本：Kimi K3靠硬盘流式运行</title>
		<link>https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 01 Aug 2026 12:16:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Kimi K3]]></category>
		<category><![CDATA[MacBook Pro]]></category>
		<category><![CDATA[NVMe固态硬盘]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[开源推理引擎]]></category>
		<category><![CDATA[本地部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/</guid>

					<description><![CDATA[一个名为 WASTE 的开源推理引擎，把参数量高达 2.78 万亿的 Kimi K3 完整跑在了一台 64GB [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一个名为 WASTE 的开源推理引擎，把参数量高达 2.78 万亿的 Kimi K3 完整跑在了一台 64GB 内存的 MacBook Pro 上。开发者强调，这不是蒸馏版、剪枝版或任何缩水变体，而是完整的开放权重模型。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a89291870547&quot;}" data-wp-interactive="core/image" data-wp-key="6a89291870547" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="428" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header.webp" alt="2.8万亿参数跑进笔记本：Kimi K3靠硬盘流式运行" class="wp-image-3149" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-300x107.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-1024x365.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-768x274.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Wikimedia Commons / D-Kuru，CC BY-SA 4.0</figcaption></figure>





<h2 class="wp-block-heading">一台笔记本，跑万亿级模型</h2>



<p class="wp-block-paragraph">WASTE 全称 Weight-Aware Streaming Tensor Engine（权重感知流式张量引擎），用 C 语言编写，运行时不依赖任何第三方库，没有 BLAS，没有 ONNX，推理路径里也没有 Python。</p>



<p class="wp-block-paragraph">它给出的成绩单是：Kimi K3 转换后形成一个 982 GiB 的容器文件，引擎启动的内存下限为 29.05 GB，在 64GB 内存的机器上实测速度为每秒 0.45 到 0.62 个词元。项目文档里贴出的一次实际运行记录显示，回答&#8221;意大利的首都是哪里&#8221;这个问题，输出 16 个词元耗时 25.78 秒。</p>



<p class="wp-block-paragraph">这个速度确实慢。但开发者认为，慢不是重点：目前没有找到另一份公开的、在消费级机器上通过磁盘流式运行万亿级模型的演示，而业内记录最完整的 6710 亿参数方案，前提是一台配备 1TB 内存的服务器。</p>



<h2 class="wp-block-heading">原理：把闲置的权重放回硬盘</h2>



<p class="wp-block-paragraph">这套方案能成立，靠的是混合专家架构的稀疏特性。Kimi K3 每处理一个词元，只会从 896 个路由专家中激活 16 个，实际参与运算的权重约占总量的 4%。绝大部分权重在任一时刻都处于闲置状态，而闲置的权重不需要待在内存里，只需要&#8221;能及时取到&#8221;。</p>



<p class="wp-block-paragraph">WASTE 的做法是把模型主干常驻内存，专家权重留在硬盘上，并按特定布局排列——每条专家记录按 4KiB 对齐，门控、上投影、下投影三个矩阵相邻存放，因此路由到一个专家只需要一次读取操作，而不是三次。剩余内存全部用作有界的专家缓存。</p>



<p class="wp-block-paragraph">真正拉开差距的优化有两项。一是把专家读取与算术运算重叠执行，收益约 1.6 倍。二是&#8221;抢跑&#8221;：下一层的专家编号本来要等隐藏状态算出来才知道，但路由器本身是常驻内存的，于是引擎在每层结束时，直接用当前层的隐藏状态去跑下一层的路由器，提前把它点名的专家取回来。这个提前一个残差块的猜测，排名第一的命中率为 92%，前六名合计 81%，把缓存命中率从 14% 拉到 38%，而总读取字节数完全不变。</p>



<p class="wp-block-paragraph">专家权重采用残差矢量量化存储，三级 256 条目码本作用于 8 维向量，平均每个权重 3.00 比特；模型主干则保持 4 比特和 8 比特精度。开发者试过把主干也压到 3 比特，结果输出直接崩溃。</p>



<h2 class="wp-block-heading">硬盘速度决定一切</h2>



<p class="wp-block-paragraph">文档反复强调，存储速度不是细节问题。处理一个词元需要读取 17GB 的专家数据，走内部固态硬盘的实测带宽是每秒 12.78GB，模型能流畅串起来；换成 USB 外置硬盘只有每秒 0.94GB，同一个词元要等 13 秒。结论很直接：外置硬盘只用来下载，转换后的容器必须放在机器内置的 NVMe 上。</p>



<p class="wp-block-paragraph">内存预算也存在反直觉的现象。在 64GB 的机器上，46GB 预算跑出 0.53 到 0.55 词元每秒，是曲线最高点；而预算调到 52GB 时结果在 0.04 到 0.46 之间剧烈跳动，完全不可复现；调到 58GB 更是稳定跌到 0.02 至 0.03。原因不是缓存失效，而是引擎虽然守住了自己的预算，机器整体却已经放不下，操作系统开始换页。</p>



<p class="wp-block-paragraph">对于不想拿出一整块 TB 级硬盘的人，同一套引擎和格式可以运行 Kimi-Linear-48B，容器只有 19GB，内存门槛 1.87GB，速度能到每秒 10.7 个词元。</p>



<h2 class="wp-block-heading">意义在哪</h2>



<p class="wp-block-paragraph">开发者对项目名字的解释是：每一个由云端服务生成的词元都被付费了两次，一次是账单，一次是数据中心的电费——而那个模型本可以（勉强、别扭但确实可以）跑在已经摆在桌上的硬件里。</p>



<p class="wp-block-paragraph">这套方案指向的场景很明确：一个前沿规模的模型，回答问题时不需要联网，没有按词元计费的账单，也没有任何数据离开本机。对于&#8221;这些数据不能发给外部接口&#8221;的场合，差别就是能做和不能做。</p>



<p class="wp-block-paragraph">作为验证对象的 Kimi K3 于 7 月 27 日由月之暗面公开权重，总参数量 2.8 万亿，支持 100 万词元上下文与原生视觉理解，是目前参数规模最大的开放权重模型。WASTE 项目方称，引擎和格式本身并不特别针对 K3，选它只是因为它是当下最难啃的一块骨头——能流式跑通 2.78 万亿参数，跑 480 亿参数自然轻松。</p>



<p class="wp-block-paragraph">来源：GitHub 开源项目 sqliteai/waste 项目文档、Hacker News；Kimi K3 参数信息来自月之暗面官方发布</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>断网也能语音转文字：Mac开源神器用上千问模型</title>
		<link>https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 29 Jul 2026 19:02:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[Mac]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[开源软件]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[语音识别]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名为 Qwen Scribe 的开源工具在 GitHub 上发布了首个公开测试版（v0.1.0-beta.1），思路完全相反：模型跑在本地、数据不出电脑、不要账号也不要 API 密钥，代码以 Apache-2.0 协议完全开源。项目上线当天就冲上了 Hacker News 首页。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a892918714eb&quot;}" data-wp-interactive="core/image" data-wp-key="6a892918714eb" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp" alt="断网也能语音转文字：Mac开源神器用上千问模型" class="wp-image-2492" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / VladUZH</figcaption></figure>





<h2 class="wp-block-heading">核心是阿里开源的千问语音模型</h2>



<p class="wp-block-paragraph">Qwen Scribe 的底层是阿里巴巴开源的 Qwen3-ASR 语音识别模型，通过 mlx-qwen3-asr 项目跑在 Mac 的 Metal GPU 上。Qwen3-ASR 是目前最强的开源语音识别模型之一，有第三方移植测试显示，它在多语言和嘈杂环境下的识别表现优于 OpenAI 的 Whisper-large-v3。</p>



<p class="wp-block-paragraph">工具提供两档模型可选：追求准确率可以用 17 亿参数版本，占用约 3.4GB 统一内存；追求速度可以用 6 亿参数版本，只占约 1.2GB 内存。模型权重在首次使用时自动下载，之后即使断网也能正常转写。</p>



<h2 class="wp-block-heading">两种用法：拖文件转写，或全局听写</h2>



<p class="wp-block-paragraph">Qwen Scribe 的功能分两块。第一块是文件转写：在本地网页界面里把音频或视频文件拖进去，工具会自动识别语言，支持强制指定语言、专有词汇提示、逐词时间戳，还能直接导出 SRT 字幕文件。所有转写记录自动保存在本地，可以随时重新打开或删除。</p>



<p class="wp-block-paragraph">第二块是系统级听写，这也是最实用的部分：在任意应用的文本输入框里，按住右侧 Command 键说话，松开后文字就会在光标处自动粘贴出来——全程在本地完成识别。屏幕上会显示一个不抢焦点的悬浮提示，标明「聆听中」「转写中」以及成功或失败状态。</p>



<p class="wp-block-paragraph">隐私设计上，这款工具做得相当细致：本地服务只监听 127.0.0.1，并做了 Host 和浏览器来源校验；听写助手只响应右 Command 键，粘贴文字前会在内存里暂存剪贴板内容，粘贴后如果剪贴板没被改动就自动恢复原状。</p>



<h2 class="wp-block-heading">上手门槛：目前需要自己动手编译</h2>



<p class="wp-block-paragraph">想尝鲜的用户需要注意几个条件：必须是搭载 Apple Silicon 芯片的 Mac，系统要求 macOS 14 或更新版本，还需要安装 Python 3.12 以上版本和 ffmpeg。</p>



<p class="wp-block-paragraph">目前的测试版只提供源码，没有现成的安装包——因为应用还没有经过苹果的开发者签名和公证，开发者不希望用户绕过系统安全警告安装未签名程序。用户需要克隆代码仓库后用 make app 命令自行编译。按照路线图，签名和公证过的正式安装包计划在 v0.2 版本推出。</p>



<p class="wp-block-paragraph">另外要说明的是，Qwen Scribe 是独立的社区项目，与阿里云、千问团队以及苹果公司均无官方关联。</p>



<p class="wp-block-paragraph">对于经常需要整理录音、写字幕，又不放心把敏感内容传到云端的用户来说，这类「模型在本地、数据不出门」的工具正在变成一个值得关注的方向——大厂的开源模型加上社区开发者的打磨，免费方案的体验已经越来越接近付费云服务。</p>



<p class="wp-block-paragraph">来源：<a href="https://github.com/VladUZH/qwen-scribe">GitHub &#8211; VladUZH/qwen-scribe</a>（via Hacker News）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
