<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Qwen &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/qwen/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Thu, 13 Aug 2026 06:27:32 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署</title>
		<link>https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 06:27:05 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</guid>

					<description><![CDATA[阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwe [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwen3.8-2.4T-A95B。这是千问历史上第一次向社区开放「Max 级」旗舰权重——过去这类顶级模型通常只以云端 API 形式提供，如今任何人都能下载、修改、自行部署。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257b598&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257b598" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp" alt="千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署" class="wp-image-4671" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-768x415.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Qwen / 阿里巴巴（Hugging Face 模型页）</figcaption></figure>





<h2 class="wp-block-heading">2.4 万亿参数，每步只激活 950 亿</h2>



<p class="wp-block-paragraph">这组数字的命名已经写明了规格：「2.4T」代表模型总参数量达到 2.4 万亿；「A95B」代表每次前向计算只为单个词元激活 950 亿参数。实现这一点的，是混合专家（MoE）结构：模型共 92 层，每层拥有 512 个专家，每个词元只路由到其中 10 个路由专家加 1 个共享专家。底层采用 Qwen3.5 架构，并混合了门控 DeltaNet 与门控注意力机制。</p>



<p class="wp-block-paragraph">相比训练一个 2.4 万亿参数的稠密模型，MoE 让「模型很大、跑起来却只需算一小部分」成为可能，大幅压低了推理成本。原生上下文长度为 262144 个词元，最长可扩展至约 101 万词元，足以覆盖长文档与长周期智能体任务。</p>



<h2 class="wp-block-heading">和云端 Max 版不是一回事</h2>



<p class="wp-block-paragraph">需要区分的是，放权的开源版与早先上线的云端版 Qwen3.8-Max 并不完全相同。云端 Max 于 8 月初发布，额外支持视觉输入、可关闭的思考模式、默认 100 万词元上下文，以及官方内置工具；而开源版 Qwen3.8-2.4T-A95B 目前只有文本输入，且思考模式默认开启、无法关闭——模型在给出最终回答前会先生成推理过程，并通过 preserve_thinking 标记在多次对话间保留推理上下文，适合需要跨步骤保持「草稿」的智能体循环。</p>



<p class="wp-block-paragraph">在官方公布的基准中，同架构的云端版本 Qwen3.8-Max 在论文复现基准 PaperBench 取得 93.0 分、在计算机操作基准 OSWorld-Verified 取得 86.1 分、在参数化 CAD 基准取得 91.5 分，均居参评模型前列；不过在 TerminalBench 2.1（86.6）与 SWE-bench Pro（67.7）上仍略低于部分对手。整体定位被千问团队形容为「除 Fable 5 外最强的模型之一」。</p>



<h2 class="wp-block-heading">自己跑起来要多少硬件</h2>



<p class="wp-block-paragraph">开源权重意味着可以本地部署。官方支持通过 Hugging Face Transformers、SGLang、vLLM、TokenSpeed 等推理框架加载，正式部署时需使用各框架针对 Qwen3.8 的最新配方，并按权重精度与 GPU 数量选择并行策略。</p>



<p class="wp-block-paragraph">全精度权重体积可观，但开源社区已经给出了瘦身方案。Unsloth 团队用动态 1-bit 分层选择性量化技术，把原始约 4.9TB 的模型压到 397GB，存储空间缩减约 91%；借助其 Unsloth-Desktop 工具，只要设备的内存与显存合计达到 410GB 以上，就能在本地把模型跑起来。对没有数据中心的中小团队而言，这意味着前沿级能力第一次能以自托管的形式落在自己手里。</p>



<h2 class="wp-block-heading">许可证与价格</h2>



<p class="wp-block-paragraph">开放不等于完全自由。Qwen3.8-2.4T-A95B 采用千问自定义许可证，而非早先常见的 Apache 2.0：个人下载、修改、部署不受限，但大规模商业使用需要另行取得授权。配套发布的还有一颗约 270 亿参数的稠密伴随模型 Qwen3.8-27B，面向算力有限的场景，不过在开源权重放出时尚未同步上线。</p>



<p class="wp-block-paragraph">云端 Qwen3.8-Max 的国内 API 定价为每百万词元输入 12 元、输出 36 元，海外为每百万词元输入 2 美元、输出 6 美元。</p>



<h2 class="wp-block-heading">为什么这件事值得关注</h2>



<p class="wp-block-paragraph">把旗舰级权重交到社区手中，意义不只在「又大了一点」。过去一年，西方实验室谈开源时往往只放出 200 亿到 300 亿参数量级的中等模型，而阿里这次直接把自家最强旗舰摆上了桌面。无论动机如何，实际效果是：当前能完全自托管、可离线运行的最强模型之一，来自于中国的开源阵营，且差距明显。</p>



<p class="wp-block-paragraph">对开发者与研究者来说，这意味着不必再为前沿能力向专有 API 持续付费，也能在本地做微调、评测与私有化部署；对下游应用，则把竞争拉回了「在模型之上能做出什么」这一层。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hugging Face 模型页 / 千问团队（经 Hacker News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>智能体榜首易主：Qwen3.8 以 55.4 分掀翻 Claude</title>
		<link>https://mylogs.cn/qwen38-max-agentic-index-first-place-artificial-analysis/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 20:46:32 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[阿里]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen38-max-agentic-index-first-place-artificial-analysis/</guid>

					<description><![CDATA[你还在以为 AI 智能体的天下只有 Claude 和 GPT 吗？8 月 6 日，独立评测机构 Artific [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你还在以为 AI 智能体的天下只有 Claude 和 GPT 吗？8 月 6 日，独立评测机构 Artificial Analysis 公布了新一期 Agentic Index（智能体能力指数）榜单，阿里通义千问 Qwen3.8-Max 以 55.4 分拿下全球第一，超过 Claude Opus 5 和 GPT-5.6。这是该指数发布以来，首次由中国模型登顶。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257c3ad&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257c3ad" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/dce7ba63_header.webp" alt="智能体榜首易主：Qwen3.8 以 55.4 分掀翻 Claude" class="wp-image-3873" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/dce7ba63_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/dce7ba63_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/dce7ba63_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/dce7ba63_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<p class="wp-block-paragraph">Agentic Index 衡量的是 AI 调用工具、规划多步任务、在真实工作场景中交付结果的能力——简单说就是&#8221;能不能当助手干活&#8221;。它由两项核心测试等权平均组成：GDPval-AA v2（模拟 44 种职业的知识工作完成度）和 τ³-Banking（金融客服多轮对话与知识检索）。两项都是实打实的工具调用测试，不是做选择题。</p>



<p class="wp-block-paragraph">说白了，这个榜单一向被美国闭源模型垄断。此前中国模型最好的成绩是 Kimi K3 的 50.1 分，而这次 Qwen3.8-Max 直接把纪录拉高了 5 分以上。这意味着在&#8221;让 AI 真正动手做事&#8221;这条赛道上，中美差距正在快速收窄。</p>



<p class="wp-block-paragraph">从模型规格看，Qwen3.8-Max 总参数量达 2.4 万亿（采用稀疏 MoE 架构），激活参数约 950 亿，上下文窗口支持 100 万 Token。它在多项子测试中表现突出：PaperBench（论文复现）93.0 分、OSWorld-Verified（电脑操作）86.1 分、Terminal-Bench 2.1（终端命令行操作）86.6 分——后两项均超过了 Claude Fable 5 和 GPT-5.6 Sol。</p>



<p class="wp-block-paragraph">价格方面也有明显优势。Qwen3.8-Max 的 API 定价约为 Claude Opus 5 输入价格的 40%、输出价格的 24%。阿里还宣布将于下周开源 Qwen3.8-Max 权重，如果兑现承诺，这将是迄今公开的最大规模模型之一。</p>



<p class="wp-block-paragraph">对开发者来说，这个排名传递了一个信号：选模型不必只盯美国闭源方案。如果你的应用涉及多模态操作、长程任务调度或成本敏感部署，Qwen3.8-Max 值得放进对比清单。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Artificial Analysis / MarkTechPost / 量子位 / 上海证券报</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>4.3G 内存跑起 800 亿参数大模型</title>
		<link>https://mylogs.cn/4-3g-%e5%86%85%e5%ad%98%e8%b7%91%e8%b5%b7-800-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 07:04:56 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[大模型本地部署]]></category>
		<category><![CDATA[苹果设备]]></category>
		<category><![CDATA[通义千问]]></category>
		<guid isPermaLink="false">https://mylogs.cn/4-3g-%e5%86%85%e5%ad%98%e8%b7%91%e8%b5%b7-800-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[你的电脑大概率跑不动 800 亿参数的大模型——除非换个装法。开源项目 Swiftlet 近日在技术社区 Ha [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你的电脑大概率跑不动 800 亿参数的大模型——除非换个装法。开源项目 Swiftlet 近日在技术社区 Hacker News 上亮出一组数字：4 比特量化的通义千问 Qwen3-Next-80B-A3B，硬盘要占 42GB，运行时内存峰值却只有 4.3GB，在搭载 M5 芯片的 Mac 上每秒解码 4.5 到 5 个词元；更小的 Qwen3.6-35B-A3B 内存峰值 2.6GB、每秒 7 到 11 个词元，还能在 iPhone 17 上以约 2.5GB 内存原生运行，速度约每秒 1 个词元。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257ce4e&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257ce4e" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/159fc2adbcc165caeea935332ec0cfea_header.webp" alt="4.3G 内存跑起 800 亿参数大模型" class="wp-image-3494" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/159fc2adbcc165caeea935332ec0cfea_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/159fc2adbcc165caeea935332ec0cfea_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/159fc2adbcc165caeea935332ec0cfea_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/159fc2adbcc165caeea935332ec0cfea_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / Swiftlet 项目页</figcaption></figure>





<p class="wp-block-paragraph">它靠的不是压缩，是搬家。这两代通义千问用的是混合专家架构（MoE，一个大模型内部拆成许多小专家，每次只喊几个干活）：800 亿参数版每层从 512 个专家里挑 10 个，实际每个词元只激活约 30 亿参数。Swiftlet 把常驻不变的那部分留在内存里，只占 1.3GB 到 2.5GB；剩下几万个专家权重打包成固定步长的容器文件放进固态硬盘，用哪个读哪个，一次读取对应一个专家，热门专家再用小缓存兜着，实测命中率 43% 到 70%。</p>



<p class="wp-block-paragraph">说白了，不是模型变小了，是内存这道门槛被硬盘顶掉了。这类&#8221;以存换存&#8221;的思路，落地速度大概会快过等更大内存的新机器。</p>



<p class="wp-block-paragraph">代价也得说清楚。作者自己承认，每个词元只激活 30 亿参数，模型&#8221;聊天和写作像大模型，记事实像小模型&#8221;；长提示词处理更慢，社区实测一万词元的提示要跑约半小时。项目采用 Apache 2.0 协议，要求苹果芯片、macOS 14 或 iOS 17 以上，同时提供命令行工具和兼容主流接口的本地服务。</p>



<p class="wp-block-paragraph">为了让数据不出本机，你愿意忍受每秒几个词元的速度吗？</p>



<p class="wp-block-paragraph">来源：GitHub / leonickson1 · Swiftlet，Hacker News「Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone」</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>千问 3.8-Max 首发：2.4 万亿参数拐点在哪</title>
		<link>https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 04:54:40 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[阿里]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/</guid>

					<description><![CDATA[千问 3.8-Max 首发：2.4 万亿参数拐点在哪]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你刷到一个数字，先别急着激动——2.4万亿参数、激活95B、千问史上首个开放权重的Max级模型，阿里2026年8月3日把Qwen3.8-Max端了出来。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257d649&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257d649" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="674" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header.webp" alt="千问 3.8-Max 首发：2.4 万亿参数拐点在哪" class="wp-image-3398" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-1024x575.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-768x431.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：腾讯网/IT之家</figcaption></figure>





<p class="wp-block-paragraph">它走的是稀疏MoE（混合专家）架构，总参数2.4万亿，每次推理只激活约950亿。上下文长度顶到1M tokens，硬件、显存、推理延迟这些事留给模型自己。定价是国际版每百万token输入2美元、输出6美元，对标Claude Opus 5只到对手的40%和24%。国内千问AI平台价格为每百万token输入12元、输出36元。</p>



<p class="wp-block-paragraph">动手能力方面，官方甩出三个真实案例：模型从零搭建oh-my-cli项目，无人工介入跑16天，265次提交、127个PR、151个issue；复现一篇推理论文并自我迭代，连续工作125小时、7600行代码、33轮GPU训练，AIME24比原方法再涨2.7分；参加WWW2025多模态对话挑战赛，24小时内击败458支人类队伍。芯片设计任务里，500轮交互把硬件门数从8298压到678，物理面积从106×106微米缩到46×46微米，整体缩小81%。</p>



<p class="wp-block-paragraph">基准上，PaperBench 93.0、IFBench 82.8、HealthBench 60.2、CoWorkBench 74.8、JobBench 53.4，多项超过Anthropic Fable 5和GPT-5.6 Sol；OSWorld-Verified 86.1、MLVU 90.8，多模态也不落下风。</p>



<p class="wp-block-paragraph">说白了，这版千问终于把&#8221;长程自主&#8221;摆到台面上了，标杆不再是单点刷分，而是能不能从一个空文件夹干完一个真实项目。权重下周登陆Hugging Face和ModelScope，Qwen3.8-27B同步开源。能调用Codex、Claude Code、Qoder这些主流框架，国内直接上qianwenai.com。</p>



<p class="wp-block-paragraph">我的判断是，国产大模型真正可用的临界点，不是榜单分数，而是这种&#8221;扔进去一个目标，干完十几个工作日&#8221;的工程闭环。等开源权重放出来，你会拿它跑什么？先想好怎么用。</p>



<p class="wp-block-paragraph">来源：千问官方博客、凤凰网科技、IT之家</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>断网也能语音转文字：Mac开源神器用上千问模型</title>
		<link>https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 29 Jul 2026 19:02:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[Mac]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[开源软件]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[语音识别]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名为 Qwen Scribe 的开源工具在 GitHub 上发布了首个公开测试版（v0.1.0-beta.1），思路完全相反：模型跑在本地、数据不出电脑、不要账号也不要 API 密钥，代码以 Apache-2.0 协议完全开源。项目上线当天就冲上了 Hacker News 首页。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257e463&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257e463" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp" alt="断网也能语音转文字：Mac开源神器用上千问模型" class="wp-image-2492" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / VladUZH</figcaption></figure>





<h2 class="wp-block-heading">核心是阿里开源的千问语音模型</h2>



<p class="wp-block-paragraph">Qwen Scribe 的底层是阿里巴巴开源的 Qwen3-ASR 语音识别模型，通过 mlx-qwen3-asr 项目跑在 Mac 的 Metal GPU 上。Qwen3-ASR 是目前最强的开源语音识别模型之一，有第三方移植测试显示，它在多语言和嘈杂环境下的识别表现优于 OpenAI 的 Whisper-large-v3。</p>



<p class="wp-block-paragraph">工具提供两档模型可选：追求准确率可以用 17 亿参数版本，占用约 3.4GB 统一内存；追求速度可以用 6 亿参数版本，只占约 1.2GB 内存。模型权重在首次使用时自动下载，之后即使断网也能正常转写。</p>



<h2 class="wp-block-heading">两种用法：拖文件转写，或全局听写</h2>



<p class="wp-block-paragraph">Qwen Scribe 的功能分两块。第一块是文件转写：在本地网页界面里把音频或视频文件拖进去，工具会自动识别语言，支持强制指定语言、专有词汇提示、逐词时间戳，还能直接导出 SRT 字幕文件。所有转写记录自动保存在本地，可以随时重新打开或删除。</p>



<p class="wp-block-paragraph">第二块是系统级听写，这也是最实用的部分：在任意应用的文本输入框里，按住右侧 Command 键说话，松开后文字就会在光标处自动粘贴出来——全程在本地完成识别。屏幕上会显示一个不抢焦点的悬浮提示，标明「聆听中」「转写中」以及成功或失败状态。</p>



<p class="wp-block-paragraph">隐私设计上，这款工具做得相当细致：本地服务只监听 127.0.0.1，并做了 Host 和浏览器来源校验；听写助手只响应右 Command 键，粘贴文字前会在内存里暂存剪贴板内容，粘贴后如果剪贴板没被改动就自动恢复原状。</p>



<h2 class="wp-block-heading">上手门槛：目前需要自己动手编译</h2>



<p class="wp-block-paragraph">想尝鲜的用户需要注意几个条件：必须是搭载 Apple Silicon 芯片的 Mac，系统要求 macOS 14 或更新版本，还需要安装 Python 3.12 以上版本和 ffmpeg。</p>



<p class="wp-block-paragraph">目前的测试版只提供源码，没有现成的安装包——因为应用还没有经过苹果的开发者签名和公证，开发者不希望用户绕过系统安全警告安装未签名程序。用户需要克隆代码仓库后用 make app 命令自行编译。按照路线图，签名和公证过的正式安装包计划在 v0.2 版本推出。</p>



<p class="wp-block-paragraph">另外要说明的是，Qwen Scribe 是独立的社区项目，与阿里云、千问团队以及苹果公司均无官方关联。</p>



<p class="wp-block-paragraph">对于经常需要整理录音、写字幕，又不放心把敏感内容传到云端的用户来说，这类「模型在本地、数据不出门」的工具正在变成一个值得关注的方向——大厂的开源模型加上社区开发者的打磨，免费方案的体验已经越来越接近付费云服务。</p>



<p class="wp-block-paragraph">来源：<a href="https://github.com/VladUZH/qwen-scribe">GitHub &#8211; VladUZH/qwen-scribe</a>（via Hacker News）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>手机跑本地AI比游戏PC还快？实测原因出人意料</title>
		<link>https://mylogs.cn/%e6%89%8b%e6%9c%ba%e8%b7%91%e6%9c%ac%e5%9c%b0ai%e6%af%94%e6%b8%b8%e6%88%8fpc%e8%bf%98%e5%bf%ab%ef%bc%9f%e5%ae%9e%e6%b5%8b%e5%8e%9f%e5%9b%a0%e5%87%ba%e4%ba%ba%e6%84%8f%e6%96%99/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 28 Jul 2026 23:07:28 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[iPhone]]></category>
		<category><![CDATA[LM Studio]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[本地大模型]]></category>
		<category><![CDATA[经验技巧]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%89%8b%e6%9c%ba%e8%b7%91%e6%9c%ac%e5%9c%b0ai%e6%af%94%e6%b8%b8%e6%88%8fpc%e8%bf%98%e5%bf%ab%ef%bc%9f%e5%ae%9e%e6%b5%8b%e5%8e%9f%e5%9b%a0%e5%87%ba%e4%ba%ba%e6%84%8f%e6%96%99/</guid>

					<description><![CDATA[提到在本地设备上运行大语言模型，多数人的第一反应是：得有一台带独立显卡的台式机。但 XDA 撰稿人 Nolen [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">提到在本地设备上运行大语言模型，多数人的第一反应是：得有一台带独立显卡的台式机。但 XDA 撰稿人 Nolen Jonker 分享了一个反直觉的实测结果——他日常真正常用的本地 AI 设备不是游戏 PC，而是手机，而且手机的出词速度经常反超台式机。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8943257f306&quot;}" data-wp-interactive="core/image" data-wp-key="6a8943257f306" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/96eb57cbe0c6e87d3ad2e66b27008c23_header.webp" alt="手机跑本地AI比游戏PC还快？实测原因出人意料" class="wp-image-2247" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/96eb57cbe0c6e87d3ad2e66b27008c23_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/96eb57cbe0c6e87d3ad2e66b27008c23_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/96eb57cbe0c6e87d3ad2e66b27008c23_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/96eb57cbe0c6e87d3ad2e66b27008c23_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：XDA Developers</figcaption></figure>





<h4 class="wp-block-heading">实测数据：小模型跑赢大模型</h4>



<p class="wp-block-paragraph">在 iPhone 16 上通过 PocketPal 应用运行本地模型时，4B 参数规模的模型稳定在每秒约 13 个 token，2B 模型甚至能超过每秒 20 个。而在台式机上，用 LM Studio 运行 9B 模型，即便把 GPU 卸载层数推到不影响其他软件使用的极限，同样的任务只有每秒 9 个 token 左右——参数更小、硬件更弱的一方反而更快。</p>



<p class="wp-block-paragraph">原因出在显存瓶颈上。LM Studio 允许把模型的 transformer 层卸载到 GPU 上运行，但每多推一层都要占用显存。9B 模型塞不进 8GB 显存的显卡时，溢出部分只能放进内存由 CPU 处理，速度随之断崖式下跌。想同时开着浏览器、Figma、Obsidian 等日常软件，就必须给显卡留余量，卸载层数减少，生成速度进一步变慢。</p>



<p class="wp-block-paragraph">手机反而没有这种取舍。它本来就只能运行小模型，而这些模型正是针对移动端约束设计的——比如 Qwen 3.5 2B 就是该系列面向智能手机部署的版本。A18 芯片采用统一内存架构，不存在独立显存预算的冲突。且小模型的能力差距比参数量看起来小得多：据称 Qwen 4B 在许多基准测试上已能追平上一代 80B 模型的表现。</p>



<h4 class="wp-block-heading">使用体验：省掉「启动税」</h4>



<p class="wp-block-paragraph">除了速度，手机还省掉了本地模型的「启动成本」。台式机上如果 LM Studio 没有预先加载好模型，从打开到出第一个 token 要等十秒以上；而 PocketPal 打开即自动载入上次使用的模型，几秒内就能开始输入。与手机上的云端 AI 相比，本地模型没有服务器往返延迟，首 token 响应反而更快。</p>



<h4 class="wp-block-heading">台式机仍有不可替代的场景</h4>



<p class="wp-block-paragraph">这并不是说手机全面胜出。当关闭其他软件、让 LM Studio 独占整台机器时，9B 或 12B 模型可以轻松达到每秒 20 个 token 以上，小模型甚至能冲上三位数。需要长上下文的任务——比如解析整篇论文或长篇转录文本——2B 模型很快就会塞满，且手机在持续生成时会因发热降频。文档解析、研究综合这类需要「坐下来认真干活」的场景，台式机依然是更好的选择。</p>



<p class="wp-block-paragraph">这次对比的结论是：对本地大模型而言，「合适」比「性能强」更重要，关键是让模型规模匹配设备与使用场景。</p>



<p class="wp-block-paragraph">来源：XDA Developers</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
