<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>开源大模型 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%bc%80%e6%ba%90%e5%a4%a7%e6%a8%a1%e5%9e%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 08:31:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>阿里通义千问下载破 30 亿，成全球最火开源 AI 模型</title>
		<link>https://mylogs.cn/alibaba-qwen-3-billion-downloads/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 08:31:03 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[中国AI]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[开源生态]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[阿里]]></category>
		<guid isPermaLink="false">https://mylogs.cn/alibaba-qwen-3-billion-downloads/</guid>

					<description><![CDATA[30 亿次下载意味着什么 开源大模型领域出现了一个标志性数字：阿里巴巴的通义千问（Qwen）家族累计全球下载量 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">30 亿次下载意味着什么</h2>



<p class="wp-block-paragraph">开源大模型领域出现了一个标志性数字：阿里巴巴的通义千问（Qwen）家族累计全球下载量突破 30 亿次，超越谷歌、Meta 等对手，成为全球下载量最高的开源 AI 模型家族。这一数据来自 Hugging Face 于 2026 年 8 月 14 日发布的一份「开源模型现状」报告，以及阿里巴巴同月 15 日的官方披露。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5eff3b90&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5eff3b90" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1078" height="718" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/qwen_header.webp" alt="阿里通义千问下载破 30 亿，成全球最火开源 AI 模型" class="wp-image-5072" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/qwen_header.webp 1078w, https://mylogs.cn/wp-content/uploads/2026/08/qwen_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/qwen_header-1024x682.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/qwen_header-768x512.webp 768w" sizes="(max-width: 1078px) 100vw, 1078px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：China Daily</figcaption></figure>





<p class="wp-block-paragraph">在 Hugging Face 平台内部，2026 年 Qwen 的下载量约为 20.45 亿次，而谷歌约为 4.18 亿次、Meta 约为 2.27 亿次——这一统计只覆盖 Hugging Face Hub，还不含中国的 ModelScope 等平台，因此低于 Qwen 跨平台累计的 30 亿次。</p>



<h2 class="wp-block-heading">生态比单点性能更关键</h2>



<p class="wp-block-paragraph">截至披露时，阿里巴巴已开源超过 460 个 Qwen 模型，衍生出 30 万余个下游模型。仅在 Hugging Face 上，开发者就基于 Qwen 创建了 151,448 个衍生模型，是 Meta 衍生数的 2.6 倍、Llama 家族相关仓库数的 4.7 倍；同期的谷歌模型衍生数为 82,506 个。</p>



<p class="wp-block-paragraph">开源权重模型可以被下载、微调并用作新 AI 产品的积木，因此下载量与衍生模型数，成为衡量开发者「用脚投票」的指标，也折射出中美开源 AI 竞赛的此消彼长。报告还指出，2026 年中国头部实验室发布的最大开源模型，参数规模普遍高于美国同行：中方月度上限在 7540 亿到 2.78 万亿之间，而美方大多数月份的最大开源模型低于 1300 亿参数。同时，中国开发者普遍采用宽松许可证——在报告追踪的 178 个参数量超 200 亿的中国模型中，59% 使用 Apache 2.0、22% 使用 MIT，没有任何一个限制仅限非商业使用。</p>



<h2 class="wp-block-heading">为什么它能走出去</h2>



<p class="wp-block-paragraph">Qwen 的崛起并非只靠性能与低价。阿里通过云业务，把 Qwen 分发到东南亚、非洲等市场的企业客户，触达许多对手没有的渠道。报告称，Qwen 已成为开发者决定微调与部署模型时「默认工作流」的一部分。面对这一态势，Meta、英伟达等美国公司近几周也相继发布新的开源模型，争夺开发者。</p>



<p class="wp-block-paragraph">对中文世界而言，一个由中国公司主导、又能被全球开发者广泛采用的开源模型家族，意味着本地应用与二次开发有了更稳固的底座。</p>



<p class="has-small-font-size wp-block-paragraph">来源：China Daily / 彭博社（据 Hugging Face 2026 年 8 月开源模型报告）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>智谱 GLM-5.3 发布：编程涨 50% 登顶开源</title>
		<link>https://mylogs.cn/zhipu-glm-5-3-release/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 02:01:54 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI基准]]></category>
		<category><![CDATA[GLM-5.3]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[智谱]]></category>
		<category><![CDATA[编程]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/zhipu-glm-5-3-release/</guid>

					<description><![CDATA[国产开源大模型在八月中旬迎来密集更新。继月之暗面发布 Kimi K3、DeepSeek 发布 V4 Pro 之 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">国产开源大模型在八月中旬迎来密集更新。继月之暗面发布 Kimi K3、DeepSeek 发布 V4 Pro 之后，智谱于 8 月 14 日正式推出新一代基座模型 GLM-5.3。与以往靠堆参数不同，这一次的跃升几乎全部来自后训练阶段。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f0006c8&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f0006c8" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/65634b25a1283ca0a7959a443d579081_header.webp" alt="智谱 GLM-5.3 发布：编程涨 50% 登顶开源" class="wp-image-5034" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/65634b25a1283ca0a7959a443d579081_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/65634b25a1283ca0a7959a443d579081_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/65634b25a1283ca0a7959a443d579081_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/65634b25a1283ca0a7959a443d579081_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">示意图（AI 大模型 / Unsplash）</figcaption></figure>





<h2 class="wp-block-heading">同基座、靠后训练拉开差距</h2>



<p class="wp-block-paragraph">GLM-5.3 总参数规模为 7430 亿，与 GLM-5.2 共享同一基座模型，所有能力提升都来自后训练 Scaling——可以理解为「课本没换，但换了更好的训练方法」。相较 GLM-5.2，其在编程能力上提升约 50%（基于智谱内部的 Z.ai Code Bench）。</p>



<p class="wp-block-paragraph">在公开基准上，GLM-5.3 取得多项开源最佳：Terminal-Bench 3.0 得分 28.3，明显超过 Kimi K3 的 17.4，而 GLM-5.2 在该项仅 4.6；DeepSWE v1.1 软件工程基准得分 66.9（GLM-5.2 为 46.2，Kimi K3 为 67.5）。整体编程体感已逼近 Claude Fable 5 与 GPT-5.6 Sol 所处的第一梯队。</p>



<h2 class="wp-block-heading">网络安全成意外亮点</h2>



<p class="wp-block-paragraph">更受关注的是能力的外溢。随着后训练规模放大，GLM-5.3 在网络安全方向涌现出了超出立项预期的能力：在 CyberGym 漏洞推理评测中得分 84.5%，高于 GLM-5.2 的 77.2%，也略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。</p>



<p class="wp-block-paragraph">发布前两周，智谱联合安全团队开展测试，累计发现经去重后的潜在漏洞 2404 个，其中 1088 个为中高危。研究人员还借助该模型定位了一处潜伏 40 余年的 DNS 协议级风险——攻击者只需少量特殊请求，就能把服务器压力最高放大近 8 万倍，潜在影响超过 1000 万处公网 DNS 服务。</p>



<h2 class="wp-block-heading">一个月，三家头部厂商集体迭代</h2>



<p class="wp-block-paragraph">GLM-5.3 并非孤例。就在此前一个月，月之暗面于 7 月 17 日发布总参数 2.8 万亿的 Kimi K3，DeepSeek 于 8 月 13 日上线总参数 1.6 万亿、每 token 激活约 490 亿的 V4 Pro。三家头部厂商在编程与复杂任务方向上集体逼近国际前沿。智谱表示，GLM-5.3 权重将在发布两周后开源，并计划接入 ZCode、Trae、Work、Qoder 等开发平台。</p>



<p class="has-small-font-size wp-block-paragraph">来源：智谱官方技术博客 z.ai / 中国基金报、证券时报等报道（2026-08-14）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署</title>
		<link>https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 06:27:05 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</guid>

					<description><![CDATA[阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwe [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwen3.8-2.4T-A95B。这是千问历史上第一次向社区开放「Max 级」旗舰权重——过去这类顶级模型通常只以云端 API 形式提供，如今任何人都能下载、修改、自行部署。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f001565&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f001565" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp" alt="千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署" class="wp-image-4671" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-768x415.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Qwen / 阿里巴巴（Hugging Face 模型页）</figcaption></figure>





<h2 class="wp-block-heading">2.4 万亿参数，每步只激活 950 亿</h2>



<p class="wp-block-paragraph">这组数字的命名已经写明了规格：「2.4T」代表模型总参数量达到 2.4 万亿；「A95B」代表每次前向计算只为单个词元激活 950 亿参数。实现这一点的，是混合专家（MoE）结构：模型共 92 层，每层拥有 512 个专家，每个词元只路由到其中 10 个路由专家加 1 个共享专家。底层采用 Qwen3.5 架构，并混合了门控 DeltaNet 与门控注意力机制。</p>



<p class="wp-block-paragraph">相比训练一个 2.4 万亿参数的稠密模型，MoE 让「模型很大、跑起来却只需算一小部分」成为可能，大幅压低了推理成本。原生上下文长度为 262144 个词元，最长可扩展至约 101 万词元，足以覆盖长文档与长周期智能体任务。</p>



<h2 class="wp-block-heading">和云端 Max 版不是一回事</h2>



<p class="wp-block-paragraph">需要区分的是，放权的开源版与早先上线的云端版 Qwen3.8-Max 并不完全相同。云端 Max 于 8 月初发布，额外支持视觉输入、可关闭的思考模式、默认 100 万词元上下文，以及官方内置工具；而开源版 Qwen3.8-2.4T-A95B 目前只有文本输入，且思考模式默认开启、无法关闭——模型在给出最终回答前会先生成推理过程，并通过 preserve_thinking 标记在多次对话间保留推理上下文，适合需要跨步骤保持「草稿」的智能体循环。</p>



<p class="wp-block-paragraph">在官方公布的基准中，同架构的云端版本 Qwen3.8-Max 在论文复现基准 PaperBench 取得 93.0 分、在计算机操作基准 OSWorld-Verified 取得 86.1 分、在参数化 CAD 基准取得 91.5 分，均居参评模型前列；不过在 TerminalBench 2.1（86.6）与 SWE-bench Pro（67.7）上仍略低于部分对手。整体定位被千问团队形容为「除 Fable 5 外最强的模型之一」。</p>



<h2 class="wp-block-heading">自己跑起来要多少硬件</h2>



<p class="wp-block-paragraph">开源权重意味着可以本地部署。官方支持通过 Hugging Face Transformers、SGLang、vLLM、TokenSpeed 等推理框架加载，正式部署时需使用各框架针对 Qwen3.8 的最新配方，并按权重精度与 GPU 数量选择并行策略。</p>



<p class="wp-block-paragraph">全精度权重体积可观，但开源社区已经给出了瘦身方案。Unsloth 团队用动态 1-bit 分层选择性量化技术，把原始约 4.9TB 的模型压到 397GB，存储空间缩减约 91%；借助其 Unsloth-Desktop 工具，只要设备的内存与显存合计达到 410GB 以上，就能在本地把模型跑起来。对没有数据中心的中小团队而言，这意味着前沿级能力第一次能以自托管的形式落在自己手里。</p>



<h2 class="wp-block-heading">许可证与价格</h2>



<p class="wp-block-paragraph">开放不等于完全自由。Qwen3.8-2.4T-A95B 采用千问自定义许可证，而非早先常见的 Apache 2.0：个人下载、修改、部署不受限，但大规模商业使用需要另行取得授权。配套发布的还有一颗约 270 亿参数的稠密伴随模型 Qwen3.8-27B，面向算力有限的场景，不过在开源权重放出时尚未同步上线。</p>



<p class="wp-block-paragraph">云端 Qwen3.8-Max 的国内 API 定价为每百万词元输入 12 元、输出 36 元，海外为每百万词元输入 2 美元、输出 6 美元。</p>



<h2 class="wp-block-heading">为什么这件事值得关注</h2>



<p class="wp-block-paragraph">把旗舰级权重交到社区手中，意义不只在「又大了一点」。过去一年，西方实验室谈开源时往往只放出 200 亿到 300 亿参数量级的中等模型，而阿里这次直接把自家最强旗舰摆上了桌面。无论动机如何，实际效果是：当前能完全自托管、可离线运行的最强模型之一，来自于中国的开源阵营，且差距明显。</p>



<p class="wp-block-paragraph">对开发者与研究者来说，这意味着不必再为前沿能力向专有 API 持续付费，也能在本地做微调、评测与私有化部署；对下游应用，则把竞争拉回了「在模型之上能做出什么」这一层。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hugging Face 模型页 / 千问团队（经 Hacker News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 开源 Instella-MoE：160 亿参数大模型</title>
		<link>https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 00:42:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Instella]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[开源大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[AMD 开源 Instella-MoE：160 亿参数大模型]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">AMD 于 7 月 24 日发布并开源了 Instella-MoE-16B-A3B，一个完全开放的混合专家（MoE）大语言模型。所谓&#8221;完全开放&#8221;，指的是从预训练到后训练每个阶段的权重、训练配置、数据混合比例、中间检查点乃至推理代码全部公开，模型权重与代码分别托管在 Hugging Face 与 GitHub（AMD-AGI/Instella-MoE）。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f001fa5&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f001fa5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1181" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp" alt="AMD 开源 Instella-MoE：160 亿参数大模型" class="wp-image-3353" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp 1181w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-300x171.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-1024x585.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-768x439.webp 768w" sizes="auto, (max-width: 1181px) 100vw, 1181px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AMD ROCm Blogs</figcaption></figure>





<p class="wp-block-paragraph">在架构上，这是一款 Decoder-only 的稀疏专家模型：总参数量 160 亿，但每处理一个 token 只激活 28 亿参数。它包含 27 个解码层、隐藏维度 2048，采用门控多头潜在注意力（Gated MLA）。专家层面设有 2 个共享专家与 64 个路由专家，每个 token 实际只激活其中 6 个路由专家，再加上 2 个共享专家——稀疏结构让它的计算开销更接近一个参数少得多的稠密模型。</p>



<p class="wp-block-paragraph">训练方面，Instella-MoE 在 AMD Instinct MI300X 与 MI325X 显卡、ROCm 软件栈上完成了 7.1T（万亿）tokens 的预训练，上下文窗口从初始的 4K 经 YaRN 位置编码扩展至 64K。后训练依次经历监督微调、DPO 偏好对齐与强化学习蒸馏，并推出了&#8221;Think&#8221;思考模型。</p>



<p class="wp-block-paragraph">基准表现上，基础模型在标准评测平均得分 76.7，为当时全开放模型最高；在 WinoGrande 拿到 86.5，HumanEval+ 为 65.7，64K 长上下文 RULER 平均 79.4。思考模型平均 73.22，其中 IFEval 83.70、AIME25 73.40、AGIEval 82.50。横向比较，其基础模型强于 SmolLM3-3B、OLMo-3-7B、OLMoE 等开放模型，略低于 Qwen3.5-4B-Base（79.5）；思考模型则高于 Olmo3-7B-Think、Gemma-4-E4B、Qwen3.5-4B 等开放权重模型。</p>



<p class="wp-block-paragraph">需要留意的是，Instella-MoE 采用 Research RAIL 许可证，仅限学术与研究用途，并非完全自由的商业授权。它的意义更多在于展示 AMD 的 ROCm 生态与开放模型路线——在英伟达几乎主导训练硬件的背景下，一个能完整复现训练全程的开放 MoE，对想要摆脱单一厂商绑定的研究团队颇具价值。</p>



<p class="wp-block-paragraph">来源：AMD ROCm Blogs《Instella-MoE》（Jiang Liu 等，2026-07-24）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍</title>
		<link>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 02 Aug 2026 07:54:13 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[AMD MI355X]]></category>
		<category><![CDATA[KimiK3]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<category><![CDATA[模型部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</guid>

					<description><![CDATA[Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国 AI 推理服务商 Wafer 公布了一组在 AMD MI355X 上部署月之暗面（Moonshot AI）开源旗舰大模型 Kimi K3 的实测数据。在综合性能上，单台 MI355X 节点的单流解码速度与每美元吞吐能力都明显超过英伟达 B200 节点，每美元吞吐甚至超过 B300。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f002846&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f002846" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp" alt="Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍" class="wp-image-3274" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-768x525.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">模型太大，主流显卡装不下</h2>



<p class="wp-block-paragraph">Kimi K3 于 7 月 16 日正式发布、7 月 27 日开放完整模型权重，是迄今全球参数规模最大的开源模型：总参数 2.8 万亿，采用混合专家（MoE）架构，每次推理实际激活约 1040 亿参数。专家总数为 896 个（另有 2 个共享专家），每次选择其中 16 个参与计算，上下文窗口为 100 万 token，原生支持视觉输入。模型基于月之暗面自研的 KDA（Kimi Delta Attention）混合线性注意力机制与注意力残差（AttnRes）技术构建。</p>



<p class="wp-block-paragraph">模型权重约 1.5TB，未分配 KV 缓存就已经超过 1.5TB 显存要求。即便是拥有 8 块 B200 的节点（每块 192GB）也无法装下完整的 K3 与百万级 token 的 KV 缓存。剩下的选择是：要么升级到显存更大的 B300（每块 288GB），要么把两个 B200 节点串起来用张量并行（TP16）跑。</p>



<p class="wp-block-paragraph">另一条路则是 AMD MI355X——单卡同样配备 288GB 显存，与 B300 一致，而每 GPU 的均价只有 B300 的约 1/2.4、B200 的约 1/1.7。硬件规格相近，价格便宜得多，听上去很美。瓶颈在软件：AMD 生态的算子优化普遍慢一拍，推理框架对新硬件的零日支持也常常慢人一步，这正是 Wafer 团队想要验证的地方。</p>



<h2 class="wp-block-heading">实测数据：便宜，而且更快</h2>



<p class="wp-block-paragraph">Wafer 在 8 块 MI355X 的节点（TP8）、两台 8 块 B200 的节点（TP16）、单台 8 块 B300 的节点（TP8+DCP8）三套配置上跑了同一组基准：1024 token 输入、400 token 输出。</p>



<p class="wp-block-paragraph">单流解码速度方面，MI355X 为 118 tok/s，B200 节点为 90 tok/s（这是 16 块 GPU 跨节点的总量，平摊到单机约为 249 tok/s 总量中更难直接拿来对比的单流表现），B300 节点为 172 tok/s。MI355X 的单流解码速度是 B200 节点的 1.3 倍以上，仅落后 B300 约 45%。</p>



<p class="wp-block-paragraph">峰值聚合吞吐方面，MI355X 节点为 952 tok/s，B200 节点为 498 tok/s（双节点 16 块 GPU 加起来的总量），B300 节点为 1568 tok/s。换算到每块 GPU：MI355X 为 119 tok/s，B200 约 31 tok/s，B300 为 196 tok/s——MI355X 是 B200 的 3.8 倍。</p>



<p class="wp-block-paragraph">按 B200 4.25 美元、B300 6 美元、MI355X 2.5 美元每 GPU 小时的价格计算，每美元每秒吞吐的对比如下：MI355X 为 48 tok/s，B300 为 33 tok/s，B200 仅 7 tok/s。MI355X 的每美元吞吐分别是 B300 的 1.45 倍、B200 的约 6.9 倍。</p>



<p class="wp-block-paragraph">需要为 B200 节点说句公道话：它的单流数据被跨节点 all-reduce 拖了后腿（用的是 RoCE v2 网络，约 195 Gb/s）——这是三套配置里唯一跨节点的方案，K3 的权重加 1M token 的 KV 缓存确实塞不进单台 8 块 192GB 显卡的服务器。但反过来也说明，K3 这种体量的模型正好让主打大显存的 MI355X 找到了一个对 B200 有实际意义的优势点。</p>



<h2 class="wp-block-heading">让 MI355X 跑起来的两个补丁</h2>



<p class="wp-block-paragraph">Kimi K3 开箱即可在 AMD 上跑起来，但要拿到上面的峰值数字，还需要两个补丁。</p>



<p class="wp-block-paragraph">第一个补丁在投机解码上。K3 没有内置任何草稿张量，既没有 MTP，也没有 EAGLE，唯一的投机路径是外部块扩散：RadixArk 出品的 Kimi-K3-DSpark。在 CUDA 上直接就能跑；在 ROCm 上，第一个真实请求就把调度器打挂了，错误是 `NameError: name &#8216;top_k_renorm_prob&#8217; is not defined`。原因是 sglang 的接受采样验证器有一条走 `torch.topk` 的稀疏路径，需要先调用 `top_k_renorm_prob` 函数；ROCm 构建里只挂了 Triton top-p 算子的别名，没把这个 top-k renorm 函数定义出来，于是请求一落到稀疏路径就立刻崩。</p>



<p class="wp-block-paragraph">修法只需要一段 PyTorch 函数：拿到概率向量，保留 top-k 项、把其他位置置零、再做一次缩放。sort、masked_fill、divide 三步搞定，加进 sglang 的 ROCm 采样分支，效果与 CUDA 路径上来自 `sgl_kernel` 的原生实现完全一致。这个小改动让单流性能提升约 2.2 倍，中等负载下单流提升约 1.7 倍，峰值聚合吞吐提升 18%。更重要的是，峰值吞吐对应的并发从 24 提到了 64。</p>



<p class="wp-block-paragraph">第二个补丁在 prefill 阶段。Wafer 团队提醒，业内谈模型性能时往往只盯着解码 tok/s，但用户真正感受到的是首 token 时延（TTFT），而 MI355X 在这里偏弱。同样的 172k token 冷启动 prefill，MI355X 需要约 51 秒，B300 只需约 23 秒。</p>



<p class="wp-block-paragraph">差距几乎全部来自一颗算子。K3 在 ROCm 上回退到了速度一般的 Triton 通用注意力实现，因为 AITER 的 MLA prefill 高速内核加载失败。表面看是缺内核，实际是 shape 不匹配：K3 在 TP8 下每个 rank 的注意力头数是 12，而 AITER 的 MLA 路径只支持 4、8 或 16 的倍数。修法是给头数从 12 零填充到 16，跑完高速内核后再从输出里取出实际的 12 个头。结果是，同样 172k 的冷启动 prefill，AITER MLA prefill 稳态速度约 13k tok/s，Triton 兜底只有 4k-7k tok/s，prefill 整体提速约 2 至 3 倍。</p>



<h2 class="wp-block-heading">这次没有写自定义内核</h2>



<p class="wp-block-paragraph">Wafer 的结论是：在 MI355X 上拿到最佳每美元吞吐基本是开箱即用，除了两个预期的框架级 bug，没有比 GLM5.2 时代更糟，甚至完全不需要写自定义内核。</p>



<p class="wp-block-paragraph">他们由此判断，SOTA（业界最优性能）在 AMD 上已经指日可待，CUDA 的护城河正在被蚕食。</p>



<p class="wp-block-paragraph">补充月之暗面官方公布的成绩：Kimi K3 在大模型编码评估系统 Frontend Code Arena 榜单上以 1679 分登顶，超过 Claude Fable 5 和 GPT-5.6 Sol 等闭源模型，是开源模型首次在该榜单夺冠；BrowseComp 测试得分 91.2%，高于 GPT-5.6 Sol 的 90.4% 和 Claude Fable 5 的 88.0%，单任务成本 2.03 美元，约为 GPT-5.6 Sol 的一半。API 官方定价为：缓存命中 2 元/百万 token、未命中输入 20 元/百万 token、输出 100 元/百万 token，Mooncake 分离式推理架构使编程场景的缓存命中率超过 90%。</p>



<p class="wp-block-paragraph">来源：Wafer Blog《Is memory the moat?》原文（2026 年 7 月）；月之暗面官方博客《Kimi K3: Open Frontier Intelligence》及官方模型卡。</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Kimi K3上线即爆火，国家超算平台紧急加推包月套餐</title>
		<link>https://mylogs.cn/kimi-k3%e4%b8%8a%e7%ba%bf%e5%8d%b3%e7%88%86%e7%81%ab%ef%bc%8c%e5%9b%bd%e5%ae%b6%e8%b6%85%e7%ae%97%e5%b9%b3%e5%8f%b0%e7%b4%a7%e6%80%a5%e5%8a%a0%e6%8e%a8%e5%8c%85%e6%9c%88%e5%a5%97%e9%a4%90/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 28 Jul 2026 08:01:36 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[API 调用]]></category>
		<category><![CDATA[Kimi K3]]></category>
		<category><![CDATA[国家超算互联网]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<category><![CDATA[算力平台]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3%e4%b8%8a%e7%ba%bf%e5%8d%b3%e7%88%86%e7%81%ab%ef%bc%8c%e5%9b%bd%e5%ae%b6%e8%b6%85%e7%ae%97%e5%b9%b3%e5%8f%b0%e7%b4%a7%e6%80%a5%e5%8a%a0%e6%8e%a8%e5%8c%85%e6%9c%88%e5%a5%97%e9%a4%90/</guid>

					<description><![CDATA[7月27日深夜，月之暗面正式开源 Kimi K3 模型。仅过了一晚，7月28日，国家超算互联网 AI 社区便宣 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">7月27日深夜，月之暗面正式开源 Kimi K3 模型。仅过了一晚，7月28日，国家超算互联网 AI 社区便宣布上线 Kimi K3 相关模型及 API 调用服务——企业和开发者既可以快速下载模型文件进行本地部署和二次开发，也可以通过 API 一键调用，直接使用这款 2.8 万亿参数开源大模型的能力。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f00395d&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f00395d" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="750" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/ad6a610183480eef7d681da462b4d7fe_header.webp" alt="Kimi K3上线即爆火，国家超算平台紧急加推包月套餐" class="wp-image-1902" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/ad6a610183480eef7d681da462b4d7fe_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/ad6a610183480eef7d681da462b4d7fe_header-300x188.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/ad6a610183480eef7d681da462b4d7fe_header-1024x640.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/ad6a610183480eef7d681da462b4d7fe_header-768x480.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Wikimedia Commons（CC BY-SA 4.0，Oleg Alexandrov 摄，超级计算机机架资料图）</figcaption></figure>





<p class="wp-block-paragraph">更能说明热度的是平台的临场反应。据《科创板日报》报道，Kimi K3 上线后，API 请求量远超超算互联网平台的预期。为了满足不同层次用户的需求，平台在原有按量计费的基础上，紧急推出了「Token Plan」包月订阅模式，采用精细化积分计费，并兼容主流终端与 AI 编程工具。一款开源模型逼得国家级算力平台连夜加推套餐，这样的场面并不多见。</p>



<h2 class="wp-block-heading">全球最大开源模型，全链条开放</h2>



<p class="wp-block-paragraph">Kimi K3 的分量确实够重。它采用混合专家（MoE）架构，总参数量达到 2.8 万亿，约为前代 K2.5 的 3 倍，是目前全球参数规模最大的开源大模型。本次开源采用修改版 MIT 许可证，覆盖模型权重、技术报告，以及支撑 K3 训练的三项底层基础设施技术：MoonEP、FlashKDA 和 AgentEnv。</p>



<p class="wp-block-paragraph">这三项技术是 K3 在算力受限条件下实现高效训练的核心支撑。按官方介绍，MoonEP 是专为超大规模细粒度 MoE 打造的高性能通信库；FlashKDA 是 Kimi Delta 注意力机制的高性能算子实现，在英伟达 H20 芯片上预填充速度较基线提升 1.72 至 2.22 倍；AgentEnv 则是联合 KVCache.ai 开发的智能体沙箱系统，支持环境快照、恢复与分叉，用于大规模多智能体并行训练。</p>



<p class="wp-block-paragraph">在架构层面，K3 结合 Stable LatentMoE 框架，可以在 896 个专家中高效激活 16 个，再加上训练方法和数据配方的优化，整体规模化训练效率相比 K2 提升约 2.5 倍。</p>



<h2 class="wp-block-heading">半小时登顶，产业链「零日适配」</h2>



<p class="wp-block-paragraph">开源消息放出后，全球开发者社区的反应相当激烈。Hugging Face 首席执行官 Clem Delangue 公开表示，Kimi K3 上线仅 30 分钟便收获超过 4000 个点赞，登顶平台趋势榜榜首，创下 Hugging Face 成立以来最快的发布增长纪录；上线前半小时，已有近 3700 名开发者在排队等待下载。</p>



<p class="wp-block-paragraph">产业链的跟进速度同样罕见。中国市场方面，华为昇腾 CANN 宣布昇腾 950 全系列、Atlas A3 产品完成 Kimi K3 部署适配；阿里云真武 M890 超节点实例实现首日适配，千问 AI 平台与阿里云百炼后续也将上线 Kimi K3 的 API。海外方面，Nebius、Baseten、Fireworks 等主流 AI 基础设施厂商均宣布首日完成适配，Nebius 更是评价 Kimi K3 为「首个达到前沿性能水平的开放权重模型」。</p>



<h2 class="wp-block-heading">国家级算力平台入场意味着什么</h2>



<p class="wp-block-paragraph">国家超算互联网此次的快速跟进，对开发者是实打实的利好。此前想跑通一个万亿级参数模型，要么自建昂贵的 GPU 集群，要么依赖海外云服务；现在通过国家级算力平台，下载、部署、API 调用一站式打通，新推出的包月订阅还让中小团队能以更可控的成本用上顶级开源模型。</p>



<p class="wp-block-paragraph">对月之暗面而言，这也是商业化提速的一环。该公司总裁张予彤此前披露，K3 发布后企业年度经常性收入（ARR）实现数倍增长，6 月中旬已突破 3 亿美元；其新一轮融资也已启动，投前估值涨至 315 亿美元。开源模型、国家算力、云厂商三方合流，Kimi K3 的这波热度，恐怕还要持续一段时间。</p>



<p class="wp-block-paragraph">来源：36氪《超算互联网AI社区上线Kimi K3相关模型及API调用服务》、科创板日报、每日经济新闻</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>2.8万亿参数Kimi K3开源，美国云平台连夜抢着接入</title>
		<link>https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0kimi-k3%e5%bc%80%e6%ba%90%ef%bc%8c%e7%be%8e%e5%9b%bd%e4%ba%91%e5%b9%b3%e5%8f%b0%e8%bf%9e%e5%a4%9c%e6%8a%a2%e7%9d%80%e6%8e%a5%e5%85%a5/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 28 Jul 2026 05:57:33 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 基础设施]]></category>
		<category><![CDATA[Kimi K3]]></category>
		<category><![CDATA[MoE 架构]]></category>
		<category><![CDATA[大模型出海]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<guid isPermaLink="false">https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0kimi-k3%e5%bc%80%e6%ba%90%ef%bc%8c%e7%be%8e%e5%9b%bd%e4%ba%91%e5%b9%b3%e5%8f%b0%e8%bf%9e%e5%a4%9c%e6%8a%a2%e7%9d%80%e6%8e%a5%e5%85%a5/</guid>

					<description><![CDATA[7月27日，月之暗面（Moonshot AI）正式开源旗舰大模型 Kimi K3 的完整权重，这是全球首个进入 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">7月27日，月之暗面（Moonshot AI）正式开源旗舰大模型 Kimi K3 的完整权重，这是全球首个进入「3万亿参数俱乐部」的开源模型。仅一天之后，美国通信云服务商 Telnyx 就宣布将 Kimi K3 上架自家推理平台 Telnyx Inference API——在此之前，Together AI 和 Modal 已经实现了「零日接入」。一款中国开源模型发布即被海外平台争相上架，这在以往并不多见。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a87f5f00475f&quot;}" data-wp-interactive="core/image" data-wp-key="6a87f5f00475f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="634" height="396" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/cde282369971c3273a5855021f5ead1a_header.webp" alt="2.8万亿参数Kimi K3开源，美国云平台连夜抢着接入" class="wp-image-1881" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/cde282369971c3273a5855021f5ead1a_header.webp 634w, https://mylogs.cn/wp-content/uploads/2026/07/cde282369971c3273a5855021f5ead1a_header-300x187.webp 300w" sizes="auto, (max-width: 634px) 100vw, 634px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Wikimedia Commons（公有领域，Kimi 聊天界面示例截图，软件版权归月之暗面所有）</figcaption></figure>





<h2 class="wp-block-heading">2.8万亿参数背后的技术账</h2>



<p class="wp-block-paragraph">Kimi K3 采用混合专家（MoE）架构，总参数量高达 2.8 万亿，内置 896 个路由专家，每个 token 仅激活其中 16 个。这意味着虽然参数规模惊人，但单次推理的实际计算量只是总参数的一小部分，兼顾了规模与效率。</p>



<p class="wp-block-paragraph">模型的另外几项核心规格同样抢眼：上下文窗口达到 100 万 token（精确值为 1,048,576），可以直接处理整个代码库或超长文档；原生支持视觉能力，文本、图片、视频输入共用同一个模型，无需外挂视觉适配器。</p>



<p class="wp-block-paragraph">支撑这些能力的是两项架构创新——Kimi Delta Attention（KDA）混合线性注意力和 Attention Residuals（注意力残差）。官方技术报告显示，与上一代 K2 相比，K3 的参数规模扩大约 3 倍，整体扩展效率反而提升了约 2.5 倍。</p>



<p class="wp-block-paragraph">除模型权重外，月之暗面还同步开源了三项训练基础设施：面向超大规模 MoE 的高性能通信库 MoonEP、KDA 高性能算子 FlashKDA（在英伟达 H20 上预填充速度较基线提升 1.72 至 2.22 倍），以及与 KVCache.ai 合作开发的智能体沙箱系统 AgentEnv。</p>



<h2 class="wp-block-heading">海外平台为何抢着上架</h2>



<p class="wp-block-paragraph">Telnyx 在发布说明中列出了接入 Kimi K3 的理由：可配置的推理强度（低、高、最大三档）、函数调用与 JSON 结构化输出、默认开启的提示词前缀缓存——这些都是构建智能体应用的关键能力。在 Telnyx 平台上，K3 与 Kimi K2.6、GLM-5.2-FP8、MiniMax M3 等模型并列可选。</p>



<p class="wp-block-paragraph">Telnyx 还给出了一个耐人寻味的判断：AI 行业的竞争优势，正在从「谁能造出最聪明的模型」转向「谁掌握决定每个请求跑在哪里的基础设施」，而 K3 的出现恰恰说明，模型侧的问题正在被开源力量解决。该公司认为，K3 在编程、推理和智能体任务的基准测试中已能与海外头部闭源模型正面竞争，「开源与前沿实验室的差距没有想象中大，某些场景甚至已经追平」。</p>



<h2 class="wp-block-heading">生态连锁反应已经出现</h2>



<p class="wp-block-paragraph">开源发布后，产业链反应迅速：阿里云千问平台宣布上线 K3；华为昇腾完成「零日适配」，这是首个在中国自研芯片上跑通的开放 3 万亿级模型。投行也给出了评价——摩根士丹利称，Kimi K3 证明中国大模型在规模、性能、定价三个层面实现了全方位追赶；高盛则认为，中国开源模型的智能水平已达到全球大规模普及的临界点。</p>



<p class="wp-block-paragraph">不过，「开源」不等于「人人可用」。2.8 万亿参数的体量意味着本地部署门槛极高，仅加载模型就需要至少 10 张 GB300 级别的 GPU。也正因如此，K3 上线后不久便因算力紧张暂停了新用户订阅——对绝大多数开发者而言，通过云平台调用 API 仍是现实的选择，这也解释了海外推理平台为何急于第一时间上架。</p>



<p class="wp-block-paragraph">来源：Telnyx 官方发布说明、Hacker News、Pandaily、腾讯新闻</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
