<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Instella &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/instella/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 03 Aug 2026 00:42:19 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AMD 开源 Instella-MoE：160 亿参数大模型</title>
		<link>https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</link>
					<comments>https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 00:42:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Instella]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[开源大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[AMD 开源 Instella-MoE：160 亿参数大模型]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">AMD 于 7 月 24 日发布并开源了 Instella-MoE-16B-A3B，一个完全开放的混合专家（MoE）大语言模型。所谓&#8221;完全开放&#8221;，指的是从预训练到后训练每个阶段的权重、训练配置、数据混合比例、中间检查点乃至推理代码全部公开，模型权重与代码分别托管在 Hugging Face 与 GitHub（AMD-AGI/Instella-MoE）。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a6fed679a056&quot;}" data-wp-interactive="core/image" data-wp-key="6a6fed679a056" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1181" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp" alt="AMD 开源 Instella-MoE：160 亿参数大模型" class="wp-image-3353" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp 1181w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-300x171.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-1024x585.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-768x439.webp 768w" sizes="(max-width: 1181px) 100vw, 1181px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AMD ROCm Blogs</figcaption></figure>





<p class="wp-block-paragraph">在架构上，这是一款 Decoder-only 的稀疏专家模型：总参数量 160 亿，但每处理一个 token 只激活 28 亿参数。它包含 27 个解码层、隐藏维度 2048，采用门控多头潜在注意力（Gated MLA）。专家层面设有 2 个共享专家与 64 个路由专家，每个 token 实际只激活其中 6 个路由专家，再加上 2 个共享专家——稀疏结构让它的计算开销更接近一个参数少得多的稠密模型。</p>



<p class="wp-block-paragraph">训练方面，Instella-MoE 在 AMD Instinct MI300X 与 MI325X 显卡、ROCm 软件栈上完成了 7.1T（万亿）tokens 的预训练，上下文窗口从初始的 4K 经 YaRN 位置编码扩展至 64K。后训练依次经历监督微调、DPO 偏好对齐与强化学习蒸馏，并推出了&#8221;Think&#8221;思考模型。</p>



<p class="wp-block-paragraph">基准表现上，基础模型在标准评测平均得分 76.7，为当时全开放模型最高；在 WinoGrande 拿到 86.5，HumanEval+ 为 65.7，64K 长上下文 RULER 平均 79.4。思考模型平均 73.22，其中 IFEval 83.70、AIME25 73.40、AGIEval 82.50。横向比较，其基础模型强于 SmolLM3-3B、OLMo-3-7B、OLMoE 等开放模型，略低于 Qwen3.5-4B-Base（79.5）；思考模型则高于 Olmo3-7B-Think、Gemma-4-E4B、Qwen3.5-4B 等开放权重模型。</p>



<p class="wp-block-paragraph">需要留意的是，Instella-MoE 采用 Research RAIL 许可证，仅限学术与研究用途，并非完全自由的商业授权。它的意义更多在于展示 AMD 的 ROCm 生态与开放模型路线——在英伟达几乎主导训练硬件的背景下，一个能完整复现训练全程的开放 MoE，对想要摆脱单一厂商绑定的研究团队颇具价值。</p>



<p class="wp-block-paragraph">来源：AMD ROCm Blogs《Instella-MoE》（Jiang Liu 等，2026-07-24）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
