<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AMD &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/amd/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 23 Aug 2026 18:52:58 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>FSR 4 老显卡能用吗？第三方已跑通，官方仍沉默</title>
		<link>https://mylogs.cn/fsr-4-%e8%80%81%e6%98%be%e5%8d%a1%e8%83%bd%e7%94%a8%e5%90%97%ef%bc%9f%e7%ac%ac%e4%b8%89%e6%96%b9%e5%b7%b2%e8%b7%91%e9%80%9a%ef%bc%8c%e5%ae%98%e6%96%b9%e4%bb%8d%e6%b2%89%e9%bb%98/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 23 Aug 2026 18:52:58 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[FSR4]]></category>
		<category><![CDATA[RDNA]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[游戏硬件]]></category>
		<category><![CDATA[超分辨率]]></category>
		<guid isPermaLink="false">https://mylogs.cn/fsr-4-%e8%80%81%e6%98%be%e5%8d%a1%e8%83%bd%e7%94%a8%e5%90%97%ef%bc%9f%e7%ac%ac%e4%b8%89%e6%96%b9%e5%b7%b2%e8%b7%91%e9%80%9a%ef%bc%8c%e5%ae%98%e6%96%b9%e4%bb%8d%e6%b2%89%e9%bb%98/</guid>

					<description><![CDATA[官方只认新卡 AMD 的 FSR 4（FidelityFX Super Resolution 4）随 RDNA [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">官方只认新卡</h2>

<p class="wp-block-paragraph">AMD 的 FSR 4（FidelityFX Super Resolution 4）随 RDNA 4 架构的 RX 9000 系列显卡一同发布，至今已超过一年。按照官方口径，这项基于机器学习的超分辨率技术仅限最新架构使用，大量仍在使用 RDNA 2、RDNA 3 老显卡的用户始终没有等来官方支持。</p>

<h2 class="wp-block-heading">第三方已经跑通</h2>

<p class="wp-block-paragraph">但技术上的障碍似乎并不存在。据中文科技媒体梳理，FSR 4 针对 RDNA 2、RDNA 3 架构的 INT8 版本动态链接库（DLL）其实早已存在。第三方工具 Optiscaler 已经成功在 RX 6000、RX 7000 系列上启用 FSR 4，实测显示 FSR 4.0 的平衡模式在清晰度、抗鬼影与抗闪烁方面，甚至优于 FSR 3.1 的质量模式。FSR 4.1 也被玩家通过类似方式移植到 RDNA 3 显卡，效果与原生 RDNA 4 平台基本一致。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca961cde&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca961cde" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1216" height="832" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/bfa4b99d18bc21b6332f395e3063a7cc_header.webp" alt="AMD 显卡与游戏画面" class="wp-image-5354" srcset="https://mylogs.cn/wp-content/uploads/2026/08/bfa4b99d18bc21b6332f395e3063a7cc_header.webp 1216w, https://mylogs.cn/wp-content/uploads/2026/08/bfa4b99d18bc21b6332f395e3063a7cc_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/bfa4b99d18bc21b6332f395e3063a7cc_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/bfa4b99d18bc21b6332f395e3063a7cc_header-768x525.webp 768w" sizes="(max-width: 1216px) 100vw, 1216px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>示意图（AI 生成）</figcaption></figure>

<p class="wp-block-paragraph">另有外媒 GameGPU 报道，有开发者通过 INT8 处理，将 FSR 4 移植到了 RX 470 这类更老的显卡上，进一步印证了老架构运行新技术的可行性。</p>

<h2 class="wp-block-heading">团队流失或是主因</h2>

<p class="wp-block-paragraph">为什么 AMD 迟迟不开闸？前 FSR 开发负责人科林·莱利（Colin Riley）在社交媒体上的回应耐人寻味：他曾在 AMD 工作近九年，主导了 FSR 2、FSR 3 与 FSR 4 的开发，面对老用户追问，他只发了一张「说了怕有大麻烦」的表情包。</p>

<p class="wp-block-paragraph">莱利透露，曾参与 FSR 4 开发的 GPUOpen 与 FidelityFX 团队中，多名核心成员已离开 AMD，转投英伟达（NVIDIA）或英特尔（Intel）——光线再生（Ray Regeneration）技术的开发者去了英伟达，GPUOpen 项目创始总监去了英特尔。这或许解释了 FSR 4 推进缓慢的现状：目前仅有少数游戏原生集成了其核心功能，光线再生技术仅限于《使命召唤：黑色行动 7》与《红色沙漠》等少数大作；在超过 100 款支持 FSR 4 的游戏中，许多仍需通过 AMD 的 Adrenalin 驱动强制覆盖才能启用增强功能，且限 RDNA 4 架构。</p>

<h2 class="wp-block-heading">友商早已向下兼容</h2>

<p class="wp-block-paragraph">作为对比，英伟达虽然同样限制了多帧生成等新功能，但其最新的画质提升技术已向下兼容至 RTX 20 系列；英特尔虽起步较晚，但驱动支持持续改善，已获得开发者认可。而 FSR 4.1 的泄露文件中曾包含可让老架构启用 FSR 4 的 DLL，但 AMD 迅速删除了相关内容，至今未对老显卡开放官方支持。</p>

<p class="wp-block-paragraph">对持有老卡的玩家而言，第三方方案虽能解燃眉之急，却始终游走在灰色地带。FSR 4 的真正普及，恐怕还要等 AMD 自己松口。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Framework 回应 BIOS 更新致 Ryzen 7040 笔记本主板变砖</title>
		<link>https://mylogs.cn/framework-%e5%9b%9e%e5%ba%94-bios-%e6%9b%b4%e6%96%b0%e8%87%b4-ryzen-7040-%e7%ac%94%e8%ae%b0%e6%9c%ac%e4%b8%bb%e6%9d%bf%e5%8f%98%e7%a0%96-4392ee13/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 20 Aug 2026 19:00:12 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[BIOS]]></category>
		<category><![CDATA[Framework]]></category>
		<category><![CDATA[Ryzen]]></category>
		<guid isPermaLink="false">https://mylogs.cn/framework-%e5%9b%9e%e5%ba%94-bios-%e6%9b%b4%e6%96%b0%e8%87%b4-ryzen-7040-%e7%ac%94%e8%ae%b0%e6%9c%ac%e4%b8%bb%e6%9d%bf%e5%8f%98%e7%a0%96-4392ee13/</guid>

					<description><![CDATA[Framework 回应 BIOS 更新致 Ryzen 7040 笔记本主板变砖 近日，可维修笔记本先驱 Fr [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">Framework 回应 BIOS 更新致 Ryzen 7040 笔记本主板变砖</h2>



<p class="wp-block-paragraph">近日，可维修笔记本先驱 Framework 就其 Laptop 13 AMD 系列笔记本的 BIOS 更新问题作出回应。据报道，部分搭载 AMD Ryzen 7040 系列处理器的 Framework 笔记本在更新 BIOS 3.20 版本后出现了主板无法启动（即&quot;变砖&quot;）的问题。</p>



<h2 class="wp-block-heading">问题详情</h2>



<p class="wp-block-paragraph">根据用户反馈，受影响的机型为 Framework Laptop 13 AMD，该系列搭载 AMD Ryzen 7040 系列移动处理器（包括 Ryzen 7 7840U 等型号）。用户在通过 Framework 官方渠道推送 BIOS 更新至 3.20 版本后，设备出现了无法正常启动的情况。</p>



<p class="wp-block-paragraph">变砖是指设备在更新固件后完全无法进入操作系统，甚至无法通过常规方式重新刷写固件。对于笔记本电脑而言，主板 BIOS 损坏意味着整机将无法开机，通常需要返厂更换主板或借助外部编程器进行固件修复。</p>



<p class="wp-block-paragraph">Framework 在官方渠道确认了该问题的存在，并表示正在调查具体情况。针对已受影响的用户，Framework 表示将处理相关投诉并提供解决方案。</p>



<h2 class="wp-block-heading">模块化笔记本的特殊困境</h2>



<p class="wp-block-paragraph">Framework 近年来因&quot;模块化&quot;&quot;可维修&quot;的设计理念受到关注。与传统笔记本不同，Framework 笔记本的许多部件均可由用户自行更换和升级。然而，BIOS 作为主板上的核心固件，其更新失败对用户来说是一个相对棘手的问题。</p>



<p class="wp-block-paragraph">对于大多数传统笔记本品牌，BIOS 更新失败通常可以通过售后服务中心处理。而 Framework 的用户群体中有相当一部分具备自行维修的能力，但主板 BIOS 芯片的刷写仍需要一定的技术条件和专用设备。</p>



<h2 class="wp-block-heading">影响范围与用户建议</h2>



<p class="wp-block-paragraph">目前尚不清楚受影响的笔记本数量占总出货量的比例。Framework 方面尚未公布具体的受影响批次或序列号范围。</p>



<p class="wp-block-paragraph">对于使用 Framework Laptop 13 AMD（Ryzen 7040 系列）的用户，在官方修复方案明确之前，建议暂缓更新 BIOS 3.20 版本。如果设备运行稳定且无新硬件需求，继续停留在当前可用的 BIOS 版本是更为稳妥的选择。</p>



<p class="wp-block-paragraph">Framework 作为一家相对年轻的硬件公司，其在供应链管理和品控方面仍在积累经验。此次 BIOS 更新问题提醒用户，即使是主打&quot;高可维修性&quot;的设备，其核心固件的可靠性同样不容忽视。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>从英伟达换到 AMD，最让用户意外的不是性能是软件</title>
		<link>https://mylogs.cn/switch-nvidia-to-amd-software-adrenalin/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 05:02:54 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[PC 硬件]]></category>
		<category><![CDATA[RX 9070 XT]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[游戏]]></category>
		<category><![CDATA[英伟达]]></category>
		<category><![CDATA[驱动软件]]></category>
		<guid isPermaLink="false">https://mylogs.cn/switch-nvidia-to-amd-software-adrenalin/</guid>

					<description><![CDATA[资深硬件作者 Goran Damnjanovic 用了近十年英伟达显卡，直到 2025 年初把陪伴已久的 RT [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">资深硬件作者 Goran Damnjanovic 用了近十年英伟达显卡，直到 2025 年初把陪伴已久的 RTX 3070 换成了 RX 9070 XT。在他看来，这块 AMD 显卡的游戏性能本就出色，但换卡之后真正让他每天感到惊讶的，是驱动软件，而不是硬件。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca963374&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca963374" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/327822d2aa06426ca7e7fb3b1d18b5cc_header.webp" alt="从英伟达换到 AMD，最让用户意外的不是性能是软件" class="wp-image-4152" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/327822d2aa06426ca7e7fb3b1d18b5cc_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/327822d2aa06426ca7e7fb3b1d18b5cc_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/327822d2aa06426ca7e7fb3b1d18b5cc_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/327822d2aa06426ca7e7fb3b1d18b5cc_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<p class="wp-block-paragraph">在英伟达阵营的那些年里，他主要用「NVIDIA 控制面板」调整各项显卡设置。这款软件界面停留在 XP 时代，尽管带点怀旧滤镜，但英伟达早该更新了。英伟达其实在 2024 年初就放出了全新的 NVIDIA app 测试版，承诺逐步取代老控制面板，可直到他换卡前，仍有大量选项只存在于老面板里，用户不得不两个软件来回切。这一局面一直持续到 2026 年 5 月，英伟达才正式退役那款经典控制面板，把功能全部并到新 app。</p>



<p class="wp-block-paragraph">换成 RX 9070 XT 后，Damnjanovic 被 AMD Software：Adrenalin Edition 的好用程度震住了。它界面现代、选项丰富，比英伟达那款老态龙钟的控制面板领先了不止一个身位。需要调的设置触手可及，新驱动一发布软件就弹窗提醒，录屏也极其简单，逐游戏配置更是被放在了醒目位置，让用户能快速为每款游戏单独设定显卡参数。</p>



<p class="wp-block-paragraph">更让他满意的是，给 RX 9070 XT 做降压和超频完全不用第三方工具。在英伟达这边，像 Afterburner 这类软件长期是超频降压的标配；而 AMD 把这些能力直接做进了 Adrenalin，点开「性能」里的「调整」选项卡、启用自定义预设，几步就能完成，甚至还能按游戏分别设定——有些游戏能吃更高的降压值，有些则会立刻崩溃，逐游戏配置非常实用。AMD 软件还允许用户自定义显卡风扇曲线，这是英伟达 app 至今缺失的功能。</p>



<p class="wp-block-paragraph">当然，软件体验占优不代表 AMD 在功能上全面领先。多帧生成至今仍是 AMD 的空白，而英伟达和英特尔都已经提供了一段时间；作者尤其羡慕英伟达的 RTX HDR，配合 OLED 显示器效果出众。不过在他眼里，RX 9070 XT 依然是每款游戏里的猛兽，运行安静清凉，FSR 4 的观感已逼近 DLSS 4，配合 OptiScaler 还能在一切支持 DLSS 的游戏里开启。他用的这块是蓝宝石 NITRO+ 版本，16GB 显存，售价约 720 美元。</p>



<p class="wp-block-paragraph">对正在挑选显卡的用户来说，这或许是个提醒：除了跑分和光追，日常天天打交道的驱动软件，同样值得放进对比清单。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 把大模型刻进硅片：单芯片每秒吐出 1.7 万个词</title>
		<link>https://mylogs.cn/amd-acquires-taalas-etching-ai-models-into-silicon-inference-chip/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 07 Aug 2026 00:58:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Taalas]]></category>
		<category><![CDATA[半导体]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[推理加速]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-acquires-taalas-etching-ai-models-into-silicon-inference-chip/</guid>

					<description><![CDATA[一枚芯片出厂时，模型权重就已经被物理蚀刻在硅片里，改都改不了——听上去像是自断退路，但它跑 AI 推理的速度， [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一枚芯片出厂时，模型权重就已经被物理蚀刻在硅片里，改都改不了——听上去像是自断退路，但它跑 AI 推理的速度，是英伟达 GPU 的 48 倍。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca9643d1&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca9643d1" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="683" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/44ef2dca934c45073e0eab6332d4744c_header.webp" alt="AMD 把大模型刻进硅片：单芯片每秒吐出 1.7 万个词" class="wp-image-3898" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/44ef2dca934c45073e0eab6332d4744c_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/44ef2dca934c45073e0eab6332d4744c_header-300x171.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/44ef2dca934c45073e0eab6332d4744c_header-1024x583.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/44ef2dca934c45073e0eab6332d4744c_header-768x437.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Register</figcaption></figure>





<p class="wp-block-paragraph">8 月 6 日美股收盘后，AMD 宣布已与加拿大 AI 芯片初创公司 Taalas 签署最终收购协议。交易金额未披露，需通过监管审批，预计在第四季度完成交割。据 The Register 了解，这是一笔实打实的收购，而非只挖团队的「人才收购」。</p>



<h2 class="wp-block-heading">不用显存，把权重直接烧进硅片</h2>



<p class="wp-block-paragraph">Taalas 成立于 2023 年，总部位于加拿大多伦多，累计融资约 2.19 亿美元。它的技术路线与主流方案完全不同：无论是常规 GPU，还是 Groq、Cerebras 那类数据流架构加速器，模型权重都存放在高带宽内存里，芯片运行时反复读取——数据在内存与计算单元之间来回搬运，带来功耗、延迟和封装成本。</p>



<p class="wp-block-paragraph">Taalas 的做法是把权重直接蚀刻进硅片。从结构上看，它的芯片由两个区域构成：存放模型权重的掩模只读存储区，以及承载键值缓存和微调适配器的静态随机存储区。这类芯片本质上是「模型专用集成电路」，一颗芯片只服务一个模型。</p>



<p class="wp-block-paragraph">这套方案并非停留在纸面。今年 2 月，Taalas 发布了首款测试芯片 HC1，采用台积电 6 纳米工艺制造。初步基准测试中，它运行 Meta 的 Llama 3.1 8B 模型达到每秒 16960 个词元——按当时的对比口径，这一速度是英伟达 GPU 的 48 倍、Cerebras 加速器的 8.5 倍。Llama 3.1 以今天的标准看已属老模型（2024 年年中发布），这枚光罩尺寸的芯片主要目的是验证概念可行。</p>



<p class="wp-block-paragraph">第二代 HC2 芯片计划于今年夏季推出，单芯片参数量目标提升至 200 亿。这个数字听起来不大，但与 GPU 一样，权重可以通过流水线并行分散到多颗芯片上。按每颗 200 亿参数计算，支撑一个万亿参数模型只需 50 颗加速器——而 AMD 恰好拥有机架级计算平台和自研系统设计团队。作为对照，英伟达近期发布的 LPX 系统跑同等规模模型，需要数十颗 GPU 外加至少 2000 颗 Groq 加速卡。</p>



<h2 class="wp-block-heading">AMD 的算盘：GPU 处理提示词，专用芯片吐词元</h2>



<p class="wp-block-paragraph">据了解，AMD 打算把基于 Instinct 的 Helios 机架与 Taalas 技术芯片配对，构成一套解耦架构：计算密集的提示词处理交给 GPU，词元生成任务卸载到 Taalas 加速器。另一种可能的模式是形成「验证—迁移」的迭代节奏，客户先在 Instinct 加速器上部署调试模型，确认效果后再迁移到 Taalas 芯片。</p>



<p class="wp-block-paragraph">AMD 人工智能高级副总裁 Vamsi Boppana 在声明中表示：「AMD 正在构建全栈 AI 平台，让客户能够为每一种 AI 工作负载灵活选择合适的计算方案。」</p>



<p class="wp-block-paragraph">这笔交易的背景，是行业竞争焦点正从训练转向推理。过去几年芯片厂商比拼的是谁能连接更多 GPU、提供更大显存和更高集群带宽；随着模型进入实际业务，推理变成了持续发生、反复计费的负载，客户开始追问每个词元的成本、响应延迟和数据中心功耗。这笔收购距离英伟达与 Groq 达成 200 亿美元交易仅隔约七个月，也印证了推理芯片已成新战场。</p>



<p class="wp-block-paragraph">AMD 近年在这条线上动作密集：2024 年以 6.65 亿美元收购模型开发商 Silo AI、以 49 亿美元收购服务器厂商 ZT Systems 为 Helios 机柜奠基，此后又拿下推理软件公司 MK1；今年 6 月收购内存优化公司 MEXT，7 月与 Cerebras 达成合作。财务上也支撑得起：AMD 第二季度营收 115 亿美元、同比增长 50%，其中数据中心业务 67 亿美元、同比增长 107%，占总营收的 58%。</p>



<h2 class="wp-block-heading">代价：芯片一旦流片，就跟这个模型绑死了</h2>



<p class="wp-block-paragraph">速度虽快，代价也很直白——芯片部署后就被锁死在那个模型上。任何超出 LoRA 适配器级别的改动，都需要重新流片，既贵又耗时。生成式 AI 热潮进入第四年，新模型几乎按月迭代，要享受这项技术红利，客户必须对自己的模型选择有十足把握。</p>



<p class="wp-block-paragraph">不过据 Taalas 说法，情况没那么糟：换新模型虽需重新流片，但不必从零开始，只需改动两层金属，成本和周期都低得多。今年 2 月该公司曾对科技媒体 The Next Platform 表示，把模型权重蚀刻进硅片的开销，比训练一个前沿模型低 100 倍。</p>



<p class="wp-block-paragraph">The Register 判断，这项技术的主要用户会集中在模型开发商、其基础设施供应商，以及少数推理服务商。AMD 在这方面有谈判优势：OpenAI、Anthropic 和 Meta 都是 Instinct 的重要客户，未来看到某个 GPT 或 Claude 跑在 Taalas 与 Instinct 的混合方案上，并不令人意外。</p>



<p class="wp-block-paragraph">这项技术还可能反向影响模型开发。开发者压制幻觉的手段之一叫「测试时扩展」，做法很简单——让模型在回答前多「想」一会儿。缺点是消耗大量词元，既费钱又让用户等更久。如果 Taalas 能把单位词元成本压下来、把输出速度提升 10 倍到 20 倍，模型开发者或许会选择把推理时间拉得更长。</p>



<p class="wp-block-paragraph">AMD 首席执行官苏姿丰此前多次表示，AI 芯片市场不存在「一种芯片通吃所有应用」的情况：GPU 凭通用性仍会占据大部分份额，因为它能支撑不断演进的新模型；但不同场景也需要更专业化的加速器共同构成完整生态。Taalas 补上的，正是最靠近专用计算的那一端。</p>



<p class="has-small-font-size wp-block-paragraph">来源：The Register</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 买下一家怪公司：把模型刻死在芯片里</title>
		<link>https://mylogs.cn/amd-acquires-taalas-ai-model-silicon-etching-inference-chip/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 20:46:33 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Taalas]]></category>
		<category><![CDATA[半导体]]></category>
		<category><![CDATA[推理加速]]></category>
		<category><![CDATA[硬件]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-acquires-taalas-ai-model-silicon-etching-inference-chip/</guid>

					<description><![CDATA[你见过把 AI 模型直接&#8221;焊死&#8221;在芯片上的做法吗？8 月 6 日，AMD 宣布收购多伦 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你见过把 AI 模型直接&#8221;焊死&#8221;在芯片上的做法吗？8 月 6 日，AMD 宣布收购多伦多初创公司 Taalas，这家公司专攻一种极端的 AI 推理方案——不靠通用 GPU，而是把模型权重直接蚀刻到硅片上。测试数据显示，其首代芯片运行 Llama 3.1 8B 模型的速度达到每秒 16,960 个 Token，是同期英伟达 GPU 的 48 倍。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca965209&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca965209" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="683" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7bdcb705_header.webp" alt="AMD 买下一家怪公司：把模型刻死在芯片里" class="wp-image-3875" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7bdcb705_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7bdcb705_header-300x171.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7bdcb705_header-1024x583.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7bdcb705_header-768x437.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Register</figcaption></figure>





<p class="wp-block-paragraph">Taalas 的技术路线在业内被称为&#8221;模型专用集成电路&#8221;（MSIC）。传统 GPU 靠高带宽内存（HBM）存储模型权重，每次推理都要从内存反复读取；Taalas 则把权重直接烧进芯片的掩模只读存储（Mask-ROM）区域，省掉了绝大部分数据搬运开销。其芯片由两个核心区域组成：掩模 ROM 存储固定权重，高速 SRAM 存储 KV 缓存和微调适配器。</p>



<p class="wp-block-paragraph">说白了，这是用灵活性换极致性能的赌注。一旦芯片出厂，上面跑的模型就锁死了——想换模型就得重新流片（重新设计光罩）。不过 Taalas 称，更换模型时只需修改两层金属布线，成本和时间远低于从头设计新芯片。</p>



<p class="wp-block-paragraph">这笔交易发生在英伟达以 200 亿美元收购 Groq 仅仅七个月之后。两家公司的思路有相似之处——都瞄准低延迟、高吞吐量的&#8221;高级推理&#8221;市场，也就是 AI 智能体、代码助手这类对首字延迟极其敏感的应用场景。但 Groq 走的是数据流架构路线，而 Taalas 走的是更激进的&#8221;模型固化&#8221;路线。</p>



<p class="wp-block-paragraph">AMD 方面没有披露交易金额。Taalas 自 2023 年成立以来累计融资 2.19 亿美元，创始团队来自 AMD 和 Tenstorrent 的前员工。AMD 计划将 Taalas 技术整合进 Instinct GPU 产品线，采用解耦架构：复杂的前端提示处理交给 GPU，高频 Token 生成交给 Taalas 加速器。</p>



<p class="wp-block-paragraph">这意味着什么？如果 Taalas 的技术能在量产中兑现承诺，AI 推理的成本结构可能被重写——不是比拼谁买了更多 GPU 卡，而是比谁能把最常用的模型&#8221;固化&#8221;下来、以最低成本持续输出 Token。对正在评估推理基础设施的企业来说，值得密切关注这条技术路线的后续进展。</p>



<p class="has-small-font-size wp-block-paragraph">来源：The Register / AMD 官方新闻稿 / 网易科技</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>这 4 颗 AMD 处理器该换了：再打游戏就是亏钱</title>
		<link>https://mylogs.cn/4-old-amd-cpus-stop-gaming-2026/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 14:23:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[CPU]]></category>
		<category><![CDATA[How-To Geek]]></category>
		<category><![CDATA[游戏硬件]]></category>
		<category><![CDATA[装机]]></category>
		<category><![CDATA[锐龙]]></category>
		<guid isPermaLink="false">https://mylogs.cn/4-old-amd-cpus-stop-gaming-2026/</guid>

					<description><![CDATA[AMD 在处理器市场已经强势多年，锐龙（Ryzen）系列几乎在每个价位段的游戏性能测试中都占据优势。目前的 A [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">AMD 在处理器市场已经强势多年，锐龙（Ryzen）系列几乎在每个价位段的游戏性能测试中都占据优势。目前的 AM5 平台乃至部分 AM4 平台芯片依然是不错的选择，但更早期的几款产品就完全是另一回事了。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca966229&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca966229" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1.webp" alt="这 4 颗 AMD 处理器该换了：再打游戏就是亏钱" class="wp-image-3838" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<p class="wp-block-paragraph">科技媒体 How-To Geek 的作者 Ismar Hrnjicevic 盘点了 4 颗曾经风光、如今已不建议继续用来打游戏的 AMD 处理器。它们发布时都是相当亮眼的游戏芯片，但现代游戏的负载越来越重，这些芯片的年龄开始成为硬伤——继续用下去，省下的升级费可能还不够填别的坑。</p>



<h2 class="wp-block-heading">AMD FX-9590：5GHz 的梦，如今是场噩梦</h2>



<p class="wp-block-paragraph">FX-9590 发布于 2013 年，出现在这份名单上并不意外，但仅用&#8221;年代久远&#8221;来解释并不完整。</p>



<p class="wp-block-paragraph">2013 年到 2017 年之间，AMD 手里并没有一款能对抗英特尔（Intel）酷睿 i7 逐代更新的旗舰桌面处理器。除去 APU 产品线，AM3+ 平台就是全部家当，因此在第一代锐龙问世之前，FX-9590 是 AMD 消费级最强的处理器。</p>



<p class="wp-block-paragraph">它确实够猛：这是第一颗出厂即可把加速频率推到 5.0GHz 的消费级桌面处理器，远高于当时热门的 FX-8350 的 4.2GHz。对一颗 8 核芯片来说，这是相当可观的成绩。不过所谓 8 核大体只是名义上的——推土机（Bulldozer）及后续的打桩机（Piledriver）架构采用 4 个模块、每模块 2 个整数单元的设计，实际表现更接近传统四核。这套颇具误导性的宣传后来还引发了一场以 AMD 败诉告终的集体诉讼。</p>



<p class="wp-block-paragraph">如今这颗芯片的年龄暴露无遗。同时期 AMD 的每周期指令数（IPC）明显落后于英特尔，导致 FX 系列在游戏中表现平平，而游戏越复杂，情况越糟。</p>



<p class="wp-block-paragraph">真正致命的是功耗。为了达到那个听起来很唬人的 5GHz，这颗芯片的热设计功耗高达 220W。除了必须配一套强力散热器，它的耗电量几乎相当于一块显卡，换来的却是并不出色的游戏体验。作者的判断是，换一颗更新、更省电的芯片，几个月内省下的电费就足以覆盖差价，在 2026 年把它塞进游戏主机毫无道理。</p>



<p class="wp-block-paragraph">有意思的是，FX-9590 反倒成了收藏品，eBay 上不少卖家的开价超过 100 美元。</p>



<h2 class="wp-block-heading">AMD 锐龙 5 1600：救活 AMD 的性价比之王，风光已过</h2>



<p class="wp-block-paragraph">初代锐龙对 AMD 的意义再怎么强调都不为过，它不仅彻底改变了这家公司，也搅动了整个处理器市场和游戏行业。</p>



<p class="wp-block-paragraph">锐龙 5 1600 及略快的 1600X 尤其值得一提：这是主流消费级处理器第一次以如此亲民的价格提供 6 核 12 线程。尽管单线程性能稍弱、在游戏中会输掉几个百分点，但它们让当时只有 4 核、且缺少超线程的英特尔酷睿 i5 产品线显得相当过时。如果既要有像样的游戏性能，又想兼顾直播、多任务和生产力，锐龙 5 1600 基本就够了。</p>



<p class="wp-block-paragraph">6 核 12 线程的设计后来老得相当体面。开放世界游戏和其他吃处理器的大作逐渐普及，反而让它多撑了好几年。但初代 Zen 架构终究到了尽头：偏低的 IPC、老旧的架构，加上不受 Windows 11 官方支持，这颗芯片的游戏黄金期已经结束。</p>



<p class="wp-block-paragraph">好消息是，很多 AM4 主板刷新 BIOS 后可以支持更新、更强的锐龙处理器，升级路径清晰。</p>



<h2 class="wp-block-heading">AMD 锐龙 3 3200G：名字像 Zen 2，骨子里不是</h2>



<p class="wp-block-paragraph">2019 年 AMD 推出 Zen 2 架构的锐龙 3000 系列，迅速成为玩家的新标准。这批芯片采用台积电当时最新的 7nm 工艺，而英特尔因为 10nm 工艺一再延期，还困在 14nm 上。简单说，Zen 2 尤其是极受欢迎的锐龙 5 3600，让 AMD 真正在处理器市场站稳了脚跟。</p>



<p class="wp-block-paragraph">锐龙 3 3200G 却不在此列。尽管它与 Zen 2 芯片同期发布、挂着 3000 系列的名号，内里却是 2018 年的 Zen+ 架构——也就是锐龙 2000 系列的底子。作者直言这是一个值得商榷的营销决定：消费者看到&#8221;3000&#8243;和代表核显的&#8221;G&#8221;，很容易以为这是一颗全新的 Zen 2 核显芯片，可以拿来装办公机顺便轻度游戏，实际上它不过是换了标的锐龙 3 2200G。</p>



<p class="wp-block-paragraph">它当年就算不上出色，如今更是糟糕。4 核 4 线程是原因之一，但不是全部：这颗芯片只有 4MB 三级缓存（锐龙 3 3300X 是 16MB），严重拖累 1% 最低帧，容易出现明显卡顿；此外它只提供 8 条 PCIe 3.0 通道给独立显卡，搭配显卡时必须格外小心，否则会形成严重瓶颈。</p>



<p class="wp-block-paragraph">当初买它的人图的是 Radeon Vega 8 核显，发布时确实能应付一些轻度游戏。但在二手市场上 Zen 2、Zen 3 芯片遍地都是的今天，把它装进游戏主机基本没有价值。</p>



<h2 class="wp-block-heading">AMD 锐龙 3 3300X：曾经的预算之王，后继无人是有原因的</h2>



<p class="wp-block-paragraph">锐龙 3 3300X 比前面那颗 3200G 强出一大截。它以 120 美元的价格上市，迅速成为预算有限玩家的爆款。全新的 Zen 2 架构带来大幅性能提升，而 2020 年的很多游戏还无法充分利用 6 核或 8 核，4 核 8 线程的锐龙 3 3300X 因此显得非常合理：省下的钱可以加到显卡上换更高帧率，而处理器瓶颈很少成为问题。</p>



<p class="wp-block-paragraph">它火到 AMD 一度供不应求，很快就难以按建议零售价买到，这也是不少人最终转向锐龙 5 3600 的原因之一。</p>



<p class="wp-block-paragraph">问题在于，2020 年的优点到 2026 年变成了缺点。四核设计在当年帮助压低了售价，如今却远不如同期的锐龙 5、锐龙 7 耐用。目前的情况是，在一些高负载游戏中，连 6 核处理器都开始相对 8 核型号显出吃力，AMD 也早已把桌面产品重心从锐龙 3 转向锐龙 5。</p>



<p class="wp-block-paragraph">锐龙 3 3300X 在它的时代是一颗优秀的预算游戏芯片，但四核架构终究拖了后腿，现在再为它花钱已不值得。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>这四颗AMD老U，别再拿来打游戏了</title>
		<link>https://mylogs.cn/%e8%bf%99%e5%9b%9b%e9%a2%97amd%e8%80%81u%ef%bc%8c%e5%88%ab%e5%86%8d%e6%8b%bf%e6%9d%a5%e6%89%93%e6%b8%b8%e6%88%8f%e4%ba%86/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 14:18:44 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[二手硬件]]></category>
		<category><![CDATA[处理器]]></category>
		<category><![CDATA[游戏]]></category>
		<category><![CDATA[装机]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%bf%99%e5%9b%9b%e9%a2%97amd%e8%80%81u%ef%bc%8c%e5%88%ab%e5%86%8d%e6%8b%bf%e6%9d%a5%e6%89%93%e6%b8%b8%e6%88%8f%e4%ba%86/</guid>

					<description><![CDATA[你在二手区淘平台机，看到&#8221;八核 5.0GHz&#8221;这种参数很难不动心。How-To Gee [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你在二手区淘平台机，看到&#8221;八核 5.0GHz&#8221;这种参数很难不动心。How-To Geek 撰稿人 Ismar Hrnjicevic 点名了四颗还在流通、但已经不适合再拿来玩游戏的 AMD 处理器，理由都不是&#8221;老&#8221;这么简单。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca9672a2&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca9672a2" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header.webp" alt="这四颗AMD老U，别再拿来打游戏了" class="wp-image-3827" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2cebab03971a79f51d34bb15a765eb1f_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<p class="wp-block-paragraph"><strong>FX-9590</strong>。2013 年的 AM3+ 平台，推土机架构，标称八核实际是四模块八整数单元，性能更接近传统四核，当年因为&#8221;八核&#8221;宣传吃过集体诉讼。加速频率 5.0GHz 听着唬人，但每周期性能太低，配上 220W 的功耗设计，电费比性能更有存在感。</p>



<p class="wp-block-paragraph"><strong>锐龙 5 1600 / 1600X</strong>。初代 Zen，6 核 12 线程的规格今天看仍不算寒酸，问题是架构太早、单线程偏弱，而且没有官方 Win11 支持——想升级系统就得绕路。</p>



<p class="wp-block-paragraph"><strong>锐龙 3 3200G</strong>。名字带 3000，实际是 Zen+ 架构，本质就是 2200G 换个壳。4 核 4 线程、三级缓存只有 4MB（同代的 3300X 有 16MB），留给独显的 PCIe 3.0 通道只剩 8 条。Vega 8 核显当年勉强能应付轻量游戏，现在 1% 最低帧惨不忍睹。</p>



<p class="wp-block-paragraph"><strong>锐龙 3 3300X</strong>。Zen 2 架构、4 核 8 线程，2020 年 120 美元的定位很讨喜，但面对吃多核的新游戏已经吃力，AMD 自己也早就放弃了桌面端锐龙 3 产品线。</p>



<p class="wp-block-paragraph">我的判断是，这四颗的共同问题是缓存和线程数被现代游戏卡住了脖子，换不换取决于主板还剩多少余地：不少 AM4 主板刷个 BIOS 就能直接上锐龙 5 5600 或 3600，成本远低于整套换新；要是打算一步到位，AM5 平台的锐龙 7 7700 这类型号仍是稳妥选择。</p>



<p class="wp-block-paragraph">来源：How-To Geek</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek 塞进一张 AMD 卡，官方要四张</title>
		<link>https://mylogs.cn/deepseek-v4-flash-single-amd-mi300x/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 18:10:51 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[MI300X]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型部署]]></category>
		<category><![CDATA[本地推理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-flash-single-amd-mi300x/</guid>

					<description><![CDATA[你要是想在自己的机器上跑一套完整的 DeepSeek V4 Flash，官方给的部署方案会让你先准备一台四卡英 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是想在自己的机器上跑一套完整的 DeepSeek V4 Flash，官方给的部署方案会让你先准备一台四卡英伟达节点。现在有人把这件事压到了一张 AMD 卡上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca968161&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca968161" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header.webp" alt="DeepSeek 塞进一张 AMD 卡，官方要四张" class="wp-image-3560" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / ryanzhou 项目页</figcaption></figure>





<p class="wp-block-paragraph">这份配置最近登上 Hacker News，作者 Ryan Zhou 把整套东西开源在 GitHub 上：一张 AMD MI300X 显卡，直接跑官方发布的 deepseek-ai/DeepSeek-V4-Flash-0731 权重，不做额外量化，也不做分层卸载，模型以出厂状态运行。仓库里包含 Docker Compose 部署栈、锁定哈希值的文件覆盖层、对照上游的差异补丁和调优参数表。</p>



<h2 class="wp-block-heading">能塞下的原因是显存，不是算力</h2>



<p class="wp-block-paragraph">DeepSeek V4 Flash 是一个混合专家（MoE，指模型内部分成很多&#8221;专家&#8221;子网络，每个词只激活其中一小部分）架构的模型，基础设计 2840 亿参数、每个词激活 130 亿。0731 这一版额外附带了推测解码草稿模块，模型卡上标注的参数量因此是 3040 亿。它以 FP4 加 FP8 的混合精度发布——专家权重用四位、注意力和路由用八位——整个检查点在硬盘上约 149 GiB。</p>



<p class="wp-block-paragraph">这个数字正是关键。它装不进 H100 的 80GB，也装不进 H200 的 141GB，所以官方推荐方案要么四张 H200，要么一整块 GB200 NVL4 托盘。而 MI300X 有 192GB 显存和 5.3 TB/s 带宽，容量是 H100 SXM5 的 2.4 倍，刚好装得下。</p>



<p class="wp-block-paragraph">实际加载后，权重占 156.67 GiB，旁边还能放下 20GB 的键值缓存，另有 96 GiB 溢出到内存层，所以主机需要约 235 GiB 系统内存。显存峰值是 205.8GB 里的 204.5GB——余量不到一个 GB，非常紧。</p>



<h2 class="wp-block-heading">性能数据</h2>



<p class="wp-block-paragraph">作者给出的实测结果如下：单条流解码中位数 168.6 词元/秒；调优后的预填充速度约 7.9 到 8.5K 词元/秒；八条并发流合计 542 词元/秒，每条中位 90.3；六十四条流突发时合计 830 词元/秒，没有显存溢出，也没有引擎报错；上下文验证到 256K，架构本身支持 100 万。</p>



<p class="wp-block-paragraph">这些数字不是白来的。调优 21 个反复出现的矩阵乘形状，让单双流解码提升了 42% 到 62%，八到六十四流场景提升 10% 到 35%。融合 SiLU 激活加快速路由之后，原生解码从 34.5 提到 56.6 词元/秒，路由内核每层耗时从 42.6 微秒降到 11.9 微秒。还有一处很实用的调度改动：把调度预算设成 2048 词元、长预填充上限设成 1024 词元后，排在一个 5.2 万词元冷提示后面的短请求，首字延迟从 8.2 秒降到 0.5 秒。</p>



<h2 class="wp-block-heading">代价是九个补丁</h2>



<p class="wp-block-paragraph">真正值得注意的是这套东西为什么需要九个补丁覆盖层。</p>



<p class="wp-block-paragraph">一处是精度格式。MI300X 用的是 AMD 与 Graphcore 的 fnuz 变体八位浮点，而 MI325X 以及更新的卡用的是行业标准格式。一个假定标准格式的内核跑在 MI300X 上，缩放值可能直接差两倍。另一处更隐蔽：专家路由的位矩阵内核在填充块列时，掩码比对的是全局张量边界而不是逻辑块大小，高并发下填充通道会污染路由矩阵，表现出来是长提示下工具名字对不上、模式被遗忘——而这恰好是这个模型主打的智能体场景。修复只有一行。</p>



<p class="wp-block-paragraph">软件侧的落差同样明显。vLLM 在 v0.21.0 的发布说明里声称支持 DeepSeek V4 的 ROCm 版本，但官方镜像在 AMD 硬件上启动就崩，报错指向一个只有英伟达 Hopper 架构才有的特性，与此同时官方配方仓库把所有 AMD 型号标为不支持。到 vLLM 0.25，官方配方验证了 MI325X，但只在张量并行度 1、4K 上下文下。MI300X——这张在 AMD 自家开发者云上 1.99 美元一小时就能租到的卡——至今不在官方支持矩阵里。</p>



<h2 class="wp-block-heading">我的判断</h2>



<p class="wp-block-paragraph">AMD 那笔硬件账其实早就算得过来了：内存受限的混合专家推理场景，单卡显存容量才是硬约束，而 AMD 卖的就是更大的容量，MI325X 到了 256GB，MI355X 是 288GB。真正拖后腿的是硬件之下的那一层。</p>



<p class="wp-block-paragraph">一个人花九个补丁、一套自建调优表填上的这段路，本该由芯片厂商自己走完。对准备用 AMD 卡做推理的团队来说，这份仓库是难得的参考；但它同时也是一份并不好看的进度报告。</p>



<p class="wp-block-paragraph">你所在的团队评估过 AMD 卡做推理吗，卡在了哪一步？</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub / ryanzhou 项目页，Hacker News</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>MiniMax H3 开源：音视频一锅端，2K 15 秒</title>
		<link>https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 04:54:46 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI视频]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[MiniMax]]></category>
		<category><![CDATA[国产AI]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[视频生成]]></category>
		<guid isPermaLink="false">https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/</guid>

					<description><![CDATA[MiniMax H3 开源：音视频一锅端，2K 15 秒]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你听过的AI视频生成工具，多数还卡在&#8221;文生视频&#8221;或&#8221;图生视频&#8221;两件事之间来回切换。2026年8月3日，MiniMax把H3正式开源，把文本、图像、视频、音频当成同一件事一起处理。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca968c52&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca968c52" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="427" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header.webp" alt="MiniMax H3 开源：音视频一锅端，2K 15 秒" class="wp-image-3400" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-300x107.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-1024x364.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-768x273.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MiniMax Research</figcaption></figure>





<p class="wp-block-paragraph">H3是个通用多模态生成模型，输出15秒、2K分辨率（短边约1440像素）、24帧每秒的视频，画面与原生立体声音频在同一次生成中同步产出。同一段提示词里可以塞进至多9张图、3段视频、3段音频。比如&#8221;参考视频1的希区柯克运镜，让图片2里的角色按音频3开口唱歌&#8221;，H3会自己理顺上下文的关系。</p>



<p class="wp-block-paragraph">核心架构由四部分撑起来：Contextual Omni Representation把上百K token的原始素材压缩到约4K token，让语言成为跨模态的通用桥梁；H3-VAE把序列有效长度扩展4倍，配合原生2K输出；H3-Omni Transformer把理解与生成的算力分离，训练吞吐约提高30%；In-Context Regeneration让2K输出由模型自身在上下文内重画，不用外挂超分模块，小字、品牌标识都能保住。</p>



<p class="wp-block-paragraph">生成任务分三档：纯文本驱动的t2va、首尾帧关键帧驱动的fl2va，以及参考素材驱动的ref2va——后者能绑定主体图像与参考音色，做口型同步与语音克隆。</p>



<p class="wp-block-paragraph">价格上，2K同档每秒单价不到主流闭源模型的三分之一，768p每秒不到主流模型720p的一半。硬件适配是同步推进的：AMD用SGLang在MI355X和MI300X上跑出Day 0支持，8卡序列并行；摩尔线程同日在国产AI训推卡MTT S5000上完成适配。开源采用MiniMax Community License，权重将在未来几天放出。</p>



<p class="wp-block-paragraph">说白了，H3的看点不是又一个&#8221;文生视频&#8221;，而是把图像生成、参考控制、编辑拉到同一个框架里。OpenAI Sora 2、字节Seedance 2.5与谷歌Gemini Omni Flash分占不同赛道，H3在编辑与可控参考上领先，但纯文生视频和图生视频环节未必都第一。</p>



<p class="wp-block-paragraph">我的判断是，2026年下半年AI视频工具的PK标准会从&#8221;几秒高清&#8221;改成&#8221;多模态可控+开源可改+多硬件可跑&#8221;。H3把三条都点上了。想试的话，盯紧开源权重放出的那一天。</p>



<p class="wp-block-paragraph">来源：MiniMax Research 官方博客、AMD Developer Blog、36氪</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 开源 Instella-MoE：160 亿参数大模型</title>
		<link>https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 00:42:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Instella]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[开源大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e5%bc%80%e6%ba%90-instella-moe%ef%bc%9a160-%e4%ba%bf%e5%8f%82%e6%95%b0%e5%a4%a7%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[AMD 开源 Instella-MoE：160 亿参数大模型]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">AMD 于 7 月 24 日发布并开源了 Instella-MoE-16B-A3B，一个完全开放的混合专家（MoE）大语言模型。所谓&#8221;完全开放&#8221;，指的是从预训练到后训练每个阶段的权重、训练配置、数据混合比例、中间检查点乃至推理代码全部公开，模型权重与代码分别托管在 Hugging Face 与 GitHub（AMD-AGI/Instella-MoE）。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca96946f&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca96946f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1181" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp" alt="AMD 开源 Instella-MoE：160 亿参数大模型" class="wp-image-3353" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header.webp 1181w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-300x171.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-1024x585.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2c316e3584bbedfdf038f9eef8640ef6_header-768x439.webp 768w" sizes="auto, (max-width: 1181px) 100vw, 1181px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AMD ROCm Blogs</figcaption></figure>





<p class="wp-block-paragraph">在架构上，这是一款 Decoder-only 的稀疏专家模型：总参数量 160 亿，但每处理一个 token 只激活 28 亿参数。它包含 27 个解码层、隐藏维度 2048，采用门控多头潜在注意力（Gated MLA）。专家层面设有 2 个共享专家与 64 个路由专家，每个 token 实际只激活其中 6 个路由专家，再加上 2 个共享专家——稀疏结构让它的计算开销更接近一个参数少得多的稠密模型。</p>



<p class="wp-block-paragraph">训练方面，Instella-MoE 在 AMD Instinct MI300X 与 MI325X 显卡、ROCm 软件栈上完成了 7.1T（万亿）tokens 的预训练，上下文窗口从初始的 4K 经 YaRN 位置编码扩展至 64K。后训练依次经历监督微调、DPO 偏好对齐与强化学习蒸馏，并推出了&#8221;Think&#8221;思考模型。</p>



<p class="wp-block-paragraph">基准表现上，基础模型在标准评测平均得分 76.7，为当时全开放模型最高；在 WinoGrande 拿到 86.5，HumanEval+ 为 65.7，64K 长上下文 RULER 平均 79.4。思考模型平均 73.22，其中 IFEval 83.70、AIME25 73.40、AGIEval 82.50。横向比较，其基础模型强于 SmolLM3-3B、OLMo-3-7B、OLMoE 等开放模型，略低于 Qwen3.5-4B-Base（79.5）；思考模型则高于 Olmo3-7B-Think、Gemma-4-E4B、Qwen3.5-4B 等开放权重模型。</p>



<p class="wp-block-paragraph">需要留意的是，Instella-MoE 采用 Research RAIL 许可证，仅限学术与研究用途，并非完全自由的商业授权。它的意义更多在于展示 AMD 的 ROCm 生态与开放模型路线——在英伟达几乎主导训练硬件的背景下，一个能完整复现训练全程的开放 MoE，对想要摆脱单一厂商绑定的研究团队颇具价值。</p>



<p class="wp-block-paragraph">来源：AMD ROCm Blogs《Instella-MoE》（Jiang Liu 等，2026-07-24）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
