<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>大模型榜单 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%a6%9c%e5%8d%95/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 20 Sep 2026 03:28:40 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>9月14日大模型榜单：开源权重成新分水岭</title>
		<link>https://mylogs.cn/9%e6%9c%8814%e6%97%a5%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%a6%9c%e5%8d%95%ef%bc%9a%e5%bc%80%e6%ba%90%e6%9d%83%e9%87%8d%e6%88%90%e6%96%b0%e5%88%86%e6%b0%b4%e5%b2%ad/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 14 Sep 2026 20:00:03 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[LMArena]]></category>
		<category><![CDATA[SuperCLUE]]></category>
		<category><![CDATA[大模型榜单]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[开源权重]]></category>
		<category><![CDATA[智谱]]></category>
		<guid isPermaLink="false">https://mylogs.cn/9%e6%9c%8814%e6%97%a5%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%a6%9c%e5%8d%95%ef%bc%9a%e5%bc%80%e6%ba%90%e6%9d%83%e9%87%8d%e6%88%90%e6%96%b0%e5%88%86%e6%b0%b4%e5%b2%ad/</guid>

					<description><![CDATA[2026 年 9 月 14 日的国内大模型榜单日报给出一组耐人寻味的信号：海外头部这一周走的是&#8221;换 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">2026 年 9 月 14 日的国内大模型榜单日报给出一组耐人寻味的信号：海外头部这一周走的是&#8221;换架构、拼 Agent&#8221;路线，国产头部则走&#8221;不换基座、把后训练练透&#8221;路线；而把三张主流榜单叠在一起看，&#8221;开源权重&#8221;正在成为区分各家模型的新分水岭。中文场景与开源生态这两块，国产模型已经不用仰视谁，但在&#8221;让人愿意投票&#8221;和&#8221;端到端把活干完&#8221;两个更偏体验的维度上，海外头部仍领先半个到一个身位。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab24719b2043&quot;}" data-wp-interactive="core/image" data-wp-key="6ab24719b2043" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/b8065336b390d3d01d56f6409d8424a3_header.webp" alt="开源大模型排行榜概念图"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：AI 生成概念图</figcaption></figure>
<h2 class="wp-block-heading">两条不同的技术路线</h2>
<p class="wp-block-paragraph">海外头部本周的重心在架构与智能体。OpenAI 把 GPT-6 Astra 定位成能直接操作电脑的智能体，Anthropic 则靠 Claude Fable 5.1 在专业任务上继续拉开身位。国产头部则明确表态&#8221;架构没动&#8221;，提升全部来自强化学习与长程任务环境。智谱官方博客里有一句话很实在：模型能力的提升正在从&#8221;模型&#8221;转移到&#8221;环境&#8221;——难点不再是让模型更聪明，而是给它搭出足够接近真实工作的测试环境。</p>
<h2 class="wp-block-heading">开源权重：一条新分水岭</h2>
<p class="wp-block-paragraph">谁把权重真正放出来、以什么协议放出，正在成为区分模型开放程度的分水岭：</p>
<p class="wp-block-paragraph">&#8211; <strong>DeepSeek</strong> 的 V4.1-Flash 用 MIT 协议直接放出权重； &#8211; <strong>Meta</strong> 的 Muse Glimmer 采用 Apache-2.0 协议； &#8211; <strong>智谱</strong> 则选择延后两周、做完安全加固再开源。</p>
<p class="wp-block-paragraph">三家都开源，但节奏与顾虑完全不同。智谱的谨慎有出处：GLM-5.3 那 2436 个漏洞发现记录，让同一项能力交到谁手里、结果差得很远。这也说明，开源不再只是&#8221;放不放权重&#8221;的二元题，而是&#8221;以何种安全姿态放出&#8221;的工程与治理题。</p>
<h2 class="wp-block-heading">差距究竟在哪里</h2>
<p class="wp-block-paragraph">在中文场景与开源生态两块，国产模型已具备对等实力。SuperCLUE 中文榜前十被国产模型包揽，LMArena 与国际模型大致&#8221;五五开&#8221;即是证据。但在另两个维度上，海外头部仍然领先：</p>
<p class="wp-block-paragraph">&#8211; <strong>让人愿意投票</strong>：盲测偏好测的是&#8221;聊得舒不舒服&#8221;； &#8211; <strong>端到端把活干完</strong>：Agent 能力测的是&#8221;活干没干完&#8221;。</p>
<p class="wp-block-paragraph">GPT-6 Astra 的盲测反差、Anthropic 约 16 分的领先，都在说明这两套尺子量出来的东西并不相同。</p>
<h2 class="wp-block-heading">跨榜单的交叉观察</h2>
<p class="wp-block-paragraph">把单个模型在不同榜单上的名次摆在一起，能看出明显的&#8221;偏科&#8221;：</p>
<p class="wp-block-paragraph">&#8211; <strong>DeepSeek V4.1-Flash</strong>：在 SuperCLUE 上排国产第 2，中文能力没得说；到了 LMArena 公司榜却只排第 11（1450.77 分），连前 10 都没进。中文评测与国际盲测之间的落差，在它身上体现得最明显。 &#8211; <strong>OpenAI Astra</strong>：在自家评测体系里全面领先，LMArena 上却比 GPT-5.5 低 29 分——盲测与 Agent 能力是两套不同的尺子。 &#8211; <strong>智谱 GLM-5.3</strong>：LMArena 第 5、SuperCLUE 第 3，两张榜都稳，是这一周表现最均衡的国产模型。</p>
<p class="wp-block-paragraph">开源权重榜本身也印证了国产的站位。在 LMArena 开源模型榜单中，智谱 GLM-5.3 以约 1477.5 的 Arena 评分位居第一，月之暗面 Kimi K3 约 1471.9 居第二，GLM-5.3-Flash 约 1471.6 居第三，DeepSeek V4.1-Flash 约 1450.8 紧随其后——开源前五中，国产模型占据多席。</p>
<h2 class="wp-block-heading">对选型意味着什么</h2>
<p class="wp-block-paragraph">对关注大模型选型的中国用户而言，这组信号有两点实用价值：其一，若场景以中文、长文档、国产开源生态为主，国产模型在能力与成本上已可放心作为主力；其二，若场景强依赖&#8221;像人一样愿意聊&#8221;的盲测体验或&#8221;完整把长任务干完&#8221;的 Agent 能力，海外头部仍有一段身位优势，需按真实工作负载而非单一榜单分数做判断。</p>
<h2 class="wp-block-heading">结语</h2>
<p class="wp-block-paragraph">模型江湖瞬息万变。9 月这一周的榜单真正值得记下的，不是谁又涨了几分，而是竞争维度正在悄然切换：从&#8221;谁的基座更强&#8221;，转向&#8221;谁把后训练练得更透、谁把权重更负责任地开源&#8221;。开源权重，正在成为继参数规模之后，衡量一家模型公司的新分水岭。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
