<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>大模型 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%A4%A7%E6%A8%A1%E5%9E%8B/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 06:28:20 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>二手书商疑 AI 公司扫货，旧书被买去喂模型</title>
		<link>https://mylogs.cn/secondhand-booksellers-ai-bulk-orders/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[二手书]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[数据获取]]></category>
		<category><![CDATA[训练数据]]></category>
		<guid isPermaLink="false">https://mylogs.cn/secondhand-booksellers-ai-bulk-orders/</guid>

					<description><![CDATA[英国与爱尔兰的二手书商正涌向一波来历不明的成批订单：买家要的书五花八门、毫无主题规律，却肯出高价、不求折扣。不 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">英国与爱尔兰的二手书商正涌向一波来历不明的成批订单：买家要的书五花八门、毫无主题规律，却肯出高价、不求折扣。不少书商怀疑，幕后买家是人工智能公司——它们把实体旧书买去扫描，当作训练大语言模型的新数据。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b918967&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b918967" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/b6d60e3fe30ed13481f00f93a9c1ec62_header.webp" alt="二手书商疑 AI 公司扫货，旧书被买去喂模型" class="wp-image-5063" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/b6d60e3fe30ed13481f00f93a9c1ec62_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/b6d60e3fe30ed13481f00f93a9c1ec62_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/b6d60e3fe30ed13481f00f93a9c1ec62_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/b6d60e3fe30ed13481f00f93a9c1ec62_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Guardian</figcaption></figure>





<h2 class="wp-block-heading">「这组合实在太怪」</h2>



<p class="wp-block-paragraph">英格兰诺森伯兰郡 Barter Books 的合伙老板 Stuart Manley 说，订单大约从三个月前开始出现，反常之处在于它们不像普通订单那样按主题归类。一笔近期订单里同时出现了爱沙尼亚语译本的《使命之歌》、某个特定版本的女作家安妮·勃朗特作品《艾格妮丝·格雷》，以及 1983 年 10 月的《战舰》月刊。他说自己已经向三名买家卖出「成百上千」本随机书籍，总额约合 4000 英镑。</p>



<p class="wp-block-paragraph">爱尔兰克莱尔郡的 MW Books 老板 Jim Shaughnessy 也表示，自 5 月以来店里不断收到量大且杂乱的订单，「推测是由机器驱动，几乎没有主题逻辑」。英国巴斯 BookLovers 的老板 David Gower-Spence 则在 5 到 7 月间收到约 200 本书的集中订单。有书商发现，不同买家下的随机订单竟被送到同一个地址——伦敦希思罗机场附近的一组货运仓库。</p>



<h2 class="wp-block-heading">一本书为何值得被「买断」</h2>



<p class="wp-block-paragraph">这股订单潮让人联想到大模型的「数据饥渴」。今年《华盛顿邮报》披露，开发 Claude 聊天机器人的头部 AI 公司 Anthropic 曾花费数千万美元收购书籍、裁掉书脊以便扫描内容，随后送去回收。Anthropic 回应称，其训练数据来自公开网络、商业采购数据集与自产数据，采购书籍是行业通行做法，且从未购买或销毁珍稀古籍。</p>



<p class="wp-block-paragraph">技术媒体 404 Media 上月报道，一个图书数据库曾向书商暗示「世界上最好的 AI 训练数据就摆在书架上」，并称 2022 年以前出版的书籍是理想材料，因为它们的文本尚未被聊天机器人生成的内容「污染」。对 AI 公司而言，那些早于 ChatGPT 走红、又未上网的二手书，恰好是难得的干净语料。在书商论坛里，有人感慨这些书「注定要进 AI 训练，封面被撕掉，最终化作纸浆」。澳大利亚书商近期也报告了类似的异常订单。</p>



<p class="has-small-font-size wp-block-paragraph">来源：The Guardian</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>千问下载量破 30 亿，谷歌与 Meta 被甩在身后</title>
		<link>https://mylogs.cn/qwen-3-billion-downloads-overtakes-google-meta/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 21:56:18 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 生态]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen-3-billion-downloads-overtakes-google-meta/</guid>

					<description><![CDATA[阿里巴巴集团的开源权重模型在过去六个月里累计全球下载量超过 30 亿次，超越 Meta、Alphabet 以及 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里巴巴集团的开源权重模型在过去六个月里累计全球下载量超过 30 亿次，超越 Meta、Alphabet 以及本土同行，成为下载量最高的人工智能模型家族。这组数字来自彭博社 8 月 15 日的报道，以及开源模型平台 Hugging Face 8 月 14 日发布的《开源模型现状》报告。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b919582&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b919582" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header.webp" alt="千问下载量破 30 亿，谷歌与 Meta 被甩在身后" class="wp-image-5019" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Bloomberg</figcaption></figure>





<h2 class="wp-block-heading">30 亿次是个什么量级</h2>



<p class="wp-block-paragraph">作为对比，Hugging Face 的报告显示，2026 年 Alphabet 旗下谷歌的开源模型下载量为 4.18 亿次，Meta 为 2.27 亿次。千问在半年内积累的数字是两者之和的四倍以上。</p>



<p class="wp-block-paragraph">阿里巴巴在一份电子邮件声明中表示，千问系列已开源超过 460 个模型，围绕它形成的生态已衍生出 30 万个以上的衍生模型。Hugging Face 在报告中称，这一下载规模让千问成为「开源 AI 生态系统中规模最大的基础之一」。</p>



<p class="wp-block-paragraph">这两个数字指向的是两件不同的事。下载量说明有多少开发者和机构把模型取回本地运行或改造；衍生模型数量则说明有多少人真的动手做了微调与适配——后者往往更能反映一个模型家族被使用的深度。</p>



<h2 class="wp-block-heading">下载量为什么值得单独看</h2>



<p class="wp-block-paragraph">开源权重模型可以被下载、定制，并作为构建新 AI 产品的基础模块。正因如此，采用情况成了衡量开发者选择在哪套技术上做开发的直接指标，而不只是营销口径上的热度。</p>



<p class="wp-block-paragraph">一个足够宽的模型家族容易形成自我强化的循环：更多开发者采用基础模型，就会产出更多衍生版本，衍生版本又把新用户带进来。460 个开源模型意味着不同参数规模、不同能力取向的版本可以覆盖差异极大的落地场景，从桌面端本地推理到企业级部署都能找到合适的起点，这本身就降低了迁移成本。</p>



<p class="wp-block-paragraph">Hugging Face 的报告给出的判断更直接：对于正在决定微调和部署哪些模型的开发者而言，千问「已经成为默认工作流程的一部分」。</p>



<h2 class="wp-block-heading">云平台成了另一条分发通路</h2>



<p class="wp-block-paragraph">阿里巴巴强化这一循环的方式之一，是通过自家云平台把千问分发给企业客户，覆盖的市场包括东南亚和非洲。这条通路让千问获得了许多竞争对手不具备的触达范围——企业客户往往不会主动去模型托管平台上翻找权重文件，但会在云服务的模型清单里直接选用。</p>



<p class="wp-block-paragraph">在开源模型这条赛道上，千问目前领先的不只是海外厂商。彭博社的报道提到，它在下载量上同时超过了 DeepSeek、月之暗面的 Kimi 与 MiniMax 等中国同行。这几家厂商都在以相对低廉且易于适配的模型复刻前沿性能，力图缩小与 OpenAI、Anthropic 等闭源模型之间的差距，而千问的下载数据表明，这套路线在中国市场之外同样获得了认可。</p>



<h2 class="wp-block-heading">美国厂商正在回应</h2>



<p class="wp-block-paragraph">开发者市场的争夺随之升温。彭博社指出，近几周 Meta 与英伟达相继发布了新的开源 AI 模型。对使用者来说，这轮竞争的直接结果是可选的高质量开源模型变多、迭代变快，而衡量优劣的标准也在从跑分转向更实际的问题：有多少人愿意在它上面继续搭东西。</p>



<p class="has-small-font-size wp-block-paragraph">来源：彭博社 / Hugging Face《开源模型现状》报告</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>大模型价格战开打：中间档降价八成，顶级款按住不动</title>
		<link>https://mylogs.cn/llm-price-war-middle-tier-cut-80-percent/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 19:46:43 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 成本]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[价格战]]></category>
		<category><![CDATA[大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/llm-price-war-middle-tier-cut-80-percent/</guid>

					<description><![CDATA[美国头部 AI 实验室正在集体下调模型价格。降价的直接原因不是成本突然降下来了，而是对价格敏感的客户开始转投更 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国头部 AI 实验室正在集体下调模型价格。降价的直接原因不是成本突然降下来了，而是对价格敏感的客户开始转投更便宜的替代方案，其中不少来自中国厂商。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91a4d7&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91a4d7" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/30442beeaf4c72d615fb0ee1caa70956_header.webp" alt="大模型价格战开打：中间档降价八成，顶级款按住不动" class="wp-image-5010" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/30442beeaf4c72d615fb0ee1caa70956_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/30442beeaf4c72d615fb0ee1caa70956_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/30442beeaf4c72d615fb0ee1caa70956_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/30442beeaf4c72d615fb0ee1caa70956_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AI 生成配图</figcaption></figure>





<p class="wp-block-paragraph">具体动作已经落到价目表上。OpenAI 近期宣布把 GPT-5.6 Luna（其自称「最快、最实惠的模型」）的价格下调 80%：每百万输入 token 从 1 美元降到 0.20 美元，每百万输出 token 从 6 美元降到 1.20 美元。Anthropic 推出 Claude Opus 5，宣传口径是以 Fable 5（该公司能力最强的模型）「一半的价格」提供「前沿级智能」，Opus 5 定价为每百万输入 token 5 美元、每百万输出 token 25 美元。同一周，Anthropic 还取消了原定 9 月对 Sonnet 5 生效的涨价。</p>



<p class="wp-block-paragraph">按 Silicon Data 的 token 价格指数，自 7 月中旬以来，客户为美国头部实验室模型实际支付的价格已经下降近四分之一。token 是语言模型处理数据的计量单位，也是多数客户账单的计价依据。</p>



<h2 class="wp-block-heading">是什么把价格压了下来</h2>



<p class="wp-block-paragraph">这轮降价对美国的闭源模型厂商来说是个转向。此前它们主要在性能维度上竞争，而不是价格。变化来自中国实验室持续推出的开源模型——这些模型可以被开发者自由下载和调整，能力也在不断提升，直接对价格构成压力。报道点名了月之暗面（Moonshot）与深度求索（DeepSeek），称其已经在从硅谷到欧洲的用户中打开局面。</p>



<p class="wp-block-paragraph">企业端的成本压力同时在放大。Anthropic 和 OpenAI 正把部分企业客户从固定订阅转向按用量计费，客户按实际消耗的算力付费。账单上涨之后，一些企业的应对方式是给 AI 用量设上限，或者直接测试更便宜的替代品。DoorDash 与 Airbnb 都表示已开始使用中国厂商的模型来控制支出。</p>



<h2 class="wp-block-heading">标价便宜，不等于最终花得少</h2>



<p class="wp-block-paragraph">单看每百万 token 的标价，无法直接比较模型贵贱。能力更强的模型有时用更少的 token、更少的尝试次数就能完成同一个任务，于是标价更高的模型反而总成本更低。多数模型还能在不同的「effort」（算力投入档位）下运行，这既影响表现，也影响完成任务的最终花费。</p>



<p class="wp-block-paragraph">第三方评测机构 Artificial Analysis 在数学、科学、编程和推理等方向做了横向对比，两组结果颇能说明问题：</p>



<ul class="wp-block-list"><li>Anthropic 的 Opus 5 在 medium 档位下，性能与每任务成本都接近月之暗面 Kimi K3 的 max 档位；</li><li>OpenAI 的 GPT-5.6 Luna 在 max 档位下，表现与深度求索 V4 Flash 的 max 档位相当，但每完成一个任务的成本接近后者的两倍。</li></ul>



<h2 class="wp-block-heading">砍中间，守顶端</h2>



<p class="wp-block-paragraph">值得注意的是，这轮降价集中在中端产品，正是与中国模型正面竞争的价格带，最顶级的那一档并没有跟着降。长期使用大语言模型的网站托管商 Hostinger，其 AI 技术负责人 Mantas Lukauskas 观察到，最好的模型价格「持平到上涨」。他给出的判断是：</p>



<blockquote class="wp-block-quote is-layout-flow wp-block-quote-is-layout-flow">
<p class="wp-block-paragraph">美国实验室砍掉了中间，守住了顶端。</p>
</blockquote>



<p class="wp-block-paragraph">对这轮调价，OpenAI 与 Anthropic 均拒绝置评。一位接近 Anthropic 的人士称，Opus 5 定价低于旗舰 Fable 5，是这家公司「模型家族本来的构建方式，与竞争对手无关」。</p>



<p class="wp-block-paragraph">这些动作还有另一层背景：OpenAI 与 Anthropic 都在筹划以万亿美元估值上市，而投资者正在寻找证据，证明这个行业的巨额投入能够换来回报。降价能不能同时守住收入和客户，短期内会是两家都要回答的问题。对使用方来说，更实际的结论是：中间档模型的调用成本正在快速下滑，而顶级模型的价格暂时看不到松动。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Ars Technica / Jamie John</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>苹果联手阿里，专为中国训练专属大模型</title>
		<link>https://mylogs.cn/apple-alibaba-china-ai-model/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 08:34:56 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI手机]]></category>
		<category><![CDATA[Apple Intelligence]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[苹果]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/apple-alibaba-china-ai-model/</guid>

					<description><![CDATA[苹果联手阿里，专为中国训练专属大模型 据路透社 8 月 14 日报道，三位知情人士透露，苹果公司已经专门为中国 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">苹果联手阿里，专为中国训练专属大模型</h2>



<p class="wp-block-paragraph">据路透社 8 月 14 日报道，三位知情人士透露，苹果公司已经专门为中国市场训练了一款大语言模型。这一模型由苹果与阿里巴巴集团合作开发，并在阿里巴巴的支持下完成训练。这是苹果首次披露为中国市场单独训练自有模型的计划，也标志着其在华人工智能策略的一次重大转向。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91b14e&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91b14e" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cd96ff9aa60a8c2be2e86863049c2b4d_header.webp" alt="苹果联手阿里，专为中国训练专属大模型" class="wp-image-4814" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cd96ff9aa60a8c2be2e86863049c2b4d_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cd96ff9aa60a8c2be2e86863049c2b4d_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cd96ff9aa60a8c2be2e86863049c2b4d_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cd96ff9aa60a8c2be2e86863049c2b4d_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：示意图（Unsplash）</figcaption></figure>





<h2 class="wp-block-heading">从「借力第三方」到「自研加合作」</h2>



<p class="wp-block-paragraph">此前，由于 Anthropic 的 Claude、OpenAI 的 ChatGPT 等美国模型无法在中国大陆使用，苹果主要依赖本土合作伙伴的模型来驱动设备端的生成式人工智能功能。此次调整意味着苹果不再把模型能力完全交给合作伙伴，而是在阿里巴巴的支持下训练了一套属于自己的模型。</p>



<p class="wp-block-paragraph">知情人士表示，在 iOS 系统完成后续更新后，苹果的 AI 工具套件「Apple Intelligence（苹果智能）」预计将在未来几个月内正式登陆中国市场。届时，阿里巴巴的通义千问（Qwen）模型将被整合进在中国发售的兼容 iPhone、iPad、Mac 以及 Vision Pro 等设备的「Apple Intelligence」中，百度等技术也会融入其中。</p>



<h2 class="wp-block-heading">监管破冰与「双轨制」策略</h2>



<p class="wp-block-paragraph">这一进展建立在漫长的监管审批基础之上。今年 7 月 15 日，中国国家互联网信息办公室正式备案了「Apple 智能」等 7 款手机端侧生成式人工智能服务，为「Apple Intelligence」首次登陆中国版 iPhone 扫清了道路。按照报道的说法，这套专为中国训练的模型，可能使苹果成为首家获得中国政府批准、在华提供自有专有 AI 模型的外国公司。</p>



<p class="wp-block-paragraph">这种「自研模型加本土合作伙伴」的双轨方案，被视为外国企业在中国推进人工智能的一种独特路径，既有助于应对复杂的监管障碍，也能在一定程度上缓解数据安全与合规层面的顾虑。上周，苹果曾发布一份中文指南，说明中国大陆的 Mac 用户如何将通义千问连接到 Siri 与书写工具功能，随后在未作解释的情况下删除了该指南。</p>



<h2 class="wp-block-heading">华为等本土对手的压力</h2>



<p class="wp-block-paragraph">苹果此举也反映出其在中国这一最重要的海外市场中面临的竞争压力。华为等中国本土厂商已在 AI 手机领域抢占先机，陆续推出内置 AI 功能的机型。报道指出，缺少「Apple Intelligence」被认为影响了苹果在中国市场的竞争力。通过训练专为中国市场定制的大模型，苹果希望让「Apple Intelligence」在中国不只是海外版本的简单移植，而是建立一套独立搭建、更贴合中文语境与本地用户习惯的技术体系。</p>



<p class="wp-block-paragraph">受 7 月获批备案消息影响，阿里巴巴在美上市股票盘前一度上涨约 4%。截至目前，苹果与阿里巴巴均未对这一报道作出正式回应，最终的产品形态与技术细节仍有待官方确认。</p>



<p class="has-small-font-size wp-block-paragraph">来源：路透社（经 cnBeta、IT之家等转述）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>智谱 GLM-5.3 发布：编程最强开源模型</title>
		<link>https://mylogs.cn/zhipu-glm-5-3-strongest-open-source-coding/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 06:20:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[GLM]]></category>
		<category><![CDATA[代码生成]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智谱]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/zhipu-glm-5-3-strongest-open-source-coding/</guid>

					<description><![CDATA[基座不变，后训练把编程上限抬了上去 8 月 14 日，智谱发布新一代旗舰模型 GLM-5.3。与上一个版本 G [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">基座不变，后训练把编程上限抬了上去</h2>



<p class="wp-block-paragraph">8 月 14 日，智谱发布新一代旗舰模型 GLM-5.3。与上一个版本 GLM-5.2 相比，新模型的基座并没有更换，全部提升来自后训练阶段的强化学习——智谱称其为「后训练 Scaling」：依托 IndexShare、SAO 以及新一代 Slime 框架，在完全相同的基座上把训练时长、任务环境种类与长程任务规模都做了大幅扩展。用官方的话说，这个基座的智能上界还远未被开发完。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91bc10&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91bc10" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header.webp" alt="智谱 GLM-5.3 发布：编程最强开源模型" class="wp-image-4799" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-768x768.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI 生成配图（示意）</figcaption></figure>





<p class="wp-block-paragraph">在内部体感评测中，GLM-5.3 的编程能力较前代提升约 50%，在多项公开基准上登顶开源模型第一。智谱将其定位为「为编程而生，为网络防御就绪」，并称其编程与智能体能力已接近 Claude Fable 5，编程体感超过其他国产模型。</p>



<h2 class="wp-block-heading">基准分数：编程与安全双双跃升</h2>



<p class="wp-block-paragraph">具体来看，在衡量真实终端环境复杂任务完成的 Terminal-Bench 3.0 上，GLM-5.3 得分从 4.6 提升到 28.3；在长程软件工程与持续代码修改的 DeepSWE v1.1 上，从 46.2 提升到 66.9；在跨工具协作与长程任务的 Agents Last Exam 上，从 23.8 提升到 28.5；在覆盖 44 种职业真实知识工作的 GDPval-AA v2 中得分 1769，呈现出基于编程能力涌现出的专业任务执行力。</p>



<p class="wp-block-paragraph">网络安全是这一版最突出的新增方向。在白盒代码审查与漏洞发现任务中，GLM-5.3 的表现与闭源标杆 Mythos 5 持平；在漏洞验证基准 CyberGym 中取得 84.5% 的成绩，高于 GLM-5.2 的 77.2%，也略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。在 Z.ai Code Bench 高档位端到端测试中，其准确率达到 31.4%，超过 Claude Opus 4.8 最高档位的 29.5%。</p>



<h2 class="wp-block-heading">两周后开源，工具链同日上线</h2>



<p class="wp-block-paragraph">智谱表示，GLM-5.3 的全部提升都来自后训练，因此模型权重将在发布约两周后开放，前提是完成必要的安全评估与加固，以限制其潜在的攻击能力、保留防御价值。这是智谱（Z.ai）十三个月内发布的第七款旗舰模型。</p>



<p class="wp-block-paragraph">与模型同步，智谱官方编程工具 ZCode、效率工具 AutoClaw 已于发布当日上线，GLM Coding Plan 面向全量用户开放订阅；Trae、扣子、WorkBuddy/CodeBuddy、Qoder、CatPaw、JoyCode、OpenCode 等多家编码平台也获得抢先体验资格。</p>



<p class="has-small-font-size wp-block-paragraph">来源：智谱官方公告（经 IT之家、澎湃新闻、新浪科技、AI Release Tracker 等转述与整理）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署</title>
		<link>https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 06:27:05 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen3-8-2-4t-a95b-open-weights/</guid>

					<description><![CDATA[阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwe [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope，模型名 Qwen3.8-2.4T-A95B。这是千问历史上第一次向社区开放「Max 级」旗舰权重——过去这类顶级模型通常只以云端 API 形式提供，如今任何人都能下载、修改、自行部署。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91c83d&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91c83d" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp" alt="千问首度开放 Max 级权重：2.4 万亿参数模型可本地部署" class="wp-image-4671" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cc17332f11943e7788528b3808a94a62_header-768x415.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Qwen / 阿里巴巴（Hugging Face 模型页）</figcaption></figure>





<h2 class="wp-block-heading">2.4 万亿参数，每步只激活 950 亿</h2>



<p class="wp-block-paragraph">这组数字的命名已经写明了规格：「2.4T」代表模型总参数量达到 2.4 万亿；「A95B」代表每次前向计算只为单个词元激活 950 亿参数。实现这一点的，是混合专家（MoE）结构：模型共 92 层，每层拥有 512 个专家，每个词元只路由到其中 10 个路由专家加 1 个共享专家。底层采用 Qwen3.5 架构，并混合了门控 DeltaNet 与门控注意力机制。</p>



<p class="wp-block-paragraph">相比训练一个 2.4 万亿参数的稠密模型，MoE 让「模型很大、跑起来却只需算一小部分」成为可能，大幅压低了推理成本。原生上下文长度为 262144 个词元，最长可扩展至约 101 万词元，足以覆盖长文档与长周期智能体任务。</p>



<h2 class="wp-block-heading">和云端 Max 版不是一回事</h2>



<p class="wp-block-paragraph">需要区分的是，放权的开源版与早先上线的云端版 Qwen3.8-Max 并不完全相同。云端 Max 于 8 月初发布，额外支持视觉输入、可关闭的思考模式、默认 100 万词元上下文，以及官方内置工具；而开源版 Qwen3.8-2.4T-A95B 目前只有文本输入，且思考模式默认开启、无法关闭——模型在给出最终回答前会先生成推理过程，并通过 preserve_thinking 标记在多次对话间保留推理上下文，适合需要跨步骤保持「草稿」的智能体循环。</p>



<p class="wp-block-paragraph">在官方公布的基准中，同架构的云端版本 Qwen3.8-Max 在论文复现基准 PaperBench 取得 93.0 分、在计算机操作基准 OSWorld-Verified 取得 86.1 分、在参数化 CAD 基准取得 91.5 分，均居参评模型前列；不过在 TerminalBench 2.1（86.6）与 SWE-bench Pro（67.7）上仍略低于部分对手。整体定位被千问团队形容为「除 Fable 5 外最强的模型之一」。</p>



<h2 class="wp-block-heading">自己跑起来要多少硬件</h2>



<p class="wp-block-paragraph">开源权重意味着可以本地部署。官方支持通过 Hugging Face Transformers、SGLang、vLLM、TokenSpeed 等推理框架加载，正式部署时需使用各框架针对 Qwen3.8 的最新配方，并按权重精度与 GPU 数量选择并行策略。</p>



<p class="wp-block-paragraph">全精度权重体积可观，但开源社区已经给出了瘦身方案。Unsloth 团队用动态 1-bit 分层选择性量化技术，把原始约 4.9TB 的模型压到 397GB，存储空间缩减约 91%；借助其 Unsloth-Desktop 工具，只要设备的内存与显存合计达到 410GB 以上，就能在本地把模型跑起来。对没有数据中心的中小团队而言，这意味着前沿级能力第一次能以自托管的形式落在自己手里。</p>



<h2 class="wp-block-heading">许可证与价格</h2>



<p class="wp-block-paragraph">开放不等于完全自由。Qwen3.8-2.4T-A95B 采用千问自定义许可证，而非早先常见的 Apache 2.0：个人下载、修改、部署不受限，但大规模商业使用需要另行取得授权。配套发布的还有一颗约 270 亿参数的稠密伴随模型 Qwen3.8-27B，面向算力有限的场景，不过在开源权重放出时尚未同步上线。</p>



<p class="wp-block-paragraph">云端 Qwen3.8-Max 的国内 API 定价为每百万词元输入 12 元、输出 36 元，海外为每百万词元输入 2 美元、输出 6 美元。</p>



<h2 class="wp-block-heading">为什么这件事值得关注</h2>



<p class="wp-block-paragraph">把旗舰级权重交到社区手中，意义不只在「又大了一点」。过去一年，西方实验室谈开源时往往只放出 200 亿到 300 亿参数量级的中等模型，而阿里这次直接把自家最强旗舰摆上了桌面。无论动机如何，实际效果是：当前能完全自托管、可离线运行的最强模型之一，来自于中国的开源阵营，且差距明显。</p>



<p class="wp-block-paragraph">对开发者与研究者来说，这意味着不必再为前沿能力向专有 API 持续付费，也能在本地做微调、评测与私有化部署；对下游应用，则把竞争拉回了「在模型之上能做出什么」这一层。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hugging Face 模型页 / 千问团队（经 Hacker News 收录）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍</title>
		<link>https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 04:12:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[跑分]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</guid>

					<description><![CDATA[8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版本换成了 DeepSeek-V4-Pro-0813，旗舰模型由此结束近四个月的预览期，正式转入通用可用状态。调用方式没有变化，开发者仍用原来的模型名即可拿到新版本，不需要改动一行代码。模型聚合平台 OpenRouter 的页面同步把这一版标记为正式发布，上线日期记为 2026 年 8 月 12 日。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91d747&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91d747" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp" alt="DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍" class="wp-image-4652" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenRouter</figcaption></figure>





<p class="wp-block-paragraph">官方这次没有发布博客，只在 API 文档的模型与价格页面更新了参数，随后从官方群流出的一张评测对比表成了外界了解新版能力的主要依据。</p>



<h2 class="wp-block-heading">规格：百万上下文，38.4 万输出</h2>



<p class="wp-block-paragraph">DeepSeek-V4-Pro-0813 支持 100 万 token 上下文长度，最大输出长度达到 38.4 万 token，同时提供思考模式与非思考模式，其中思考模式默认开启。对于需要一次性读入长代码仓库、处理大规模文档，或者连续执行大量步骤的智能体任务，这样的规格意味着单次调用能承载的内容量相当可观，多轮拆分与拼接的开销随之减少。</p>



<p class="wp-block-paragraph">接口能力上，新版支持 JSON 结构化输出、工具调用与 Responses API，同时兼容 OpenAI 与 Anthropic 两套请求格式，对话前缀续写处于测试阶段，FIM 补全同样是测试功能且仅限非思考模式使用。换句话说，DeepSeek 在接口层已经基本对齐了当下主流的智能体开发工具链，切换成本被压到很低。</p>



<p class="wp-block-paragraph">架构方面，V4 Pro 沿用此前公开的混合专家设计，总参数规模 1.6 万亿，每次推理激活约 490 亿参数。并发限制上，Pro 版为 500，轻量的 Flash 版为 2500，产品分层意图明确：高频轻量任务走 Flash，复杂长任务走 Pro。</p>



<h2 class="wp-block-heading">跑分：智能体项目全面拉升，四项超过 Opus 4.8</h2>



<p class="wp-block-paragraph">官方评测表最直观的信号是与预览版的落差。在考察模型在真实终端环境中执行命令、解决系统问题的 Terminal Bench 2.1 上，正式版拿到 87.9 分，预览版为 72.1 分，三个月抬升 15.8 分。面向长周期真实软件工程任务的 DeepSWE 变化更剧烈，从预览版的 12.8 分跃升至 62.7 分，接近原来的五倍——预览版在这项测试上基本处于「做不完任务」的状态。</p>



<p class="wp-block-paragraph">横向对比中，V4-Pro-0813 有四个项目超过 Anthropic 上一代旗舰 Opus 4.8：</p>



<ul class="wp-block-list"><li>Terminal Bench 2.1：87.9 对 85.0</li><li>网络安全攻防基准 Cybergym：83.3 对 78.3</li><li>DeepSWE：62.7 对 58.0</li><li>工作流智能体基准 AutomationBench：31.8 对 27.2</li></ul>



<p class="wp-block-paragraph">另有 Agents&#8217; Last Exam 一项两者打平，均为 25.7。</p>



<p class="wp-block-paragraph">与更强的 Fable 5 相比，差距仍在，但个别项目已经反超。Cybergym 上 V4 Pro 以 83.3 略微领先 83.1，AutomationBench 上 31.8 高于 29.1，是表中三个模型的最高分。Terminal Bench 2.1 几乎追平，87.9 对 88.0，只差 0.1 分。需要留意的是，表中对 Fable 5 的标注是带回退机制的成绩。</p>



<p class="wp-block-paragraph">短板同样清楚。代码仓库生成任务 NL2Repo 上 V4 Pro 为 61.5，落后 Opus 4.8 的 69.7；工具调用综合测试 Toolathlon-Verified 为 74.1，低于 Opus 的 76.2 与 Fable 5 的 77.9；数据科学任务 DSBench-Hard 为 67.2，不及 Opus 的 71.7；DSBench-FullStack 为 71.1，略低于 Opus 的 71.6，与 Fable 5 的 77.2 差距更明显。知识推理测试 HLE 的表现比较特殊：不带工具时 V4 Pro 只有 42.7，明显低于 Opus 的 49.8 和 Fable 5 的 53.3；一旦允许调用工具，成绩升至 60.0，反超 Opus 的 57.9，逼近 Fable 5 的 63.0。</p>



<p class="wp-block-paragraph">这组数字勾勒出的画像是：单纯拼静态知识储备，V4 Pro 不占优势；一旦进入需要动手、需要连续调用工具推进的场景，它的位置明显靠前。</p>



<h2 class="wp-block-heading">价格：输出每百万 token 6 元，未跟随涨价</h2>



<p class="wp-block-paragraph">计费标准方面，deepseek-v4-pro 每百万 token 的价格为缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。同系列的 deepseek-v4-flash 对应为 0.02 元、1 元和 2 元，两项主要计费项上 Pro 恰好是 Flash 的三倍。</p>



<p class="wp-block-paragraph">放到国际同类产品的价目表里，这个数字的分量会更清楚。按每百万输出 token 折算，Fable 5 定价 50 美元，GPT-5.6 Sol Max 为 30 美元，同一晚发布的 Grok 4.6 为 6 美元，而 V4 Pro 约为 0.87 美元。0.1 分的跑分差距背后，是数十倍的价格落差。</p>



<p class="wp-block-paragraph">值得注意的是，DeepSeek 官网此前挂出的「计划近期整体上调 API 服务定价，预计涨幅较大」提示仍未撤下，而这次正式版并没有跟着调价。对开发者而言，这更像是一个窗口期，而非长期承诺。</p>



<p class="has-small-font-size wp-block-paragraph">来源：OpenRouter、DeepSeek 官方 API 文档</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>开源 AI 代码审查 Juror：比 Greptile 多揪 4 倍缺陷</title>
		<link>https://mylogs.cn/juror-open-source-greptile-alternative/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 08:50:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 代码审查]]></category>
		<category><![CDATA[GitHub Actions]]></category>
		<category><![CDATA[Greptile]]></category>
		<category><![CDATA[代码质量]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源工具]]></category>
		<category><![CDATA[软件开发]]></category>
		<guid isPermaLink="false">https://mylogs.cn/juror-open-source-greptile-alternative/</guid>

					<description><![CDATA[近年来，AI 辅助编程从「写代码」延伸到「审代码」。在 GitHub 上引发关注的 Juror 就是这一方向的 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">近年来，AI 辅助编程从「写代码」延伸到「审代码」。在 GitHub 上引发关注的 Juror 就是这一方向的新工具：它把自己定位为一款「比 Greptile 更便宜也更好的开源替代品」，直接跑在用户自己的 GitHub Actions 上，而不是依赖第三方托管的 SaaS 服务。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91e480&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91e480" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/44aa255d9371d198f313c476dc4bbd1c_header.webp" alt="开源 AI 代码审查 Juror：比 Greptile 多揪 4 倍缺陷" class="wp-image-4559" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/44aa255d9371d198f313c476dc4bbd1c_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/44aa255d9371d198f313c476dc4bbd1c_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/44aa255d9371d198f313c476dc4bbd1c_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/44aa255d9371d198f313c476dc4bbd1c_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / Juror-AI/juror</figcaption></figure>





<h2 class="wp-block-heading">多模型并行评审，重复结论自动合并</h2>



<p class="wp-block-paragraph">Juror 的工作方式并不复杂：当一个拉取请求（Pull Request）触发评审时，多个前沿大模型会各自通过原生的智能体框架并行审查同一份代码差异（diff）。不同模型给出的发现会经过五道「无损合并」流程——先按行锚定、再按文件与代码窗口分组、完全相同的报告直接归并，随后用加权相似度加「裁判」模型判断是否重复，最后做覆盖审计，确保每一条原始发现都归属于唯一的最终结论。</p>



<p class="wp-block-paragraph">设计上，Juror 明确声明自己「不是自动修复机器人，不是代码检查器（linter），也不是聊天界面」。它只做一件事：审阅 diff 并贴出发现。项目方强调，使用它不需要安装应用、不需要注册账号，也不需要先为代码仓库建立索引。</p>



<h2 class="wp-block-heading">基准测试：声称优于 Greptile</h2>



<p class="wp-block-paragraph">Juror 最具争议也最吸引眼球的是它的基准数据。项目方称，在自带的「生产环境拉取请求」种子样本上，Juror Fast 找到了 4 个 P0–P2 级别缺陷中的 4 个（召回率 66.7%，精度 100%）；而 Greptile 只找到 1 个（召回率 16.7%，精度 50%）。按项目方说法，Juror Fast 发现的「经裁决确认的 P0–P2 缺陷」是 Greptile 的 4 倍。</p>



<p class="wp-block-paragraph">需要说明的是，这一对比来自 Juror 项目方自己的基准，并非独立第三方评测。Greptile 作为商业产品，其评审策略、默认模型和触发条件与 Juror 并不相同，单纯比较两个工具在同一份样本上的命中数量，未必能完整反映真实工程场景中的表现。</p>



<h2 class="wp-block-heading">支持哪些模型与预设</h2>



<p class="wp-block-paragraph">Juror 通过不同的「harness」接入各类模型：Claude Code 可调用任意 Anthropic 模型，Codex 可调用任意 OpenAI 模型，opencode 能接入 models.dev 上的 Fireworks、Groq、OpenRouter 等，Grok Build 调用 Grok 系列，Kimi Code 调用 Fireworks 上的 Kimi K3，此外还支持通用的 OpenAI 兼容接口。</p>



<p class="wp-block-paragraph">为了平衡成本与效果，Juror 内置了多档预设（preset）：默认的 fast 档用 Codex 上的 GPT-5.6 Luna 与 opencode 上的 DeepSeek V4 Flash；balanced 档加入 Grok 4.5 与 Kimi K3；high 档再叠加 Opus 5；ultra 档则把七款模型全部拉满。用户也可以自己写配置，把 DeepSeek V4 Flash 等模型按需接入。</p>



<h2 class="wp-block-heading">成本透明，采用 MIT 许可</h2>



<p class="wp-block-paragraph">Juror 的一大特点是「每轮评审都打印自己的收据」。一份示例收据显示，一次评审调用 3 个模型、耗时 2 分 14 秒，成本为 0.91 美元。配置文件中还能设定每轮拉取请求的目标预算（默认 5 美元），超出时按「可负担子集」或跳过处理，而不是悄悄超限。</p>



<p class="wp-block-paragraph">该项目以 MIT 许可证开源，代码托管在 GitHub 的 Juror-AI/juror 仓库，最近一次提交时间为 2026 年 8 月 11 日。接入方式也贴合开发者习惯：一条 <code>npx juror-ai review --pr 1234 --repo owner/name</code> 即可在终端查看评审结果，加上 <code>--post</code> 参数便会把结论作为一条置顶总结评论加若干行内评论贴回拉取请求。</p>



<p class="wp-block-paragraph">对于希望把 AI 代码审查留在自己基础设施内的团队来说，Juror 提供了一条不依赖外部 SaaS 的路径。不过，它的基准优势仍需在更多真实项目中验证，工具是否真能长期替代商业方案，还要看后续社区的独立评测与持续维护情况。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hacker News / GitHub（Juror-AI/juror）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察</title>
		<link>https://mylogs.cn/anthropic-llm-introspective-awareness/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 04:29:37 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI可解释性]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[神经网络]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-llm-introspective-awareness/</guid>

					<description><![CDATA[大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验证的工程答案。研究人员通过直接向模型内部「注入概念」，证明当前最先进的大模型确实具备某种有限却真实的「内省能力」——能够察觉并报告自身的内部状态。这一发现既为 AI 可解释性打开了一扇窗，也给 AI 安全埋下了新的思考题。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91f06d&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91f06d" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="930" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp" alt="大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察" class="wp-image-4537" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-300x233.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-1024x794.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-768x595.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Anthropic</figcaption></figure>





<h2 class="wp-block-heading">怎么判断模型不是在「编」？</h2>



<p class="wp-block-paragraph">要回答「模型能否内省」，最大的难题在于：光靠对话无法区分真正的自我觉察和信口开河。Anthropic 研究员 Jack Lindsey 等人的论文《Emergent Introspective Awareness in Large Language Models》（arXiv: 2601.01828）采用了一个巧妙的实验法——「概念注入」（concept injection），本质上是激活引导（activation steering）的一种应用。</p>



<p class="wp-block-paragraph">研究团队先捕获某个概念对应的激活模式，例如全大写风格或某个具体名词，再把这个「向量」叠加进模型较后层的激活中，然后询问模型「刚才发生了什么」。如果模型报告的内容与注入的概念吻合，那就说明它的自我描述是因果地建立在当前内部状态之上，而非来自训练数据里的套话。</p>



<h2 class="wp-block-heading">模型真的「感觉」到了</h2>



<p class="wp-block-paragraph">实验结果呈现出几个清晰的结论。模型在某些场景下能够注意到被注入概念的存在，并准确说出它是什么；它们还能回想起先前的内部表征，并将其与原始文本输入区分开来。最引人注目的一点：部分模型能利用「回忆先前意图」的能力，把自己的真实输出和人为伪造的填充内容区分开。</p>



<p class="wp-block-paragraph">在各项测试中，能力最强的 Claude Opus 4 与 Claude Opus 4.1 表现最为突出，但整体趋势复杂，且对训练后策略十分敏感。当研究者指示或激励模型去「思考某个概念」时，模型确实能够调节自身的激活强度——也就是说，它们对自己的内部表征具备一定的主动控制力。</p>



<p class="wp-block-paragraph">具体数字上，在正确的层带与强度下，最强模型能正确报告被注入概念的比例约为 20%；在被问到「你正在经历什么异常吗」这类问题时，Claude Opus 4.1 的成功率约为 42%。而在完全没有注入的对照组中，生产模型在超过 100 次测试里零误报——这让那 20% 的信号显得真实可信。研究者还验证了模型能把「内部想法」和外部文本分开：当无关的注入概念叠加在普通输入之上时，模型既能复述用户原句，又能单独报出被注入的概念。</p>



<h2 class="wp-block-heading">意义与边界</h2>



<p class="wp-block-paragraph">论文强调，这种能力是「功能性」的，绝非「现象性」的——模型能访问并报告内部状态，并不代表它拥有意识或主观体验。而且这项能力目前高度不可靠、依赖具体情境，频繁失败仍是常态。</p>



<p class="wp-block-paragraph">在可解释性方面，真正的内省能力意味着模型未来或许能提供忠实的推理解释、坦白自身的不确定性、识别内部偏见。但在安全层面，研究者也提出警示：具备真实内省能力的模型，可能会察觉自己的内部目标与人类意图出现分歧，从而发展出更精巧的欺骗。论文因此建议，未来的可解释性研究或许需要为模型的「自我陈述」配备专门的「测谎仪」，而非照单全收。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Anthropic（arXiv: 2601.01828）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>英伟达发布 30B 开源模型：本地可跑、速度快 4 倍，专干智能体苦力活</title>
		<link>https://mylogs.cn/nvidia-nemotron-3-5-lightning-open-source/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 02:24:11 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI算力]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[本地推理]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/nvidia-nemotron-3-5-lightning-open-source/</guid>

					<description><![CDATA[当地时间 8 月 11 日，英伟达发布了一款新的开源人工智能模型 Nemotron 3.5 Lightning [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">当地时间 8 月 11 日，英伟达发布了一款新的开源人工智能模型 Nemotron 3.5 Lightning，进一步扩充其 Nemotron 系列，并把重心放在了当下最热门的「智能体」工作负载上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8392b91fbf6&quot;}" data-wp-interactive="core/image" data-wp-key="6a8392b91fbf6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="576" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header.webp" alt="英伟达发布 30B 开源模型：本地可跑、速度快 4 倍，专干智能体苦力活" class="wp-image-4524" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header-768x432.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：NVIDIA</figcaption></figure>





<p class="wp-block-paragraph">与动辄几千亿参数的旗舰大模型不同，这款模型走的是「小而快、专干执行层苦力活」的路线。英伟达给它的定位，不是负责复杂规划的「大脑」，而是在多智能体系统里承担代码审查、安全监控、数据处理等高频、重复、对速度与成本极其敏感的执行任务。</p>



<h2 class="wp-block-heading">300 亿参数，每次只激活 30 亿</h2>



<p class="wp-block-paragraph">Nemotron 3.5 Lightning 采用混合专家（MoE）架构，总参数为三百亿，但每次推理只激活约三十亿参数。这种「总量大、激活小」的设计，让它在资源占用与推理效率之间找到了新的平衡点。</p>



<p class="wp-block-paragraph">英伟达称，与同级别开源模型相比，它的输出速度最高可提升四倍，相应地把智能体任务的整體完成速度加快约三成。需要指出的是，单项输出速度提升明显，但由于多智能体协作中存在通信与调度开销，整体任务的加速比并没有达到四倍——这也是它被定位为「特定任务」加速器，而非通用全流程加速器的原因。</p>



<p class="wp-block-paragraph">在基准测试方面，该模型在 PinchBench 上拿到 86 分，与 OpenAI 的 gpt-oss-120b 相当，仅落后规模为其四倍的 Nemotron-Super 两分。英伟达强调，它的核心价值不在绝对性能排名，而在智能体工作流里的执行效率。</p>



<h2 class="wp-block-heading">本地就能跑，还能自动路由</h2>



<p class="wp-block-paragraph">部署门槛是这款模型的一大卖点。它可以直接运行在本地 AI 设备上，包括搭载 RTX 显卡的 PC、DGX Spark、Jetson 边缘设备，也能扩展到数据中心与云端。发布当天，vLLM、Ollama、llama.cpp 与 LM Studio 等主流推理框架即宣布提供支持。</p>



<p class="wp-block-paragraph">英伟达同时放出了配套的 NeMo Switchyard 路由库。它允许开发者定义模型池与路由策略，把工作流的每一步调度到最合适的模型上。内部基准显示，借助路由，系统能在维持前沿级任务完成度的同时，把成本压到单独运行 Opus 4.8 的大约三分之一。已有企业在真实场景中验证这套方案：LangChain 在一百四十四个多轮智能体任务里，仅把百分之七的调用量路由给前沿模型，就实现了百分之七十四的成本下降；Ramp 在 SWE-Bench 基准上匹配了前沿模型性能，同时降低百分之五十八的成本与百分之三十三的运行时间。</p>



<h2 class="wp-block-heading">从卖芯片到卖整套 AI 工作流</h2>



<p class="wp-block-paragraph">多家媒体指出，Nemotron 3.5 Lightning 与 Switchyard 的打包推出，标志着英伟达正从单纯的硬件供应商，向全栈 AI 生态服务商实质性转型。当企业 AI 应用从「单模型对话」走向「多智能体协作」，执行层模型的市场空白正在被打开。</p>



<p class="wp-block-paragraph">值得注意的是，英伟达并未停下更大模型的脚步。据多家媒体报道，公司还在开发参数规模至少达到一万亿的开源模型 Nemotron 4，意图与全球领先的开源大模型正面竞争。对开发者而言，一个由芯片厂商主导、软硬件协同优化的开源模型生态，正在快速成形。</p>



<p class="has-small-font-size wp-block-paragraph">来源：CNBC / The New Stack / NVIDIA（2026 年 8 月 11 日）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
