<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>开源模型 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 08:31:15 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>只学小学课本，大模型的能力上限就被锁死了</title>
		<link>https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 08:30:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能研究]]></category>
		<category><![CDATA[可解释性]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[知识边界]]></category>
		<category><![CDATA[预训练数据]]></category>
		<guid isPermaLink="false">https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</guid>

					<description><![CDATA[一项「受控」的极端实验 现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">一项「受控」的极端实验</h2>



<p class="wp-block-paragraph">现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某项能力，究竟是真正「学会」了，还是只是被提示词「唤醒」了既有的知识。一个名为 LittleLearner 的研究项目换了一种思路——直接把训练数据本身限定住。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f08121c350&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f08121c350" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp" alt="只学小学课本，大模型的能力上限就被锁死了" class="wp-image-5068" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<p class="wp-block-paragraph">研究团队从 FineWeb-Edu 语料出发，经过五道过滤管线，提炼出一份 880 亿 token 的「小学课程库」（LittleCurriculum），严格对齐美国 Common Core 课程标准（幼儿园至五年级，即 K–5）。所有五年级以上才会涉及的概念、事实和词汇，都被明确排除在外。</p>



<h2 class="wp-block-heading">只上过小学的模型</h2>



<p class="wp-block-paragraph">基于这份语料，团队从零训练了三个规格的模型，参数量分别为 6 亿、13 亿和 50 亿，并为每一个都配备了一个使用未过滤语料训练的「对照组」，以便做干净的比较。</p>



<p class="wp-block-paragraph">实验得出了清晰的结论，可以概括为「唤醒，而非习得」：无论是扩大模型规模、做 SFT 加 GRPO 的后期训练，还是在上下文里给示例（in-context learning），都只能放大课程库里已经教过的内容，却无法真正提升课程范围之外（五年级以上）的能力。换句话说，预训练阶段的数据过滤器，设定了模型能力的实际上限。</p>



<h2 class="wp-block-heading">规模、后期训练、上下文学习都救不了</h2>



<p class="wp-block-paragraph">具体来看，扩大模型参数量，确实能提升课程范围内的表现，也能小幅延伸到同一学习轨迹上的问题，但对需要更高阶能力的问题几乎毫无帮助。用 GRPO 把模型训练成数学专精后，K–5 范围内的数学能力显著增强，可即便喂入课程之外的数据，五年级以上的能力缺口依然补不回来。在团队测试的提示条件下，上下文学习也没能为 50 亿参数的 LittleLearner 解锁新的推理能力。</p>



<h2 class="wp-block-heading">为什么这个边界有价值</h2>



<p class="wp-block-paragraph">正因为训练范围被明确定义，研究者才能把模型行为的变化，直接对应到「教了什么」上。他们提出了三个方向：用强化学习检验「能力能否被奖励驱动出来」；观察引入负数等新概念时的学习效率与遗忘；以及把机器和人类儿童放在相同暴露条件下做对比，看两者学分数、解应用题时是否犯类似的错。</p>



<p class="wp-block-paragraph">这项由 Fanfei Li、Wieland Brendel 等人完成的工作（arXiv:2608.13545，2026）提示了一个朴素的道理：当我们在讨论一个大模型「懂不懂」某件事时，答案很可能早在它出生的那一刻，就被训练数据写好了。</p>



<p class="has-small-font-size wp-block-paragraph">来源：LittleLearner 项目团队（arXiv:2608.13545）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>免费「隐形」AI 模型 SWE Atlas 跑赢商业对手</title>
		<link>https://mylogs.cn/big-pickle-swe-atlas-50-8/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[SWE Atlas]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/big-pickle-swe-atlas-50-8/</guid>

					<description><![CDATA[一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成绩。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f08121d144&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f08121d144" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp" alt="免费「隐形」AI 模型 SWE Atlas 跑赢商业对手" class="wp-image-5059" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／PhillipChaffee/big-pickle-swe-atlas 项目页</figcaption></figure>





<h2 class="wp-block-heading">一次非官方的越级挑战</h2>



<p class="wp-block-paragraph">big-pickle 是 OpenCode Zen 平台上处于「隐形」（stealth）期的免费模型，其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看，它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者（GitHub 账号 PhillipChaffee）在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测：全部 124 道任务解出 63 道，任务解决率达到 50.8%。</p>



<p class="wp-block-paragraph">SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题，比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架，并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。</p>



<h2 class="wp-block-heading">横向对比：免费模型的越级表现</h2>



<p class="wp-block-paragraph">放在 SWE Atlas QnA 官方排行榜（2026 年 7 月 28 日更新）中，big-pickle 的成绩意味着：在相同的 Mini-SWE-Agent 脚手架类别里，它压过了榜单上所有条目，包括 GLM 5.2（48.12%）与 GPT-5.6-Sol（46.00%）。在整个榜单中，只有运行在原生 Claude Code 脚手架上的 Opus 5（63.17%）与 Opus 4.8（57.26%）略高。</p>



<p class="wp-block-paragraph">分语言看，TypeScript 解决率 58.1%（18/31）、Python 55.2%（16/29）、Go 50.0%（19/38）、C 语言 38.5%（10/26）；分任务类型看，代码上手（Code Onboarding）60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。</p>



<h2 class="wp-block-heading">结果可以独立核查</h2>



<p class="wp-block-paragraph">开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本，任何人都能审计。需要说明的局限包括：每个任务只跑了一次（官方协议跑三次取均值，单次标准误约正负 4.5 个百分点）；沙箱资源被主动调低至 4 CPU / 8 GB（而非声明的 16/16），但 124 条轨迹的扫描显示零超时、零内存溢出，说明这只会压低而非抬高分数；模型身份未知，结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计，严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub（PhillipChaffee/big-pickle-swe-atlas）、Scale AI SWE Atlas</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>千问下载量破 30 亿，谷歌与 Meta 被甩在身后</title>
		<link>https://mylogs.cn/qwen-3-billion-downloads-overtakes-google-meta/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 21:56:18 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 生态]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<guid isPermaLink="false">https://mylogs.cn/qwen-3-billion-downloads-overtakes-google-meta/</guid>

					<description><![CDATA[阿里巴巴集团的开源权重模型在过去六个月里累计全球下载量超过 30 亿次，超越 Meta、Alphabet 以及 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">阿里巴巴集团的开源权重模型在过去六个月里累计全球下载量超过 30 亿次，超越 Meta、Alphabet 以及本土同行，成为下载量最高的人工智能模型家族。这组数字来自彭博社 8 月 15 日的报道，以及开源模型平台 Hugging Face 8 月 14 日发布的《开源模型现状》报告。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f08121df16&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f08121df16" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header.webp" alt="千问下载量破 30 亿，谷歌与 Meta 被甩在身后" class="wp-image-5019" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c9f5fe8a541acaf41be98b1dbd7f0c68_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Bloomberg</figcaption></figure>





<h2 class="wp-block-heading">30 亿次是个什么量级</h2>



<p class="wp-block-paragraph">作为对比，Hugging Face 的报告显示，2026 年 Alphabet 旗下谷歌的开源模型下载量为 4.18 亿次，Meta 为 2.27 亿次。千问在半年内积累的数字是两者之和的四倍以上。</p>



<p class="wp-block-paragraph">阿里巴巴在一份电子邮件声明中表示，千问系列已开源超过 460 个模型，围绕它形成的生态已衍生出 30 万个以上的衍生模型。Hugging Face 在报告中称，这一下载规模让千问成为「开源 AI 生态系统中规模最大的基础之一」。</p>



<p class="wp-block-paragraph">这两个数字指向的是两件不同的事。下载量说明有多少开发者和机构把模型取回本地运行或改造；衍生模型数量则说明有多少人真的动手做了微调与适配——后者往往更能反映一个模型家族被使用的深度。</p>



<h2 class="wp-block-heading">下载量为什么值得单独看</h2>



<p class="wp-block-paragraph">开源权重模型可以被下载、定制，并作为构建新 AI 产品的基础模块。正因如此，采用情况成了衡量开发者选择在哪套技术上做开发的直接指标，而不只是营销口径上的热度。</p>



<p class="wp-block-paragraph">一个足够宽的模型家族容易形成自我强化的循环：更多开发者采用基础模型，就会产出更多衍生版本，衍生版本又把新用户带进来。460 个开源模型意味着不同参数规模、不同能力取向的版本可以覆盖差异极大的落地场景，从桌面端本地推理到企业级部署都能找到合适的起点，这本身就降低了迁移成本。</p>



<p class="wp-block-paragraph">Hugging Face 的报告给出的判断更直接：对于正在决定微调和部署哪些模型的开发者而言，千问「已经成为默认工作流程的一部分」。</p>



<h2 class="wp-block-heading">云平台成了另一条分发通路</h2>



<p class="wp-block-paragraph">阿里巴巴强化这一循环的方式之一，是通过自家云平台把千问分发给企业客户，覆盖的市场包括东南亚和非洲。这条通路让千问获得了许多竞争对手不具备的触达范围——企业客户往往不会主动去模型托管平台上翻找权重文件，但会在云服务的模型清单里直接选用。</p>



<p class="wp-block-paragraph">在开源模型这条赛道上，千问目前领先的不只是海外厂商。彭博社的报道提到，它在下载量上同时超过了 DeepSeek、月之暗面的 Kimi 与 MiniMax 等中国同行。这几家厂商都在以相对低廉且易于适配的模型复刻前沿性能，力图缩小与 OpenAI、Anthropic 等闭源模型之间的差距，而千问的下载数据表明，这套路线在中国市场之外同样获得了认可。</p>



<h2 class="wp-block-heading">美国厂商正在回应</h2>



<p class="wp-block-paragraph">开发者市场的争夺随之升温。彭博社指出，近几周 Meta 与英伟达相继发布了新的开源 AI 模型。对使用者来说，这轮竞争的直接结果是可选的高质量开源模型变多、迭代变快，而衡量优劣的标准也在从跑分转向更实际的问题：有多少人愿意在它上面继续搭东西。</p>



<p class="has-small-font-size wp-block-paragraph">来源：彭博社 / Hugging Face《开源模型现状》报告</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Mistral 推出 OCR 4.1：文档 AI 进入段落级时代</title>
		<link>https://mylogs.cn/mistral-ocr-4-1-document-ai/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 08:35:00 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Mistral]]></category>
		<category><![CDATA[OCR]]></category>
		<category><![CDATA[RAG]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[企业AI]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[文档智能]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mistral-ocr-4-1-document-ai/</guid>

					<description><![CDATA[Mistral 推出 OCR 4.1：文档 AI 进入段落级时代 法国人工智能公司 Mistral 于 7 月 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">Mistral 推出 OCR 4.1：文档 AI 进入段落级时代</h2>



<p class="wp-block-paragraph">法国人工智能公司 Mistral 于 7 月发布 OCR 4.1 公开预览版，把文档识别从单纯的「文字提取」推进到「结构化理解」。新模型最大的变化，是能够输出段落级的边界框（Bounding Box）、结构化区块标签，以及区块级的置信度评分，让企业在把纸质或扫描文档喂给检索增强生成（RAG）系统之前，先对提取质量做更细的把控。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f08121ed74&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f08121ed74" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header.webp" alt="Mistral 推出 OCR 4.1：文档 AI 进入段落级时代" class="wp-image-4818" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Mistral</figcaption></figure>





<h2 class="wp-block-heading">不只是识别文字</h2>



<p class="wp-block-paragraph">传统 OCR 只关心「图里是什么字」，而 OCR 4.1 试图理解文档的结构。它借助计算机视觉处理复杂排版、手写体以及数学公式，把图像和 PDF 中的文本、公式与表格布局，以较高的精度转换为结构化的 Markdown 格式。对于 RAG 管线而言，这意味着预处理步骤可以被压缩成一次 API 调用。</p>



<p class="wp-block-paragraph">Mistral 在官方文档中介绍，OCR 4.1 的 API 新增了「block」级别的置信度粒度选项：除了原有的「page」（页面级）与「word」（词级）之外，开发者现在可以拿到页面级与区块级两套评分，从而判断某一段落、某张表格的提取是否可靠，再决定是自动入库还是转人工复核。</p>



<h2 class="wp-block-heading">对手与定位</h2>



<p class="wp-block-paragraph">在企业文档智能领域，Mistral 的对手包括亚马逊的 Textract 与谷歌云的 Document AI。前者能提取文本、手写、表格与表单，后者则将 OCR 与版式分析、分类、结构化提取结合。相比这些背靠大型云生态的平台，Mistral 选择了一条更聚焦的路线：用一个连接自有模型、Studio 工具链与企业 AI 栈的专用文档模型切入。</p>



<p class="wp-block-paragraph">不过价格引发了讨论。OCR 4.1 定价约为每千页 3.5 欧元（约合 4.38 美元），有开发者指出这比部分竞品贵出近一倍。但在处理历史文献、复杂版式时的稳定性，以及在合规与数据主权方面支持开放权重、可本地私有化部署的特性，让它成为文档 AI 赛道一个值得关注的变量。</p>



<h2 class="wp-block-heading">为什么重要</h2>



<p class="wp-block-paragraph">文档摄取是智能体（agent）落地企业场景的关键入口。一个模型即便推理能力很强，只要把表格压平错了、把页脚误认成正文，或者把低置信度的数字直接写进检索索引，最终输出仍可能出错。OCR 4.1 把改进点放在「喂给搜索、智能体与自动化决策的那条文档管道」内部，用段落级输出与置信度评分，给开发者更细的检视、路由与索引能力。在头部大模型比拼通用能力的当下，押注细分工具模型，也是欧洲 AI 避开正面战场的一种务实选择。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Mistral 官方文档与多家科技媒体综合整理</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>智谱 GLM-5.3 发布：编程最强开源模型</title>
		<link>https://mylogs.cn/zhipu-glm-5-3-strongest-open-source-coding/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 06:20:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[GLM]]></category>
		<category><![CDATA[代码生成]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智谱]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/zhipu-glm-5-3-strongest-open-source-coding/</guid>

					<description><![CDATA[基座不变，后训练把编程上限抬了上去 8 月 14 日，智谱发布新一代旗舰模型 GLM-5.3。与上一个版本 G [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">基座不变，后训练把编程上限抬了上去</h2>



<p class="wp-block-paragraph">8 月 14 日，智谱发布新一代旗舰模型 GLM-5.3。与上一个版本 GLM-5.2 相比，新模型的基座并没有更换，全部提升来自后训练阶段的强化学习——智谱称其为「后训练 Scaling」：依托 IndexShare、SAO 以及新一代 Slime 框架，在完全相同的基座上把训练时长、任务环境种类与长程任务规模都做了大幅扩展。用官方的话说，这个基座的智能上界还远未被开发完。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f08121fa45&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f08121fa45" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header.webp" alt="智谱 GLM-5.3 发布：编程最强开源模型" class="wp-image-4799" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/08/7a91a1567b8ce79d73f101098bf4c808_header-768x768.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI 生成配图（示意）</figcaption></figure>





<p class="wp-block-paragraph">在内部体感评测中，GLM-5.3 的编程能力较前代提升约 50%，在多项公开基准上登顶开源模型第一。智谱将其定位为「为编程而生，为网络防御就绪」，并称其编程与智能体能力已接近 Claude Fable 5，编程体感超过其他国产模型。</p>



<h2 class="wp-block-heading">基准分数：编程与安全双双跃升</h2>



<p class="wp-block-paragraph">具体来看，在衡量真实终端环境复杂任务完成的 Terminal-Bench 3.0 上，GLM-5.3 得分从 4.6 提升到 28.3；在长程软件工程与持续代码修改的 DeepSWE v1.1 上，从 46.2 提升到 66.9；在跨工具协作与长程任务的 Agents Last Exam 上，从 23.8 提升到 28.5；在覆盖 44 种职业真实知识工作的 GDPval-AA v2 中得分 1769，呈现出基于编程能力涌现出的专业任务执行力。</p>



<p class="wp-block-paragraph">网络安全是这一版最突出的新增方向。在白盒代码审查与漏洞发现任务中，GLM-5.3 的表现与闭源标杆 Mythos 5 持平；在漏洞验证基准 CyberGym 中取得 84.5% 的成绩，高于 GLM-5.2 的 77.2%，也略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。在 Z.ai Code Bench 高档位端到端测试中，其准确率达到 31.4%，超过 Claude Opus 4.8 最高档位的 29.5%。</p>



<h2 class="wp-block-heading">两周后开源，工具链同日上线</h2>



<p class="wp-block-paragraph">智谱表示，GLM-5.3 的全部提升都来自后训练，因此模型权重将在发布约两周后开放，前提是完成必要的安全评估与加固，以限制其潜在的攻击能力、保留防御价值。这是智谱（Z.ai）十三个月内发布的第七款旗舰模型。</p>



<p class="wp-block-paragraph">与模型同步，智谱官方编程工具 ZCode、效率工具 AutoClaw 已于发布当日上线，GLM Coding Plan 面向全量用户开放订阅；Trae、扣子、WorkBuddy/CodeBuddy、Qoder、CatPaw、JoyCode、OpenCode 等多家编码平台也获得抢先体验资格。</p>



<p class="has-small-font-size wp-block-paragraph">来源：智谱官方公告（经 IT之家、澎湃新闻、新浪科技、AI Release Tracker 等转述与整理）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍</title>
		<link>https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 04:12:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[跑分]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</guid>

					<description><![CDATA[8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版本换成了 DeepSeek-V4-Pro-0813，旗舰模型由此结束近四个月的预览期，正式转入通用可用状态。调用方式没有变化，开发者仍用原来的模型名即可拿到新版本，不需要改动一行代码。模型聚合平台 OpenRouter 的页面同步把这一版标记为正式发布，上线日期记为 2026 年 8 月 12 日。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f0812209a3&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f0812209a3" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp" alt="DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍" class="wp-image-4652" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenRouter</figcaption></figure>





<p class="wp-block-paragraph">官方这次没有发布博客，只在 API 文档的模型与价格页面更新了参数，随后从官方群流出的一张评测对比表成了外界了解新版能力的主要依据。</p>



<h2 class="wp-block-heading">规格：百万上下文，38.4 万输出</h2>



<p class="wp-block-paragraph">DeepSeek-V4-Pro-0813 支持 100 万 token 上下文长度，最大输出长度达到 38.4 万 token，同时提供思考模式与非思考模式，其中思考模式默认开启。对于需要一次性读入长代码仓库、处理大规模文档，或者连续执行大量步骤的智能体任务，这样的规格意味着单次调用能承载的内容量相当可观，多轮拆分与拼接的开销随之减少。</p>



<p class="wp-block-paragraph">接口能力上，新版支持 JSON 结构化输出、工具调用与 Responses API，同时兼容 OpenAI 与 Anthropic 两套请求格式，对话前缀续写处于测试阶段，FIM 补全同样是测试功能且仅限非思考模式使用。换句话说，DeepSeek 在接口层已经基本对齐了当下主流的智能体开发工具链，切换成本被压到很低。</p>



<p class="wp-block-paragraph">架构方面，V4 Pro 沿用此前公开的混合专家设计，总参数规模 1.6 万亿，每次推理激活约 490 亿参数。并发限制上，Pro 版为 500，轻量的 Flash 版为 2500，产品分层意图明确：高频轻量任务走 Flash，复杂长任务走 Pro。</p>



<h2 class="wp-block-heading">跑分：智能体项目全面拉升，四项超过 Opus 4.8</h2>



<p class="wp-block-paragraph">官方评测表最直观的信号是与预览版的落差。在考察模型在真实终端环境中执行命令、解决系统问题的 Terminal Bench 2.1 上，正式版拿到 87.9 分，预览版为 72.1 分，三个月抬升 15.8 分。面向长周期真实软件工程任务的 DeepSWE 变化更剧烈，从预览版的 12.8 分跃升至 62.7 分，接近原来的五倍——预览版在这项测试上基本处于「做不完任务」的状态。</p>



<p class="wp-block-paragraph">横向对比中，V4-Pro-0813 有四个项目超过 Anthropic 上一代旗舰 Opus 4.8：</p>



<ul class="wp-block-list"><li>Terminal Bench 2.1：87.9 对 85.0</li><li>网络安全攻防基准 Cybergym：83.3 对 78.3</li><li>DeepSWE：62.7 对 58.0</li><li>工作流智能体基准 AutomationBench：31.8 对 27.2</li></ul>



<p class="wp-block-paragraph">另有 Agents&#8217; Last Exam 一项两者打平，均为 25.7。</p>



<p class="wp-block-paragraph">与更强的 Fable 5 相比，差距仍在，但个别项目已经反超。Cybergym 上 V4 Pro 以 83.3 略微领先 83.1，AutomationBench 上 31.8 高于 29.1，是表中三个模型的最高分。Terminal Bench 2.1 几乎追平，87.9 对 88.0，只差 0.1 分。需要留意的是，表中对 Fable 5 的标注是带回退机制的成绩。</p>



<p class="wp-block-paragraph">短板同样清楚。代码仓库生成任务 NL2Repo 上 V4 Pro 为 61.5，落后 Opus 4.8 的 69.7；工具调用综合测试 Toolathlon-Verified 为 74.1，低于 Opus 的 76.2 与 Fable 5 的 77.9；数据科学任务 DSBench-Hard 为 67.2，不及 Opus 的 71.7；DSBench-FullStack 为 71.1，略低于 Opus 的 71.6，与 Fable 5 的 77.2 差距更明显。知识推理测试 HLE 的表现比较特殊：不带工具时 V4 Pro 只有 42.7，明显低于 Opus 的 49.8 和 Fable 5 的 53.3；一旦允许调用工具，成绩升至 60.0，反超 Opus 的 57.9，逼近 Fable 5 的 63.0。</p>



<p class="wp-block-paragraph">这组数字勾勒出的画像是：单纯拼静态知识储备，V4 Pro 不占优势；一旦进入需要动手、需要连续调用工具推进的场景，它的位置明显靠前。</p>



<h2 class="wp-block-heading">价格：输出每百万 token 6 元，未跟随涨价</h2>



<p class="wp-block-paragraph">计费标准方面，deepseek-v4-pro 每百万 token 的价格为缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。同系列的 deepseek-v4-flash 对应为 0.02 元、1 元和 2 元，两项主要计费项上 Pro 恰好是 Flash 的三倍。</p>



<p class="wp-block-paragraph">放到国际同类产品的价目表里，这个数字的分量会更清楚。按每百万输出 token 折算，Fable 5 定价 50 美元，GPT-5.6 Sol Max 为 30 美元，同一晚发布的 Grok 4.6 为 6 美元，而 V4 Pro 约为 0.87 美元。0.1 分的跑分差距背后，是数十倍的价格落差。</p>



<p class="wp-block-paragraph">值得注意的是，DeepSeek 官网此前挂出的「计划近期整体上调 API 服务定价，预计涨幅较大」提示仍未撤下，而这次正式版并没有跟着调价。对开发者而言，这更像是一个窗口期，而非长期承诺。</p>



<p class="has-small-font-size wp-block-paragraph">来源：OpenRouter、DeepSeek 官方 API 文档</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>英伟达发布 30B 开源模型：本地可跑、速度快 4 倍，专干智能体苦力活</title>
		<link>https://mylogs.cn/nvidia-nemotron-3-5-lightning-open-source/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 02:24:11 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI算力]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[本地推理]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/nvidia-nemotron-3-5-lightning-open-source/</guid>

					<description><![CDATA[当地时间 8 月 11 日，英伟达发布了一款新的开源人工智能模型 Nemotron 3.5 Lightning [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">当地时间 8 月 11 日，英伟达发布了一款新的开源人工智能模型 Nemotron 3.5 Lightning，进一步扩充其 Nemotron 系列，并把重心放在了当下最热门的「智能体」工作负载上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f081221934&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f081221934" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="576" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header.webp" alt="英伟达发布 30B 开源模型：本地可跑、速度快 4 倍，专干智能体苦力活" class="wp-image-4524" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8fa335c4f062e69c417cebfec4a4f52d_header-768x432.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：NVIDIA</figcaption></figure>





<p class="wp-block-paragraph">与动辄几千亿参数的旗舰大模型不同，这款模型走的是「小而快、专干执行层苦力活」的路线。英伟达给它的定位，不是负责复杂规划的「大脑」，而是在多智能体系统里承担代码审查、安全监控、数据处理等高频、重复、对速度与成本极其敏感的执行任务。</p>



<h2 class="wp-block-heading">300 亿参数，每次只激活 30 亿</h2>



<p class="wp-block-paragraph">Nemotron 3.5 Lightning 采用混合专家（MoE）架构，总参数为三百亿，但每次推理只激活约三十亿参数。这种「总量大、激活小」的设计，让它在资源占用与推理效率之间找到了新的平衡点。</p>



<p class="wp-block-paragraph">英伟达称，与同级别开源模型相比，它的输出速度最高可提升四倍，相应地把智能体任务的整體完成速度加快约三成。需要指出的是，单项输出速度提升明显，但由于多智能体协作中存在通信与调度开销，整体任务的加速比并没有达到四倍——这也是它被定位为「特定任务」加速器，而非通用全流程加速器的原因。</p>



<p class="wp-block-paragraph">在基准测试方面，该模型在 PinchBench 上拿到 86 分，与 OpenAI 的 gpt-oss-120b 相当，仅落后规模为其四倍的 Nemotron-Super 两分。英伟达强调，它的核心价值不在绝对性能排名，而在智能体工作流里的执行效率。</p>



<h2 class="wp-block-heading">本地就能跑，还能自动路由</h2>



<p class="wp-block-paragraph">部署门槛是这款模型的一大卖点。它可以直接运行在本地 AI 设备上，包括搭载 RTX 显卡的 PC、DGX Spark、Jetson 边缘设备，也能扩展到数据中心与云端。发布当天，vLLM、Ollama、llama.cpp 与 LM Studio 等主流推理框架即宣布提供支持。</p>



<p class="wp-block-paragraph">英伟达同时放出了配套的 NeMo Switchyard 路由库。它允许开发者定义模型池与路由策略，把工作流的每一步调度到最合适的模型上。内部基准显示，借助路由，系统能在维持前沿级任务完成度的同时，把成本压到单独运行 Opus 4.8 的大约三分之一。已有企业在真实场景中验证这套方案：LangChain 在一百四十四个多轮智能体任务里，仅把百分之七的调用量路由给前沿模型，就实现了百分之七十四的成本下降；Ramp 在 SWE-Bench 基准上匹配了前沿模型性能，同时降低百分之五十八的成本与百分之三十三的运行时间。</p>



<h2 class="wp-block-heading">从卖芯片到卖整套 AI 工作流</h2>



<p class="wp-block-paragraph">多家媒体指出，Nemotron 3.5 Lightning 与 Switchyard 的打包推出，标志着英伟达正从单纯的硬件供应商，向全栈 AI 生态服务商实质性转型。当企业 AI 应用从「单模型对话」走向「多智能体协作」，执行层模型的市场空白正在被打开。</p>



<p class="wp-block-paragraph">值得注意的是，英伟达并未停下更大模型的脚步。据多家媒体报道，公司还在开发参数规模至少达到一万亿的开源模型 Nemotron 4，意图与全球领先的开源大模型正面竞争。对开发者而言，一个由芯片厂商主导、软硬件协同优化的开源模型生态，正在快速成形。</p>



<p class="has-small-font-size wp-block-paragraph">来源：CNBC / The New Stack / NVIDIA（2026 年 8 月 11 日）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>本地大模型实战：5 个慢速笔记本也能跑的项目</title>
		<link>https://mylogs.cn/local-llm-5-projects-slow-laptop/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 11:32:44 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[llama.cpp]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[本地大模型]]></category>
		<category><![CDATA[离线AI]]></category>
		<category><![CDATA[边缘计算]]></category>
		<guid isPermaLink="false">https://mylogs.cn/local-llm-5-projects-slow-laptop/</guid>

					<description><![CDATA[别被「必须旗舰显卡」吓退 很多人以为跑本地大模型一定得配一张昂贵的独立显卡。这个说法有一半是对的——确实有不少 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">别被「必须旗舰显卡」吓退</h2>



<p class="wp-block-paragraph">很多人以为跑本地大模型一定得配一张昂贵的独立显卡。这个说法有一半是对的——确实有不少任务离不开显卡。但模型世界里还藏着一大批体积小、却能把事情做漂亮的小模型。只要手边有一台近五年内生产的旧电脑或笔记本，内存不低于 8GB，就能跑起来，速度大约在每秒 10 个词元上下。这个速度听起来不起眼，可在不少实际场景里，原始速度根本不是关键。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f0812229b5&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f0812229b5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e4dba4cc484557b2f5512259452231f7_header.webp" alt="本地大模型实战：5 个慢速笔记本也能跑的项目" class="wp-image-4448" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e4dba4cc484557b2f5512259452231f7_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e4dba4cc484557b2f5512259452231f7_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e4dba4cc484557b2f5512259452231f7_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e4dba4cc484557b2f5512259452231f7_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：How-To Geek</figcaption></figure>





<h2 class="wp-block-heading">第一行命令：用 Ollama 起一个本地服务</h2>



<p class="wp-block-paragraph">对于大多数想自己托管 AI 的人来说，Ollama 几乎成了默认选择。它内置模型库，提供一套兼容 OpenAI 的接口，能在本地直接拉起一个服务进程。基于开放权重模型搭建真正能执行任务的 AI、而非单纯对话，它再合适不过。</p>



<p class="wp-block-paragraph">最大的好处是省心。硬件探测、量化版本选择这类琐碎活儿，Ollama 都替用户打理了。唯一要盯紧的是量化设置：选错格式的后果很严重，仅仅两比特的差别，就能让整机性能天差地别。选定模型后，执行 <code>ollama pull 模型名</code> 拉取，再 <code>ollama run 模型名</code> 就能对话。</p>



<h2 class="wp-block-heading">要榨干性能：试试 llama.cpp</h2>



<p class="wp-block-paragraph">llama.cpp 是一套专门跑 GGUF 格式模型的推理引擎。它没有界面开销，把能用的 CPU 优化都用到了极致，适合那种「每一分性能都要抠」的场景，代价是上手更费劲。</p>



<p class="wp-block-paragraph">它高度依赖命令行（不过也有网页界面可用），模型文件得自己管理，量化格式也得自己搞明白。起步方式是下载发布版或自行编译，再从 Hugging Face 取一份 GGUF 模型，用 llama-cli 或 llama-server 跑起来。有一项设置至关重要：把上下文长度封顶，别用默认值。KV 缓存吃掉内存的速度快得惊人，设太高整机立刻卡死。</p>



<h2 class="wp-block-heading">给老旧硬件的礼物：Gemma 4 边缘模型</h2>



<p class="wp-block-paragraph">Gemma 4 家族里最小的两员——E2B 与 E4B——于 2026 年春天专为「边缘」硬件发布。名字里的「E」代表有效参数量，用更少的显存堆出更深的层次。举例来说，E4B 在 4 比特量化下大约只占 5GB 内存。</p>



<p class="wp-block-paragraph">它们擅长摘要、起草、抽取结构化数据、翻译这类基础活儿，也能做一点推理，只是比不上更大的思考型模型。通过 Ollama 使用时，按内存选型号：有 8GB 就上 E4B，更少就退到 E2B。上下文也别拉太高，一样会挤占内存。</p>



<h2 class="wp-block-heading">慢笔记本的绝配：给相册自动写说明</h2>



<p class="wp-block-paragraph">这篇文章里最受青睐的本地 AI 项目之一，是个给截图自动生成描述的小程序。这套配置跑在显卡上，但完全没有理由不能挪到 CPU 上，尤其是不要求实时的时候。批量给一整个文件夹的照片生成说明文字或替代文本，正是慢笔记本的理想任务——模型每秒吐三个词元，即便在无人值守时运行，慢一点也无妨。</p>



<p class="wp-block-paragraph">可选方案有好几个：Moondream2（或 Moondream3，约 16 亿参数）专为边缘设计，4 比特量化下轻松塞进 3GB；SmolVLM 2B 是开放权重模型，擅长批处理；Gemma 4 E4B 每个版本都带视觉能力。要是想翻找过去十年的照片并让它们变得可搜索，这招极其实用。建议先用十几张差异很大的图试试水，再决定要不要丢进上万张的图库。</p>



<h2 class="wp-block-heading">把文档搜索变聪明：私有语义检索</h2>



<p class="wp-block-paragraph">电脑自带搜索基本是「傻瓜式」的，只认敲进去的字面关键词。换上 AI，就能做语义搜索——用更自然的描述去找东西，不必字字对应。推荐先从 EmbeddingGemma 入手：它只有 3.08 亿参数，量化后内存占用不到 200MB，甚至能把输出向量从 768 维截到 128 维而几乎不损质量。把它接在 Ollama 服务后，配合 AnythingLLM 或 Open WebUI 就能用。只是要记住，在 CPU 上扫一遍庞大的文档库，动辄要等上几个小时。</p>



<h2 class="wp-block-heading">怎么选：快用 llama.cpp，图省心用 Ollama</h2>



<p class="wp-block-paragraph">想要最快的搭建，选 llama.cpp；对其他人，作者强烈推荐 Ollama，那份省心简直是游戏规则的改变者。若一时没有特定模型目标，先从 Gemma 4 的边缘型号起步最稳妥——它们能做的事多到惊人，而且哪怕是一台「土豆机」也带得动。</p>



<p class="has-small-font-size wp-block-paragraph">来源：How-To Geek（作者 Nick Lewis，2026 年 8 月 11 日）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Redis 之父给 Mac 写了个 MiniMax H3 本地推理引擎</title>
		<link>https://mylogs.cn/antirez-h3c-minimax-h3-mac-local-inference/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 04:45:09 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[antirez]]></category>
		<category><![CDATA[Apple Silicon]]></category>
		<category><![CDATA[H3]]></category>
		<category><![CDATA[MiniMax]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[本地推理]]></category>
		<category><![CDATA[视频生成]]></category>
		<guid isPermaLink="false">https://mylogs.cn/antirez-h3c-minimax-h3-mac-local-inference/</guid>

					<description><![CDATA[Redis 作者 antirez（Salvatore Sanfilippo）近日在 GitHub 上发布了一个 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">Redis 作者 antirez（Salvatore Sanfilippo）近日在 GitHub 上发布了一个名为 h3.c 的项目，目标是为苹果电脑写一套原生的 MiniMax H3 推理引擎。与社区里基于 MLX 框架的移植不同，h3.c 从词法到 Metal 着色器几乎都用 C 和 Objective-C 重写，专门吃 Apple Silicon 的统一内存，让 Mac 在本地直接跑这个 33B 参数的全模态视频模型。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f081223a2a&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f081223a2a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/h3c_header.webp" alt="Redis 之父给 Mac 写了个 MiniMax H3 本地推理引擎" class="wp-image-4405" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/h3c_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/h3c_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/h3c_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/h3c_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／antirez/h3.c 项目页</figcaption></figure>





<h2 class="wp-block-heading">为什么要在 Mac 上重造一个引擎</h2>



<p class="wp-block-paragraph">MiniMax 在 8 月 3 日把 H3 正式开源，这是一个能同时吃进文本、图像、音频、视频、再一次性吐出最长 15 秒带原生立体声视频的通用生成模型。官方提供了 Hugging Face 权重和基于 SGLang、MLX 等的参考实现，社区也很快出现了 PipeNetwork 的 MLX 移植版。</p>



<p class="wp-block-paragraph">但 antirez 选择了一条更硬核的路：不依赖现成框架，自己用 C 实现推理内核，再用 Metal 把矩阵运算落到苹果芯片的 GPU 上。这样做的好处是能精细控制统一内存的占用与复用——视频模型权重动辄上百 GB，能否塞进 Mac 的有限内存，取决于推理引擎怎么分批搬运张量。h3.c 目前仍在开发中，仓库显示它已能跑通提示词到视频、首尾帧约束，以及参考图、视频、音频的 Ref2VA 条件控制。</p>



<h2 class="wp-block-heading">速度能快多少</h2>



<p class="wp-block-paragraph">项目 README 里给出了一组在 M5 Max 上的实测。以一段 512 像素见方、22 帧的红狐踏雪短片为基准：用默认 20 步去噪需要约 26.4 秒；而采用 4 步的激进调度，耗时压缩到约 3.5 秒，画面对照 29 步参考稿的全片结构相似度（SSIM）仍有 0.556，独立的冲浪者测试为 0.547。换句话说，用不到七分之一的时间，就能拿到一个可用、但细节更糙的预览。</p>



<p class="wp-block-paragraph">模型核心是一个 33B 的稠密 Transformer（H3-Omni-Transformer），文本编码器复用 Qwen 系模型，权重以 BF16 精度常驻。在开启预览的激进配置下，峰值显存占用约 25.9 GiB（int8 估算）。仓库还提供多档预设：默认 20 步、最慢 50 步参考、最快 4 至 7 步，开发者可以一次只调一个旋钮来权衡速度与画质。</p>



<h2 class="wp-block-heading">能拿来做什么</h2>



<p class="wp-block-paragraph">h3.c 内置了一个类似 Iris 的交互会话：启动时加载模型与分词器，之后输入提示词即可连续生成，重复提示词换随机种子时不必重新加载。它支持首帧与末帧锚定，让镜头从 A 画面运动到 B 画面，也支持按顺序追加多张参考图，标记为图片 1、图片 2，让模型据此生成「让图片 1 里的人挥手」这类指令。</p>



<p class="wp-block-paragraph">分辨率方面，512×512 是被反复验证的开发尺寸，768p 级别的横竖构图也已验证，画布上限受机械限制约 768×1344。更短的 256 见方预览会自动降低空间位置编码频率，消除长镜头里出现的网格伪影。</p>



<p class="wp-block-paragraph">对普通用户而言，h3.c 的意义在于把在云端排队、按秒计费的视频生成，变成在自己电脑上离线跑的一件事。代价是需要一台内存充足的 Apple Silicon Mac，以及等待项目继续打磨工程完整度。antirez 本人以把复杂系统写到极简著称，h3.c 最终能否成为 Mac 上跑 H3 的默认选择，还要看后续的内存优化与稳定性。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hacker News | antirez | https://github.com/antirez/h3.c</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>能源部开放权重科研模型，自己握权重才安心</title>
		<link>https://mylogs.cn/doe-genesis-science-1-open-model/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 14:42:55 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI for Science]]></category>
		<category><![CDATA[Arcee]]></category>
		<category><![CDATA[可信AI]]></category>
		<category><![CDATA[开放权重]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[科研大模型]]></category>
		<category><![CDATA[美国能源部]]></category>
		<guid isPermaLink="false">https://mylogs.cn/doe-genesis-science-1-open-model/</guid>

					<description><![CDATA[一家国家级实验室最怕的，不是模型不够强，而是跑科研计算的模型权重握在别人手里、只能靠租用接口续命。美国能源部（ [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一家国家级实验室最怕的，不是模型不够强，而是跑科研计算的模型权重握在别人手里、只能靠租用接口续命。美国能源部（DOE）想换个玩法。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f081224647&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f081224647" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/56b0c32abd19bca93d9658ef9103e832_header.webp" alt="能源部开放权重科研模型，自己握权重才安心" class="wp-image-4124" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/56b0c32abd19bca93d9658ef9103e832_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/56b0c32abd19bca93d9658ef9103e832_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/56b0c32abd19bca93d9658ef9103e832_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/56b0c32abd19bca93d9658ef9103e832_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Arcee AI</figcaption></figure>





<p class="wp-block-paragraph">2026 年 7 月 22 日，DOE 联合开源模型实验室 Arcee AI 公布 Genesis-Science-1（GS1）——一个面向科研的“开放权重”基础模型。它并非某家公司的闭源产品，而是由 DOE 及其国家实验室在“创世计划”（Genesis Mission）框架下共建。Arcee 负责拉算力、做预训练与后训练、搭建科研工作台与周边系统；DOE 的科学家们则界定该解决什么问题、提供训练用的数据与环境，并验证模型产出是否站得住脚。GS1 被描述为一款万亿参数级别的语言模型，搭配一套“受治理的执行系统”，用于跑那些耗时、棘手的长链路科研任务，计划今年晚些时候开放权重、技术报告和公开演示，底层基于 Arcee 新一代 Trinity 架构（其 Trinity Large 为 4000 亿参数的稀疏混合专家模型）。</p>



<p class="wp-block-paragraph">“创世计划”本身由 2025 年 11 月的一道行政命令启动，是 DOE 牵头的国家级倡议，目标是十年内让美国科研产出与影响力翻倍，串联起 17 个国家实验室，由 DOE 副部长兼科学长官 Darío Gil 主抓。</p>



<p class="wp-block-paragraph">GS1 真正特别的地方在“治理”。它运行在受控的科研环境里：只用获批的工具，能写代码、修代码、在运行中失败时自我恢复，并保留每一步推理的可复现记录。模型跑在一套沙箱化的分段执行系统里，会为进度打检查点、记录每一次提示词、工具调用和中间结果，且绝不被赋予对 DOE 基础设施的无限访问权。任何涉及安全、保密、发表或算力使用的事，都必须由人拍板。开放权重的意义正在于此——实验室可以把模型牢牢握在自己手里，保留已知版本、在自有环境里评估、按本学科微调，并追溯答案背后完整的工作链路。</p>



<p class="wp-block-paragraph">为了让社区参与共建，DOE 在阿贡国家实验室（Argonne）托管的 genesisopenmodels.anl.gov 开放了贡献通道，面向高校、其他实验室、企业、非营利与研究机构；贡献者保留素材所有权并可设定使用条款。据 energy.gov 公告，首轮贡献窗口中，预训练类申请截止 2026 年 8 月 14 日、微调类截止 8 月 25 日，之后预计每三个月滚动一次。</p>



<p class="wp-block-paragraph">Arcee 联合创始人兼 CEO Mark McQuade 把背后的逻辑说得很直白：“一个国家如果领先的领域全都封闭，就不可能在 AI 上领先。”Arcee 在公告中也不回避一个事实：它认可中国的 DeepSeek、通义千问、Kimi、MiniMax、GLM 等开源模型实验室做得很好，并认为这些团队恰恰暴露出美国本土能造出的强开源模型太少——而这，正是 GS1 想补上的缺口。</p>



<p class="has-small-font-size wp-block-paragraph">来源：美国能源部 / Arcee AI</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
