<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>大模型训练 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e8%ae%ad%e7%bb%83/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 08:31:15 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>只学小学课本，大模型的能力上限就被锁死了</title>
		<link>https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 08:30:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能研究]]></category>
		<category><![CDATA[可解释性]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[知识边界]]></category>
		<category><![CDATA[预训练数据]]></category>
		<guid isPermaLink="false">https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</guid>

					<description><![CDATA[一项「受控」的极端实验 现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">一项「受控」的极端实验</h2>



<p class="wp-block-paragraph">现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某项能力，究竟是真正「学会」了，还是只是被提示词「唤醒」了既有的知识。一个名为 LittleLearner 的研究项目换了一种思路——直接把训练数据本身限定住。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8d913140376&quot;}" data-wp-interactive="core/image" data-wp-key="6a8d913140376" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp" alt="只学小学课本，大模型的能力上限就被锁死了" class="wp-image-5068" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<p class="wp-block-paragraph">研究团队从 FineWeb-Edu 语料出发，经过五道过滤管线，提炼出一份 880 亿 token 的「小学课程库」（LittleCurriculum），严格对齐美国 Common Core 课程标准（幼儿园至五年级，即 K–5）。所有五年级以上才会涉及的概念、事实和词汇，都被明确排除在外。</p>



<h2 class="wp-block-heading">只上过小学的模型</h2>



<p class="wp-block-paragraph">基于这份语料，团队从零训练了三个规格的模型，参数量分别为 6 亿、13 亿和 50 亿，并为每一个都配备了一个使用未过滤语料训练的「对照组」，以便做干净的比较。</p>



<p class="wp-block-paragraph">实验得出了清晰的结论，可以概括为「唤醒，而非习得」：无论是扩大模型规模、做 SFT 加 GRPO 的后期训练，还是在上下文里给示例（in-context learning），都只能放大课程库里已经教过的内容，却无法真正提升课程范围之外（五年级以上）的能力。换句话说，预训练阶段的数据过滤器，设定了模型能力的实际上限。</p>



<h2 class="wp-block-heading">规模、后期训练、上下文学习都救不了</h2>



<p class="wp-block-paragraph">具体来看，扩大模型参数量，确实能提升课程范围内的表现，也能小幅延伸到同一学习轨迹上的问题，但对需要更高阶能力的问题几乎毫无帮助。用 GRPO 把模型训练成数学专精后，K–5 范围内的数学能力显著增强，可即便喂入课程之外的数据，五年级以上的能力缺口依然补不回来。在团队测试的提示条件下，上下文学习也没能为 50 亿参数的 LittleLearner 解锁新的推理能力。</p>



<h2 class="wp-block-heading">为什么这个边界有价值</h2>



<p class="wp-block-paragraph">正因为训练范围被明确定义，研究者才能把模型行为的变化，直接对应到「教了什么」上。他们提出了三个方向：用强化学习检验「能力能否被奖励驱动出来」；观察引入负数等新概念时的学习效率与遗忘；以及把机器和人类儿童放在相同暴露条件下做对比，看两者学分数、解应用题时是否犯类似的错。</p>



<p class="wp-block-paragraph">这项由 Fanfei Li、Wieland Brendel 等人完成的工作（arXiv:2608.13545，2026）提示了一个朴素的道理：当我们在讨论一个大模型「懂不懂」某件事时，答案很可能早在它出生的那一刻，就被训练数据写好了。</p>



<p class="has-small-font-size wp-block-paragraph">来源：LittleLearner 项目团队（arXiv:2608.13545）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>MoE 训练卡在通信上，Cursor 开源解法提速 41%</title>
		<link>https://mylogs.cn/cursor-mixture-of-kittens-moe-megakernel/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 05:01:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Cursor]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/cursor-mixture-of-kittens-moe-megakernel/</guid>

					<description><![CDATA[训练一个混合专家模型（MoE），最贵的往往不是算力本身，而是显卡之间来回搬运数据的那段时间。8 月 4 日，A [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">训练一个混合专家模型（MoE），最贵的往往不是算力本身，而是显卡之间来回搬运数据的那段时间。8 月 4 日，AI 编程工具公司 Cursor 旗下的研究团队开源了一套名为 Mixture-of-Kittens（简称 MoK）的训练超级内核，把这段一直被当成“损耗”的通信开销，硬生生压了下去。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8d91314155b&quot;}" data-wp-interactive="core/image" data-wp-key="6a8d91314155b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header.webp" alt="MoE 训练卡在通信上，Cursor 开源解法提速 41%" class="wp-image-3629" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Cursor</figcaption></figure>





<h2 class="wp-block-heading">瓶颈不在算力，在搬运</h2>



<p class="wp-block-paragraph">Cursor 训练的是自家的智能体编程模型 Composer。团队在博客中写道，随着训练和推理规模不断放大，混合专家层始终是最主要的瓶颈——视工作负载和训练配置而定，这一层可以吃掉端到端训练时间的一半以上。</p>



<p class="wp-block-paragraph">原因在于 MoE 的工作方式。这类模型不会让每个 token 都走完整个网络，而是由一个路由器为它挑选少数几个“专家”子网络。省算力的代价是，专家权重被切分存放在不同显卡上，token 必须先被分发（dispatch）到持有对应专家的卡上算完，再被收回（combine）原处加权求和。通信耗时可能和计算本身一样长，两者若串行执行，效率极低。</p>



<p class="wp-block-paragraph">过去一年 Cursor 也写过自己的 MXFP8、NVFP4 训练算子和面向推理的“warp decode”方案，但那些工作只优化了计算部分，默认通信由别的库另行处理。到了生产环境，通信反而成了限制因素，于是团队决定从第一性原理出发，把整个 MoE 层连同通信一起重写。</p>



<h2 class="wp-block-heading">一个内核吞下所有环节</h2>



<p class="wp-block-paragraph">MoK 的做法是把 MoE 的全部通信与计算融进单一内核，并且保证完全确定性——同样的输入必定得到逐位一致的输出。它专为英伟达 GB300 NVL72 机架设计：72 张显卡处在同一个 NVLink 域内，为细粒度的计算通信重叠创造了条件；但同一机架里集成的 Grace 中央处理器相对偏慢，显卡很容易空转等它，因此内核必须尽量抹掉主机侧的工作与同步。</p>



<p class="wp-block-paragraph">团队的几项关键选择颇具反直觉色彩。业界惯例是用“推”（push）的方式散发 token，认为协议开销小、更能跑满链路；Cursor 的实测却发现，分发环节改用“拉”（pull）在专家负载不均时能把 NVLink 带宽利用率再提升最多 29%。更关键的是信令开销：推式分发要等最多 71 个对端的完成信号并刷新整个机架的内存，而拉式分发无需跨卡同步，微基准里两者延迟相差约 5.8 倍——103 微秒对 18 微秒。最终 MoK 选定了前向拉式分发、推式收回的组合。</p>



<p class="wp-block-paragraph">此外，内核用环形 token 缓冲区复用固定内存，免去主机每步重新计算和分配缓冲区；并把流式多处理器拆开，一部分做矩阵乘法，一部分继续搬数据。在 Blackwell 架构上，凑够 256 个 token 就足以触发一条完整的张量核心矩阵乘指令，于是下一批还在路上时，这一批已经开算。</p>



<h2 class="wp-block-heading">快了多少</h2>



<p class="wp-block-paragraph">在单个 MoE 层的对比测试中，MoK 的 MXFP8 前向吞吐最高达到最强公开基线的 2.37 倍。参与对比的是 NCCL 加 PyTorch、DeepEP 加 PyTorch、DeepEP 加 Transformer Engine，以及英伟达 HybridEP 加 Megatron 四套组合。</p>



<p class="wp-block-paragraph">更有说服力的是生产数据。在横跨多个 NVL72 机架、共 512 张显卡的真实训练栈上，端到端每秒处理的 token 数从此前基于 DeepEP 方案的 760.9 提升到 1070.2，相当于 1.41 倍。Cursor 表示，MoK 目前已经支撑着数万张显卡规模的 Composer 训练。</p>



<h2 class="wp-block-heading">谁会用得上</h2>



<p class="wp-block-paragraph">MoK 针对的是 DeepSeek-V3 式的 MoE 结构——一个共享专家加上数以百计的路由专家。Cursor 在文中直接点名，这一结构被 GLM、Qwen、Kimi（直到 K2.7）等开放权重模型广泛采用。换句话说，任何一家在 NVL72 机架上训练同类架构的团队，理论上都能直接受益。</p>



<p class="wp-block-paragraph">代码已按 Apache 2.0 协议发布在 GitHub 的 cursor/mixture-of-kittens 仓库。署名作者为 Stuart H. Sul、Nash Brown、Henry Wildermuth、William Lin 和 Federico Cassano。</p>



<p class="wp-block-paragraph">值得玩味的是发布者的身份：一家靠卖编程助手赚钱、不做芯片也不卖基础设施的应用层公司，公开了能从同一批硬件里多榨出四成吞吐的底层算子。这既说明模型训练成本对它已是实打实的支出项，也说明大规模训练的竞争，正越来越多地落在那些看不见的内核细节上。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Cursor 官方博客</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
