<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>预训练数据 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e9%a2%84%e8%ae%ad%e7%bb%83%e6%95%b0%e6%8d%ae/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 08:31:15 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>只学小学课本，大模型的能力上限就被锁死了</title>
		<link>https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 08:30:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能研究]]></category>
		<category><![CDATA[可解释性]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[知识边界]]></category>
		<category><![CDATA[预训练数据]]></category>
		<guid isPermaLink="false">https://mylogs.cn/littlelearner-llm-k5-knowledge-boundary/</guid>

					<description><![CDATA[一项「受控」的极端实验 现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">一项「受控」的极端实验</h2>



<p class="wp-block-paragraph">现代大语言模型几乎是在「什么都学」的海量语料上训练的，因此外界很难判断：模型表现出的某项能力，究竟是真正「学会」了，还是只是被提示词「唤醒」了既有的知识。一个名为 LittleLearner 的研究项目换了一种思路——直接把训练数据本身限定住。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a818ab48464a&quot;}" data-wp-interactive="core/image" data-wp-key="6a818ab48464a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp" alt="只学小学课本，大模型的能力上限就被锁死了" class="wp-image-5068" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/A_futuristic_abstract_illustra_2026-08-16T08-28-47-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<p class="wp-block-paragraph">研究团队从 FineWeb-Edu 语料出发，经过五道过滤管线，提炼出一份 880 亿 token 的「小学课程库」（LittleCurriculum），严格对齐美国 Common Core 课程标准（幼儿园至五年级，即 K–5）。所有五年级以上才会涉及的概念、事实和词汇，都被明确排除在外。</p>



<h2 class="wp-block-heading">只上过小学的模型</h2>



<p class="wp-block-paragraph">基于这份语料，团队从零训练了三个规格的模型，参数量分别为 6 亿、13 亿和 50 亿，并为每一个都配备了一个使用未过滤语料训练的「对照组」，以便做干净的比较。</p>



<p class="wp-block-paragraph">实验得出了清晰的结论，可以概括为「唤醒，而非习得」：无论是扩大模型规模、做 SFT 加 GRPO 的后期训练，还是在上下文里给示例（in-context learning），都只能放大课程库里已经教过的内容，却无法真正提升课程范围之外（五年级以上）的能力。换句话说，预训练阶段的数据过滤器，设定了模型能力的实际上限。</p>



<h2 class="wp-block-heading">规模、后期训练、上下文学习都救不了</h2>



<p class="wp-block-paragraph">具体来看，扩大模型参数量，确实能提升课程范围内的表现，也能小幅延伸到同一学习轨迹上的问题，但对需要更高阶能力的问题几乎毫无帮助。用 GRPO 把模型训练成数学专精后，K–5 范围内的数学能力显著增强，可即便喂入课程之外的数据，五年级以上的能力缺口依然补不回来。在团队测试的提示条件下，上下文学习也没能为 50 亿参数的 LittleLearner 解锁新的推理能力。</p>



<h2 class="wp-block-heading">为什么这个边界有价值</h2>



<p class="wp-block-paragraph">正因为训练范围被明确定义，研究者才能把模型行为的变化，直接对应到「教了什么」上。他们提出了三个方向：用强化学习检验「能力能否被奖励驱动出来」；观察引入负数等新概念时的学习效率与遗忘；以及把机器和人类儿童放在相同暴露条件下做对比，看两者学分数、解应用题时是否犯类似的错。</p>



<p class="wp-block-paragraph">这项由 Fanfei Li、Wieland Brendel 等人完成的工作（arXiv:2608.13545，2026）提示了一个朴素的道理：当我们在讨论一个大模型「懂不懂」某件事时，答案很可能早在它出生的那一刻，就被训练数据写好了。</p>



<p class="has-small-font-size wp-block-paragraph">来源：LittleLearner 项目团队（arXiv:2608.13545）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
