<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>开源研究 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%bc%80%e6%ba%90%e7%a0%94%e7%a9%b6/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 01 Aug 2026 18:49:50 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI预训练找到第三条轴：多猜K次，省6.2倍数据</title>
		<link>https://mylogs.cn/ai%e9%a2%84%e8%ae%ad%e7%bb%83%e6%89%be%e5%88%b0%e7%ac%ac%e4%b8%89%e6%9d%a1%e8%bd%b4%ef%bc%9a%e5%a4%9a%e7%8c%9ck%e6%ac%a1%ef%bc%8c%e7%9c%816-2%e5%80%8d%e6%95%b0%e6%8d%ae/</link>
					<comments>https://mylogs.cn/ai%e9%a2%84%e8%ae%ad%e7%bb%83%e6%89%be%e5%88%b0%e7%ac%ac%e4%b8%89%e6%9d%a1%e8%bd%b4%ef%bc%9a%e5%a4%9a%e7%8c%9ck%e6%ac%a1%ef%bc%8c%e7%9c%816-2%e5%80%8d%e6%95%b0%e6%8d%ae/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 01 Aug 2026 18:49:39 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI预训练]]></category>
		<category><![CDATA[Explorative Modeling]]></category>
		<category><![CDATA[开源研究]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[生成模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai%e9%a2%84%e8%ae%ad%e7%bb%83%e6%89%be%e5%88%b0%e7%ac%ac%e4%b8%89%e6%9d%a1%e8%bd%b4%ef%bc%9a%e5%a4%9a%e7%8c%9ck%e6%ac%a1%ef%bc%8c%e7%9c%816-2%e5%80%8d%e6%95%b0%e6%8d%ae/</guid>

					<description><![CDATA[过去十多年，生成式模型的进步几乎沿着两条路走：把模型做得更大，把数据喂得更多。伊利诺伊大学厄巴纳-香槟分校（U [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去十多年，生成式模型的进步几乎沿着两条路走：把模型做得更大，把数据喂得更多。伊利诺伊大学厄巴纳-香槟分校（UIUC）的一个团队提出，还存在被长期忽视的第三条路——让模型在训练时&#8221;多猜几次&#8221;。这项名为探索式建模（Explorative Modeling，简称 XM）的方法，论文于 7 月 29 日以预印本形式发布在 arXiv（编号 2607.27372），代码同步开源。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729bb75c086&quot;}" data-wp-interactive="core/image" data-wp-key="6a729bb75c086" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/bbbc5edfdbb642423fad5ce343d4241b_header.webp" alt="AI预训练找到第三条轴：多猜K次，省6.2倍数据" class="wp-image-3191" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/bbbc5edfdbb642423fad5ce343d4241b_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/bbbc5edfdbb642423fad5ce343d4241b_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/bbbc5edfdbb642423fad5ce343d4241b_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/bbbc5edfdbb642423fad5ce343d4241b_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Alexi Gladstone / Explorative Modeling 项目主页</figcaption></figure>





<h2 class="wp-block-heading">问题出在&#8221;平均值&#8221;上</h2>



<p class="wp-block-paragraph">研究者用一个直观的例子解释了生成模型的根本难题：如果让模型直接预测&#8221;一张狗的图片&#8221;，符合要求的答案可能有数十亿张。模型在训练中见过成千上万只不同的狗，而与所有这些图片距离最近的那个预测，恰恰是它们的平均值——一团棕色的模糊色块，看上去根本不像狗。</p>



<p class="wp-block-paragraph">换成飞镖靶的比喻更清楚：飞镖随机落在靶面各处，如果只允许猜一次、按距离扣分，那么最优解是靶心正中央，而那里几乎从来没有飞镖落下。团队实际训练了一个模型来玩这个游戏，结果它每次都选正中间。用同样方式训练文本模型，模型只会反复输出&#8221;the&#8221;。</p>



<p class="wp-block-paragraph">现有的可扩展生成模型都用同一招绕开这个问题：把生成过程拆成许多小步，让每一步只面对大致唯一的答案。自回归模型（例如大语言模型）一次预测一个片段；扩散模型从纯噪声出发，走上百个细小步骤逐渐逼近真实数据。研究者把这种做法称为&#8221;生成分解&#8221;。</p>



<p class="wp-block-paragraph">但这一招有代价。模型按单步训练，推理时却要连跑成百上千步，自己不完美的输出被重新当作输入喂回去，误差不断累积——这被称为曝光偏差，也是视频模型跑过十秒就&#8221;糊掉&#8221;、大语言模型长文本越写越离题的原因。更关键的是，训练方式和推理方式不一致，意味着生成模型始终不是端到端的，而端到端恰恰是深度学习自 AlexNet 以来最重要的经验。</p>



<h2 class="wp-block-heading">不拆生成，改拆训练</h2>



<p class="wp-block-paragraph">探索式建模换了个拆法：生成过程一步不动，改拆训练循环。每个训练步里，模型生成 K 个候选结果，逐一与真实数据比对，只对最接近的那个做反向传播。最简单的实现就是一个 for 循环，官方仓库里用 <code>--xm_best_of_k K</code> 一个开关即可启用，K=1 就退回原始基线。</p>



<p class="wp-block-paragraph">回到飞镖游戏：如果允许猜二十次、只算最准的那次，猜正中央立刻变成糟糕策略，最优做法是把猜测铺开到飞镖真正落点上。实验也印证了这一点——随着 K 增大，一个点变成三堆点，模糊色块变成清晰图像，&#8221;the the the&#8221;变成通顺文本。团队把 K 决定的这项能力称为&#8221;生成表达力&#8221;，即模型能锁定多少个彼此不同的答案，并认为它与参数量、数据量同等重要，却长期被固化在训练目标里无法扩展。</p>



<h2 class="wp-block-heading">成绩单：省数据、省算力，越大越明显</h2>



<p class="wp-block-paragraph">团队在不改动任何其他配方（连超参数都没调）的前提下，把探索机制加到现有模型上。在图像生成方面，加入探索后达到原有最强配方 RAE 的最终水平，只用了 6.2 倍更少的数据和 4.1 倍更少的浮点运算量，并在无引导条件下于 ImageNet 256 上取得接近业界最好水平的 1.43 FID。收敛速度还会层层叠加：XRAE 比 RAE 快 6.2 倍，而 RAE 本身比标准 SiT 配方快 47 倍，累计接近 300 倍。在一条调优过的 SiT 基线上，探索把浮点运算效率最高提升 52%，达到同等表现只需 2.5 倍更少的数据。</p>



<p class="wp-block-paragraph">综合下来，论文给出的整体数字是：浮点运算效率提升 4.1 倍，样本效率提升 6.2 倍，参数效率提升 47%。一个探索五个候选的大模型，表现超过了参数多出 47% 的超大基线。</p>



<p class="wp-block-paragraph">最值得注意的是收益随规模增长而放大：数据规模扩大时，探索带来的增益从 7% 升到 36%；模型规模扩大时从 13% 升到 23%；算力提高到三倍时，效率增益翻了一倍不止。视频生成上部分模型提升超过 20%，掩码扩散语言模型的困惑度与多样性权衡也优于基线。作者指出，前沿训练所用的算力约为这批实验的一万倍，若趋势成立，论文里的数字更可能是下限。</p>



<p class="wp-block-paragraph">在机器人任务上，端到端的探索式策略在五项操作任务中匹配或超过扩散策略基线，却只用一次网络前向传播，而基线需要 100 次；在 Maze2D 路径规划中，推理步数减少 16 到 256 倍。</p>



<h2 class="wp-block-heading">代价与尚待验证的部分</h2>



<p class="wp-block-paragraph">多生成一个候选并非免费。论文估算，前向探索模式下每增加一个候选，成本约相当于标准 Transformer 训练步的三分之一——因为只多了一次前向传播，不需要完整反向传播，候选还能折叠进批次维度并行处理。本质上这是一笔交易：训练时多花算力换取更好的匹配，再通过更快收敛或更少生成步数把这笔开销赚回来。</p>



<p class="wp-block-paragraph">局限同样明确。图像实验限于 256×256 分辨率的类条件 ImageNet，视频实验只做到 10 帧、128×128，团队坦言更高分辨率的视频实验超出了算力预算。语言方面，掩码扩散语言模型效果较清晰，自回归语言模型则更难改进，作者将其结果描述为&#8221;温和&#8221;，留待后续工作——而当前主流大语言模型恰恰都是自回归架构。这套方法能否在前沿规模上继续保持算力优势，仍需独立复现来检验。</p>



<p class="wp-block-paragraph">项目由 UIUC 计算机科学博士生、美国国家科学基金会研究生研究奖学金获得者 Alexi Gladstone 主导，UIUC 教授 Heng Ji 与哈佛大学助理教授 Yilun Du 提供指导与算力支持。代码基于 PyTorch，已发布在 GitHub 上的 alexiglad/XM 仓库。</p>



<p class="wp-block-paragraph">来源：Alexi Gladstone 个人博客《Explorative Modeling — Unlocking a Third Pretraining Axis and End-to-End Generation》，论文 arXiv:2607.27372</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/ai%e9%a2%84%e8%ae%ad%e7%bb%83%e6%89%be%e5%88%b0%e7%ac%ac%e4%b8%89%e6%9d%a1%e8%bd%b4%ef%bc%9a%e5%a4%9a%e7%8c%9ck%e6%ac%a1%ef%bc%8c%e7%9c%816-2%e5%80%8d%e6%95%b0%e6%8d%ae/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
