AI预训练找到第三条轴:多猜K次,省6.2倍数据

过去十多年,生成式模型的进步几乎沿着两条路走:把模型做得更大,把数据喂得更多。伊利诺伊大学厄巴纳-香槟分校(UIUC)的一个团队提出,还存在被长期忽视的第三条路——让模型在训练时”多猜几次”。这项名为探索式建模(Explorative Modeling,简称 XM)的方法,论文于 7 月 29 日以预印本形式发布在 arXiv(编号 2607.27372),代码同步开源。

问题出在”平均值”上

研究者用一个直观的例子解释了生成模型的根本难题:如果让模型直接预测”一张狗的图片”,符合要求的答案可能有数十亿张。模型在训练中见过成千上万只不同的狗,而与所有这些图片距离最近的那个预测,恰恰是它们的平均值——一团棕色的模糊色块,看上去根本不像狗。

换成飞镖靶的比喻更清楚:飞镖随机落在靶面各处,如果只允许猜一次、按距离扣分,那么最优解是靶心正中央,而那里几乎从来没有飞镖落下。团队实际训练了一个模型来玩这个游戏,结果它每次都选正中间。用同样方式训练文本模型,模型只会反复输出”the”。

现有的可扩展生成模型都用同一招绕开这个问题:把生成过程拆成许多小步,让每一步只面对大致唯一的答案。自回归模型(例如大语言模型)一次预测一个片段;扩散模型从纯噪声出发,走上百个细小步骤逐渐逼近真实数据。研究者把这种做法称为”生成分解”。

但这一招有代价。模型按单步训练,推理时却要连跑成百上千步,自己不完美的输出被重新当作输入喂回去,误差不断累积——这被称为曝光偏差,也是视频模型跑过十秒就”糊掉”、大语言模型长文本越写越离题的原因。更关键的是,训练方式和推理方式不一致,意味着生成模型始终不是端到端的,而端到端恰恰是深度学习自 AlexNet 以来最重要的经验。

不拆生成,改拆训练

探索式建模换了个拆法:生成过程一步不动,改拆训练循环。每个训练步里,模型生成 K 个候选结果,逐一与真实数据比对,只对最接近的那个做反向传播。最简单的实现就是一个 for 循环,官方仓库里用 --xm_best_of_k K 一个开关即可启用,K=1 就退回原始基线。

回到飞镖游戏:如果允许猜二十次、只算最准的那次,猜正中央立刻变成糟糕策略,最优做法是把猜测铺开到飞镖真正落点上。实验也印证了这一点——随着 K 增大,一个点变成三堆点,模糊色块变成清晰图像,”the the the”变成通顺文本。团队把 K 决定的这项能力称为”生成表达力”,即模型能锁定多少个彼此不同的答案,并认为它与参数量、数据量同等重要,却长期被固化在训练目标里无法扩展。

成绩单:省数据、省算力,越大越明显

团队在不改动任何其他配方(连超参数都没调)的前提下,把探索机制加到现有模型上。在图像生成方面,加入探索后达到原有最强配方 RAE 的最终水平,只用了 6.2 倍更少的数据和 4.1 倍更少的浮点运算量,并在无引导条件下于 ImageNet 256 上取得接近业界最好水平的 1.43 FID。收敛速度还会层层叠加:XRAE 比 RAE 快 6.2 倍,而 RAE 本身比标准 SiT 配方快 47 倍,累计接近 300 倍。在一条调优过的 SiT 基线上,探索把浮点运算效率最高提升 52%,达到同等表现只需 2.5 倍更少的数据。

综合下来,论文给出的整体数字是:浮点运算效率提升 4.1 倍,样本效率提升 6.2 倍,参数效率提升 47%。一个探索五个候选的大模型,表现超过了参数多出 47% 的超大基线。

最值得注意的是收益随规模增长而放大:数据规模扩大时,探索带来的增益从 7% 升到 36%;模型规模扩大时从 13% 升到 23%;算力提高到三倍时,效率增益翻了一倍不止。视频生成上部分模型提升超过 20%,掩码扩散语言模型的困惑度与多样性权衡也优于基线。作者指出,前沿训练所用的算力约为这批实验的一万倍,若趋势成立,论文里的数字更可能是下限。

在机器人任务上,端到端的探索式策略在五项操作任务中匹配或超过扩散策略基线,却只用一次网络前向传播,而基线需要 100 次;在 Maze2D 路径规划中,推理步数减少 16 到 256 倍。

代价与尚待验证的部分

多生成一个候选并非免费。论文估算,前向探索模式下每增加一个候选,成本约相当于标准 Transformer 训练步的三分之一——因为只多了一次前向传播,不需要完整反向传播,候选还能折叠进批次维度并行处理。本质上这是一笔交易:训练时多花算力换取更好的匹配,再通过更快收敛或更少生成步数把这笔开销赚回来。

局限同样明确。图像实验限于 256×256 分辨率的类条件 ImageNet,视频实验只做到 10 帧、128×128,团队坦言更高分辨率的视频实验超出了算力预算。语言方面,掩码扩散语言模型效果较清晰,自回归语言模型则更难改进,作者将其结果描述为”温和”,留待后续工作——而当前主流大语言模型恰恰都是自回归架构。这套方法能否在前沿规模上继续保持算力优势,仍需独立复现来检验。

项目由 UIUC 计算机科学博士生、美国国家科学基金会研究生研究奖学金获得者 Alexi Gladstone 主导,UIUC 教授 Heng Ji 与哈佛大学助理教授 Yilun Du 提供指导与算力支持。代码基于 PyTorch,已发布在 GitHub 上的 alexiglad/XM 仓库。

来源:Alexi Gladstone 个人博客《Explorative Modeling — Unlocking a Third Pretraining Axis and End-to-End Generation》,论文 arXiv:2607.27372


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注