<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>预测 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e9%a2%84%e6%b5%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 04 Aug 2026 18:11:07 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>大模型输给 50 年前的算法，问题出在维度</title>
		<link>https://mylogs.cn/llm-fail-tabular-prediction-dimension/</link>
					<comments>https://mylogs.cn/llm-fail-tabular-prediction-dimension/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 18:10:54 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI研究]]></category>
		<category><![CDATA[arXiv论文]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[表格数据]]></category>
		<category><![CDATA[预测]]></category>
		<guid isPermaLink="false">https://mylogs.cn/llm-fail-tabular-prediction-dimension/</guid>

					<description><![CDATA[你要是把一张几百行的表格丢给最强的大模型，让它照着已有数据预测新样本属于哪一类，结果大概率不如一个几十年前就写 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是把一张几百行的表格丢给最强的大模型，让它照着已有数据预测新样本属于哪一类，结果大概率不如一个几十年前就写好的老算法。这件事在机器学习圈子里不算秘密，但一直没人说清楚原因。8 月 3 日提交到 arXiv 的一篇论文，给出了一个相当明确的答案：问题出在数据的维度上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7272dd02acc&quot;}" data-wp-interactive="core/image" data-wp-key="6a7272dd02acc" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1600" height="900" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header.webp" alt="大模型输给 50 年前的算法，问题出在维度" class="wp-image-3564" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header.webp 1600w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-768x432.webp 768w, https://mylogs.cn/wp-content/uploads/2026/08/99a87eb2e9f9f346804d6c350c29c201_header-1536x864.webp 1536w" sizes="(max-width: 1600px) 100vw, 1600px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：论文 arXiv:2608.02412 图 1</figcaption></figure>





<p class="wp-block-paragraph">论文题为《Why Large Language Models Fail at Tabular Prediction》，编号 arXiv:2608.02412，作者是 Fundamental Technologies 的 Marta Garnelo 和 Voylab 的 Wojciech M. Czarnecki。</p>



<h2 class="wp-block-heading">实验只测最纯粹的那一层</h2>



<p class="wp-block-paragraph">这项研究刻意避开了两种常见做法：不追求刷出最高分，也不提出新架构、新提示方案或新智能体框架。</p>



<p class="wp-block-paragraph">它把一个前沿大模型放进最纯粹的推理状态来观察——单轮对话，提示里一次性塞进完整的训练集和测试集，没有系统提示词，不调用任何工具，不搭多轮推理，也不做微调，只让模型一次性生成所有测试点的类别。</p>



<p class="wp-block-paragraph">在这个设定下，团队系统性地检验了五个可能的失败原因：一是模型处理不了带噪声或线性不可分的数据；二是逗号分隔格式把数据拉成一行，模糊了列结构；三是数值被切成词元的方式有问题；四是单次查询里要分类的测试点太多；五是输入数据的维度，也就是特征数量太高。</p>



<p class="wp-block-paragraph">前四个假设全部被对照实验证伪。换更结构化的输入格式没用，改数值切分策略没用，调整单次查询的测试点数量同样没用。</p>



<h2 class="wp-block-heading">只有大模型怕维度</h2>



<p class="wp-block-paragraph">站得住的只剩下维度这一条，而它的证据相当硬。</p>



<p class="wp-block-paragraph">研究者对 31 个基准数据集做了随机线性投影，逐步改变输入的维度。结果是：参与对比的九种方法里，大模型是唯一一个准确率随维度上升而下降的，其余每一个经典基线要么持平，要么反而变好。</p>



<p class="wp-block-paragraph">为了进一步刻画这种行为，团队又把大模型的预测结果和 252 种不同配置的经典模型做了逐点比对。在二维数据上，大模型的预测方式高度接近基于距离的局部方法，网格一致性最高达到 91.6%——也就是说，它在低维时的行为像是在&#8221;找最近的邻居&#8221;。但一旦进入高维空间，没有任何一种经典模型能复现它的预测，哪怕给这些模型加上精心调节过、随维度变化的噪声也做不到。</p>



<p class="wp-block-paragraph">作者在结论里态度很克制：他们没有声称找到了模型内部的运作机制，只是证明大模型的这项能力会随维度以一种独特的方式瓦解，而这种瓦解不是任何&#8221;被噪声污染的经典学习器&#8221;能模仿出来的。机制本身，留作开放问题。</p>



<h2 class="wp-block-heading">一个被反复断言、却没被解释的前提</h2>



<p class="wp-block-paragraph">这项研究真正的价值，在于它补上了一块一直缺失的论证。</p>



<p class="wp-block-paragraph">过去几年，表格基础模型（专门为表格数据训练的预测模型）发展得很快，而这个方向成立的前提就是&#8221;通用大模型不适合干这件事&#8221;。问题在于，这个前提通常只是被断言，没有被解释。论文开头那张图给出的对照很直观：在 11 个精选的表格任务上，大模型的平均归一化准确率明显低于那些比 Transformer 架构早了几十年的传统方法。</p>



<p class="wp-block-paragraph">作者还指出了一个更值得警惕的行业习惯：人们主要通过跑分认识这些模型，而当分数不好看时，标准反应是在模型外面加东西——检索、工具调用、智能体循环——而不是退回去追问，这个核心模型到底做不到什么、为什么做不到。</p>



<h2 class="wp-block-heading">我的判断</h2>



<p class="wp-block-paragraph">这个结论对实际选型的意义可能比看上去更大。</p>



<p class="wp-block-paragraph">企业里最常见的预测任务，恰恰是表格类的：风控评分、流失预测、需求量估计。而这类数据的特征维度动辄几十上百，正好落在大模型失效最明显的区间里。换句话说，通用大模型在语言和代码上的强势，并不能顺理成章地迁移过来——它在这里输的不是一点点，而是输给了年纪比它大得多的方法。</p>



<p class="wp-block-paragraph">结论不是&#8221;别用大模型&#8221;，而是别默认它什么都能接。表格预测这块，成熟工具链依然是更理性的答案；至于高维下那种独特的失效方式究竟在暴露什么，得等后续研究来回答了。</p>



<p class="wp-block-paragraph">你手上的业务数据，有多少是躺在表格里的？</p>



<p class="has-small-font-size wp-block-paragraph">来源：arXiv 论文 2608.02412（Marta Garnelo、Wojciech M. Czarnecki），Hacker News</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/llm-fail-tabular-prediction-dimension/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
