你要是把一张几百行的表格丢给最强的大模型,让它照着已有数据预测新样本属于哪一类,结果大概率不如一个几十年前就写好的老算法。这件事在机器学习圈子里不算秘密,但一直没人说清楚原因。8 月 3 日提交到 arXiv 的一篇论文,给出了一个相当明确的答案:问题出在数据的维度上。

论文题为《Why Large Language Models Fail at Tabular Prediction》,编号 arXiv:2608.02412,作者是 Fundamental Technologies 的 Marta Garnelo 和 Voylab 的 Wojciech M. Czarnecki。
实验只测最纯粹的那一层
这项研究刻意避开了两种常见做法:不追求刷出最高分,也不提出新架构、新提示方案或新智能体框架。
它把一个前沿大模型放进最纯粹的推理状态来观察——单轮对话,提示里一次性塞进完整的训练集和测试集,没有系统提示词,不调用任何工具,不搭多轮推理,也不做微调,只让模型一次性生成所有测试点的类别。
在这个设定下,团队系统性地检验了五个可能的失败原因:一是模型处理不了带噪声或线性不可分的数据;二是逗号分隔格式把数据拉成一行,模糊了列结构;三是数值被切成词元的方式有问题;四是单次查询里要分类的测试点太多;五是输入数据的维度,也就是特征数量太高。
前四个假设全部被对照实验证伪。换更结构化的输入格式没用,改数值切分策略没用,调整单次查询的测试点数量同样没用。
只有大模型怕维度
站得住的只剩下维度这一条,而它的证据相当硬。
研究者对 31 个基准数据集做了随机线性投影,逐步改变输入的维度。结果是:参与对比的九种方法里,大模型是唯一一个准确率随维度上升而下降的,其余每一个经典基线要么持平,要么反而变好。
为了进一步刻画这种行为,团队又把大模型的预测结果和 252 种不同配置的经典模型做了逐点比对。在二维数据上,大模型的预测方式高度接近基于距离的局部方法,网格一致性最高达到 91.6%——也就是说,它在低维时的行为像是在”找最近的邻居”。但一旦进入高维空间,没有任何一种经典模型能复现它的预测,哪怕给这些模型加上精心调节过、随维度变化的噪声也做不到。
作者在结论里态度很克制:他们没有声称找到了模型内部的运作机制,只是证明大模型的这项能力会随维度以一种独特的方式瓦解,而这种瓦解不是任何”被噪声污染的经典学习器”能模仿出来的。机制本身,留作开放问题。
一个被反复断言、却没被解释的前提
这项研究真正的价值,在于它补上了一块一直缺失的论证。
过去几年,表格基础模型(专门为表格数据训练的预测模型)发展得很快,而这个方向成立的前提就是”通用大模型不适合干这件事”。问题在于,这个前提通常只是被断言,没有被解释。论文开头那张图给出的对照很直观:在 11 个精选的表格任务上,大模型的平均归一化准确率明显低于那些比 Transformer 架构早了几十年的传统方法。
作者还指出了一个更值得警惕的行业习惯:人们主要通过跑分认识这些模型,而当分数不好看时,标准反应是在模型外面加东西——检索、工具调用、智能体循环——而不是退回去追问,这个核心模型到底做不到什么、为什么做不到。
我的判断
这个结论对实际选型的意义可能比看上去更大。
企业里最常见的预测任务,恰恰是表格类的:风控评分、流失预测、需求量估计。而这类数据的特征维度动辄几十上百,正好落在大模型失效最明显的区间里。换句话说,通用大模型在语言和代码上的强势,并不能顺理成章地迁移过来——它在这里输的不是一点点,而是输给了年纪比它大得多的方法。
结论不是”别用大模型”,而是别默认它什么都能接。表格预测这块,成熟工具链依然是更理性的答案;至于高维下那种独特的失效方式究竟在暴露什么,得等后续研究来回答了。
你手上的业务数据,有多少是躺在表格里的?
来源:arXiv 论文 2608.02412(Marta Garnelo、Wojciech M. Czarnecki),Hacker News