AI资讯 / 产业

产业 / 媒体

填补LLM无法处理结构化数据的空白

IEEE Spectrum AI

大型语言模型(LLM)在生成文本、图像乃至解决复杂数学问题方面表现出色,却在处理结构化表格数据时屡屡碰壁。这一盲区恰恰覆盖了企业最核心的数据资产——银行交易记录、临床试验数据、营销指标等无不以行列形式存储于电子表格中。AI初创公司Fundamental于2026年2月携2.75亿美元融资正式亮相,推出专为表格数据设计的基础模型NEXUS,开创了「大型表格模型」(LTM)这一新赛道。与依赖梯度提升决策树的传统机器学习方案不同,NEXUS通过在海量多样化数据库上预训练,能够跨场景完成预测任务,无需针对每个用例耗费数月进行专项调优。目前,亚马逊云服务已将NEXUS嵌入Amazon SageMaker平台,谷歌、Mastercard等机构也相继推出类似技术,LTM赛道正迅速升温。

LLM之所以难以处理表格数据,根源在于其架构设计。语言天然具有顺序性,改变词序往往会改变甚至破坏句子含义,而LLM的核心机制正是预测线性序列中的下一个值。但电子表格中的数据并不遵循这一逻辑——无论如何调换行列顺序,数据的实际含义保持不变。这种与线性顺序无关的特性,使LLM在面对表格时几乎无从下手。阿姆斯特丹高级AI研究员Boris van Breugel指出,结构化数据长期被忽视还有一层人类偏见:「人们喜欢看图像、视频和ChatGPT的回答,但表格数据因为不够直观而一直落后。」

Fundamental CEO Jeremy Fraenkel进一步强调了确定性预测的重要性。LLM的一大特点是对输入的微小变化极为敏感,输出结果随之波动——这在创意写作场景中或许是优点,但在判断一笔交易是否存在欺诈时,模型必须给出稳定一致的结论。LTM正是为此而生:它不仅处理数值本身,还同时学习数值所代表的含义、所属类别,以及与同列其他数据之间的统计关联,从而实现对结构化数据更准确的推理与预测。

在训练数据的获取上,Fundamental面临的挑战远比LLM开发者更为复杂。自然语言数据在互联网上俯拾皆是且结构相对统一,而表格数据不仅分散、敏感,不同领域的数据集之间几乎没有共性可言——生物学数据集与金融数据集的差异之大,使得通用预训练极为困难。为此,Fundamental通过合作授权获取专有数据集,结合高质量公开数据及数据增强技术,构建了覆盖数十亿张表格的训练语料库。值得注意的是,NEXUS采用机密计算架构,Fundamental在物理层面无法访问客户数据,更不会将其用于训练。

正是这一隐私保护特性,促成了NEXUS与亚马逊云服务的深度合作。2026年6月,AWS将NEXUS嵌入Amazon SageMaker——这一被业界视为安全机器学习默认操作系统的平台——使NEXUS能够直接在客户数据所在环境中运行,而非要求客户将敏感数据导出至外部模型。Fraenkel将其定位为「一级合作伙伴关系」,NEXUS在AWS生态中如同原生解决方案般存在,未来还将进一步扩展至更多数据环境。

LTM赛道的竞争正在全面提速。2026年3月,金融风控公司Feedzai与万事达卡分别推出面向金融场景的专有LTM技术;6月,谷歌发布TabFM,完全基于数亿条合成数据集训练。学术界同样活跃,FlexTab、TabICL、iLTM等多个研究型LTM在过去一年相继问世。van Breugel预判,未来大多数数据处理与分析工作将由自动化系统完成,无论是LLM、LTM还是两者的结合。Fraenkel则将两类模型比作人类大脑的左右半球:LLM擅长推理、理解与文本摘要,LTM精于数字、统计与模式识别,两者协同才能释放真正强大的潜力。

要点

  • LLM因架构上依赖线性序列预测,天然不适合处理行列顺序无关的表格数据,这一结构性缺陷催生了LTM这一新型基础模型。
  • Fundamental的NEXUS模型通过在数十亿张多样化表格上预训练,可跨场景完成预测任务,相比传统梯度提升算法大幅降低了针对单一用例的调优成本。
  • NEXUS采用机密计算架构,已被嵌入Amazon SageMaker,实现了在客户数据本地环境中运行,兼顾性能与数据隐私。
  • 谷歌、Mastercard、Feedzai等机构相继入局,LTM赛道在2026年上半年迅速从单一玩家走向多方竞争格局。
  • 研究人员预测,LLM与LTM的协同将成为未来AI数据分析的主流范式,两者分别承担文本理解与数值推理的不同职能。
查看原始来源

原始标题:Large Tabular Models Excel Where LLMs Fail

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。