文章摘要
LDM(结构化数据基础模型)是可补足大语言模型短板、面向产业高维数据的平行AI赛道,近年全球科技巨头纷纷加速布局。清华背景团队推出参数仅400M的新一代模型LimiX-2,在三大国际主流基准测试全任务登顶,断层领先谷歌SAP等海外模型,该团队重构了LDM底层技术范式,中国团队已在该关键AI赛道走在世界前列。

近两年AI赛道的热度持续攀升,当大语言模型领域的竞争进入白热化阶段,另一条聚焦结构化数据的AI路线——LDM(结构化数据基础模型)也开始吸引全球头部科技玩家的布局。

就在一众巨头纷纷涌入这条赛道抢位之际,一支来自中国的团队已经率先站稳了行业头部位置。今年9月中旬,海外软件巨头刚发布新一代结构化模型,短短几小时后,由清华背景团队创立的企业就推出了参数仅400M的结构化数据基础模型,直接在三大国际主流基准测试的二分类、多分类、回归等任务中拿下全部第一,展现出断层式的领先优势。

这并非该团队首次在LDM领域拿下国际头部位置。早在去年,团队就推出了国内首个结构化数据基础模型,也曾长期霸榜国际测试榜单,之后团队并未止步于榜单成绩,而是持续深耕底层技术与模型储备,此次推出的新一代模型再次让海内外同行措手不及。

在这支团队看来,真正重要的从来不是单次拿下第一,而是在每一个关键节点都有能力重回行业顶端。作为国内首个结构化数据通用大模型,该系列产品啃下的正是数据背后最珍贵也最难挖掘的“因果规律”。

与部分以目标预测为核心的行级建模路线不同,新一代模型将面向变量关系建模作为核心目标,重点学习跨变量、跨样本的联合依赖结构。同时,团队自建了一套高质量自动化数据合成引擎,让模型先接触足够复杂的数据世界,再处理真实业务场景中的任务。

过去几年,大语言模型已经在文本、语音、视频等领域实现了能力突破,但当AI真正向产业深处渗透,一个长期被掩盖的问题逐渐显现:现实世界远比语言构建的语义世界更加复杂。当前的大语言模型大多基于已经被人类理解、筛选和抽象后的语义化信息,通过编码Token、学习上下文关系形成知识与推理能力,但这类模型处理的本质是已经完成语义转化的现实。

而在产业系统中,还存在另一类长期游离在语义层之外的数据。以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等数十甚至上千个变量会同时变化,共同构成持续演化的高维数据空间,其中大量关键规律并未被人类提前总结为规则、公式或文本知识。产业真正关心的也并非单个变量的数值,而是变量之间的稳定关系、可跨环境复用的规律,以及一个变量变化后整个系统的响应方式。如果将这类数据先转换为文本再交由大语言模型处理,必然会经历一次信息压缩,而生产场景中被压缩的细粒度差异,恰恰是决定预测精度、良率与风险判断的核心信息。

这也正是结构化数据建模与语言建模的本质差异:大语言模型主要学习人类已经表达出来的世界,而LDM则希望直接进入真实世界留下的高维数据空间,从变量关系本身出发理解运行规律,二者属于平行且互补的基础模型路线。既能深入产业场景,又能补足大语言模型对真实数据世界理解的缺口,LDM的发展前景愈发清晰。

随着AI越来越多地进入复杂决策场景,LDM已经成为基础模型体系中越来越重要的能力拼图。近两年,全球科技玩家纷纷加速布局这条赛道:头部科技企业将表格数据基础模型纳入其基础模型版图;另一巨头推出专用模型,探索预训练模型跨表格、跨任务的直接迁移能力;企业软件巨头则动作迅猛,先后推出自研模型、收购相关团队并投入超10亿欧元扩建结构化数据AI研究团队,最新的结构化模型已经正式接入企业核心业务系统,用于现金流预测、供应商风险评估等核心决策任务。

LDM赛道的升温,也让这支中国团队多年深耕的技术方向走到了聚光灯下。作为较早探索结构化数据与因果智能的团队,他们长期致力于解决Scaling规律能否延伸至结构化数据、新型网络能否进一步打开因果建模上限等底层问题,这些偏离传统因果研究路径的探索在当时并不容易。如今两代模型连续冲上国际基准测试前列,也让这条当初看似冒险的技术路线得到了效果验证。

值得注意的是,当前LDM赛道的玩家底层技术路线并不相同。以部分主流模型为代表的路线,核心目标是给定上下文与目标,让模型快速适配新表格并准确预测目标变量,这类路线在分类、回归等任务中表现出色,但当结构化数据模型向更深层次发展,当需求不止于“预测目标的数值”,而是需要理解变量之间的关系、预测变量变化后的系统响应时,这类以目标变量为中心的建模路线就暴露出了局限:为了快速适配任务,数据通常会被压缩为高层表示,部分变量级的细粒度信息会在这个过程中丢失。

而该团队在新一代模型上的核心突破,正是重构了结构化数据模型的底层技术范式。团队提出了上下文机制网络,将结构化数据建模从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题。与传统路线不同,新模型不再将变量关系作为服务于预测的中间信息,而是直接作为模型学习的核心对象,这种底层范式的切换类似大语言模型从单阶段预训练到生成式预训练的演进,核心变化不仅在于测试成绩,更在于模型的学习目标与信息组织方式被重新定义。

要实现这一新的学习目标并非易事。为了让模型真正理解变量之间的相互作用,训练过程不能局限于固定的预测任务。因此,团队提出了上下文条件掩码建模,并升级了自动化合成数据生成引擎,通过不断更换需要遮蔽与预测的变量,倒逼模型从单一目标预测转向学习变量间的条件依赖与联合结构。经过反复训练,模型不再只是学会某一道题的解法,而是逐渐掌握变量之间的相互作用逻辑,不再局限于围绕单个目标变量死磕,而是能够理清整张表格中变量的整体关系。

在底层技术层面,新一代模型还将建模粒度下沉到单元格级别,以单元格作为基础表示单元,保留列身份、具体取值与缺失状态,并支持跨变量、跨样本的信息交互。从数据表示、训练目标到网络计算,整套设计都围绕联合依赖建模展开,在这套框架下,分类、回归、缺失值填补等任务都可以统一为对同一数据模型的不同查询,而持续的联合关系建模也为后续的结构发现乃至因果骨架发现提供了基础。重构学习目标、实现关系学习、保留细粒度特征,三者共同构成了一套完整的技术范式闭环。

一套新技术范式的价值,往往体现在它能否改写模型的能力边界。对于LDM领域来说,比刷新榜单更重要的是能否将能力真正落地到生产环境,而在走向真实场景之前,新一代模型已经在国际基准测试中证明了这条路线的领先性。

在三大国际主流基准测试中,该模型在二分类、多分类与回归任务中均位居第一,领先海外多款同类模型。以其中一项主流评测为例,其分类任务的综合评分达到1917,领先第二名多达143分;回归任务的综合评分同样位居第一,这说明该模型的优势不仅在于分类的准确性,更在于对连续变量间依赖关系的精细建模能力。

新一代模型的性能提升,同样离不开训练数据的支撑。新的学习目标对训练数据的多样性提出了更高要求,因此团队升级了大规模自动化合成数据引擎,覆盖更多的数据分布、交互关系与噪声类型,让模型提前接触更丰富的数据结构,从数据侧支撑能力维度的扩展。

除了分类、回归等预测能力,新一代模型还将能力延伸到了因果发现领域。面对高维复杂数据,传统因果发现方法往往受限于专家先验与统计假设,而在多个公开数据集上,该模型的表现已经领先多种传统因果发现方法。

分类、回归与跨数据泛化都是企业的日常任务,这类榜单检验的是模型面对真实数据时的稳定预测、迁移与决策支撑能力,而这背后指向的正是LDM更长期的能力路径:从预测走向关系建模、因果发现、干预决策,让AI进一步理解真实世界的变量关系、生成机制与变化规律,最终实现通用因果智能。这也正是产业智能化下一阶段最值得关注的方向之一。

2020年大型语言模型的问世,让行业第一次清晰看到,基础模型跨过能力临界点后,AI将从单点任务解决走向通用智能。六年后的今天,通用人工智能已经从遥远的概念逐渐成为可实现的愿景,但AI的进一步发展终究要进入比语言世界复杂得多的真实世界——理解变量间的相互作用、因果关系的传导逻辑,以及微小变化如何影响整个系统。

LDM赛道所指向的,正是这个仍处于早期阶段却可能决定通用人工智能下一阶段能力上限的关键节点:让大模型从理解人类已经表达的知识,进一步走向理解世界运行本身。而在这个决定未来AI能力上限的赛道上,中国团队已经走到了行业前列。

以上内容不代表本平台立场,仅供读者参考