结构化大模型 TabICL、Limix 和 Nori 比较

  • TabICL:主打大规模表格分类 + 回归,解决传统表格 ICL 样本上限瓶颈,两阶段嵌入,大数据集速度优势最强。
  • LimiX通用结构化基础模型(LDM),一模型做多任务(分类、回归、缺失填充、生成、因果推理),轻量版本 CPU 可用,核心是行列双注意力联合分布建模。
  • Nori回归专精,原生输出预测分布/不确定性,但分类能力弱,上下文样本上限低。

设计思路

TabICL

主打大规模表格预测场景,核心解决传统表格 ICL 模型显存爆炸、无法适配大数据集的痛点,采用两阶段编码架构。第一阶段完成列嵌入、实现行特征压缩,将单行数据转化为固定维度向量;第二阶段基于压缩后的 Embedding 开展 Transformer 上下文学习。该设计将模型计算复杂度从 $O(n^2m)$ 优化至 $O(n^2 + nm^2)$,大幅降低超大表格的显存与算力开销,整体架构优先适配高样本、高维特征的表格数据,预训练侧重分类与回归基础预测任务。

LimiX

定位通用全能型结构化基础模型,核心设计为行列网格双向注意力机制,将每个特征作为独立 Token,同时实现样本内特征交互、同特征跨样本全局交互。区别于单一预测模型,其预训练目标为表格数据联合分布掩码建模,不局限于标签预测。

Nori

专注数值回归任务的专精型 ICL 模型,核心架构为样本间密集注意力,全程围绕数值预测分布建模优化。摒弃了通用表格模型的多任务设计,聚焦工业界主流的营收预测、风险评估、定价回归等业务场景,原生支持预测分布、分位数、置信区间输出,内置可解释性工具,整体设计极致贴合回归任务的工程落地需求,优先保障小样本回归的精度与不确定性建模能力。

优缺点

TabICL

优点:

  • 超大样本适配能力顶尖:支持最高 50 万样本、500 维特征的高维大表格,大数据场景推理速度比传统 TabPFN 快 10 倍,是三者中唯一适配十万级以上表格数据的模型。
  • 分类任务性能优异:在各类表格分类基准数据集上表现最优,零调参即可实现优质效果,适配绝大多数通用表格分类场景。
  • 工程友好性高:兼容 sklearn 接口,开源且许可宽松,开箱即用,无需复杂预处理。

缺点:

  • 任务场景单一:仅支持分类、回归基础预测,不原生支持缺失值填充、表格数据生成、因果推断等进阶任务。
  • 小样本无优势:在几百行小规模数据集上,性能不及 Limix、Nori。
  • 缺失值处理薄弱:无原生缺失值优化能力,依赖前置数据预处理工序。

LimiX

优点:

  • 多任务全能适配:三者中唯一支持预测、缺失值填充、合成数据生成、特征归因、反事实推理的通用模型,一站式覆盖表格全场景任务。
  • 轻量化、低算力:2M 轻量版参数体量极小,可直接在CPU设备运行,低算力场景性价比极高。
  • 原生适配异构数据:天然兼容数值、类别特征,自带缺失值处理能力,大幅降低数据预处理成本。

缺点:

  • 大数据场景效率低:完整行列双向注意力机制计算开销大,数据集超 10 万行后,推理速度远慢于 TabICL。
  • 稳定性与调参门槛高:模型逻辑复杂,多任务切换时性能存在波动,工程调参难度高于另外两款模型。
  • 大样本分类性能偏弱:超大表格分类基准场景下,效果略逊于 TabICL。

Nori

优点:

  • 回归任务专精顶尖:针对数值回归深度优化,在海量回归基准数据集上效果优异,小样本回归冷启动能力极强。
  • 原生支持不确定性估计:可直接输出预测分布、分位数、置信区间,适配需要风险评估、结果置信度的工业场景。
  • 部署极简、生态成熟:适配 CPU 推理,自带 SHAP 可解释性工具。

缺点:

  • 分类能力几乎缺失:非设计主打场景,多分类、二分类任务效果差,不推荐使用。
  • 样本扩展性极差:密集注意力 $O(n^2)$ 计算瓶颈明显,仅适配中小数据集,数万行以上大表格易显存溢出、速度暴跌。
  • 功能单一:无缺失填充、数据生成、因果分析等进阶能力,仅能用于回归预测。

选型推荐

优先选择 TabICL

适配大规模表格预测场景:数据集样本量超 10 万、甚至 50 万,核心需求为表格分类(客户分群、风控识别、异常检测)或通用大规模回归,仅需基础预测能力,无需缺失填充、数据生成等进阶功能,追求高推理速度与高精度。

优先选择 Limix

适配中小体量、多任务复合型场景:数据集规模较小(10 万行以内),需要单模型兼顾多项任务,比如同时完成数据清洗(缺失值填充)、标签预测、合成数据生成、特征归因分析、因果推理;或设备算力有限,需要轻量化模型快速落地、减少预处理成本。

优先选择 Nori

适配工业级精准回归场景:核心业务为数值预测(营收预测、销量预估、定价分析、风险量化),需要输出预测置信区间、不确定性评估结果,追求极简部署、高可解释性,数据集为中小体量,无分类及进阶数据处理需求。