一张企业数据表有上百万行、成千上万列时,传统流程往往要为它单独训练和调参。Prior Labs 新发布的 TabPFN-3.5,想把这件事做得更像使用通用大模型:先学会处理各种表格任务,再直接用于新的分类或回归问题。作者称,它目前同时位居 TabArena 和 BeyondArena 两项表格模型榜单首位,并可处理最多 100 万行、2 万个特征——特征就是年龄、地区、交易次数这类供模型判断的输入列。
最值得注意的是复杂表格上的表现。发布信息称,在 BeyondArena 中,TabPFN-3.5 面对文本丰富、高基数和高维数据时,较此前最强基线高 250 个 Elo 分,较此前总榜领先者高 150 分。高基数是指一列里有大量不同取值,例如商品编号;Elo 则按模型成对胜负计算相对排名,分差只适用于同一榜单规则。系列还包括速度据称提升 6 倍、仍处 alpha 阶段的 Fast 版,以及用更多计算换取更高准确率的 API 版 Thinking;后者据称又比基础版高 20 个 BeyondArena Elo 分和 44 个 TabArena Elo 分。上述结果来自发布帖,材料未披露独立复核情况。