TabFM 是 Google Research 推出的零样本表格基础模型,无需针对新数据集训练、调参或特征工程,单次前向传播即可完成分类与回归预测。 该模型采用创新的交替行列注意力 Transformer 架构,同时在行和列维度捕捉依赖关系,从而理解任意表格结构。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's TabFM, how does it perform zero-shot classification and regression on tabular da. Article summary: Here is a comprehensive, source-backed overview of TabFM.. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026 年 7 月 1 日,Google Research 正式发布了 TabFM——一个专为表格数据打造的基础模型,能够以零样本方式对从未见过的新表格执行分类与回归预测,完全无需微调、训练或手动特征工程 。TabFM 将表格预测任务重新定义为上下文学习问题:它将整个数据集——包含历史样例与待预测目标行——拼接成一个统一的上下文提示,通过单次前向传播直接输出预测结果
。
TabFM 采用混合注意力(交替行列)Transformer 架构 。与一维文本数据不同,表格数据需要同时理解行与列之间的关系。TabFM 的核心创新在于交替执行两种注意力操作:
这种两步机制能够构建行与列的固定维度嵌入表示,使得模型在推理时能够泛化到任意的表格结构 。该架构融合了此前 TabPFN 的交替行列注意力与 TabICL 的上下文学习方法
。
TabFM 的训练数据完全来自数亿个通过结构因果模型生成的合成数据集 。这一策略巧妙避开了开源表格数据稀缺和质量参差不齐的问题——许多真实世界表格数据包含敏感或商业机密信息,无法自由用于大规模预训练
。通过掌控数据生成过程,Google 在完全不依赖真实业务数据的前提下,构建了一个多样且分布均衡的训练语料库
。
TabFM 在 TabArena 上完成了验证。TabArena 是一个基于 Elo 评分的动态表格机器学习基准测试,其公开排行榜可访问 tabarena.ai 。根据 Google 公布的测试结果:
具体 Elo 分数取决于实时排行榜状态,但 Google 官方数据显示 TabFM-Ensemble 在分类与回归两个面板中均排名第一 。截至 2026 年 7 月初,TabArena 分类排行榜上单模型最佳成绩由 TabPFN-3(Elo 1721)保持,而集成方法(如 AutoGluon extreme 4h)则作为天花板存在
。TabFM 的加入正在改变这一竞争格局。
TabFM 采用双重许可模式:
| 组件 | 许可类型 | 获取地址 |
|---|---|---|
| 模型权重 | 非商业许可 | Hugging Face(google/tabfm-1.0.0-pytorch) |
| 使用代码与示例 | Apache 2.0 | GitHub(google-research/tabfm) |
模型权重采用非商业、源代码可用许可发布——这意味着根据 OSI 定义或 G7 2026 年四层框架,TabFM 并非完全开源模型 。不过,推理代码和示例笔记本则采用了较为宽松的 Apache 2.0 许可
。这一模式与 Google 此前对 Gemma 等研究模型的处理方式一致(部分 Gemma 后续版本迁移至 Apache 2.0
),也与 Prior Labs 以非商业条款发布 TabPFN 模型权重的做法类似
。
Google 计划在公告发布后的数周内将 TabFM 直接集成到 BigQuery 中 。届时 BigQuery 用户可通过
AI.PREDICTSQL 命令执行零样本分类与回归,其语法模式对标 BigQuery ML 已有的托管推理函数(类似 TimesFM 的 AI.FORECAST)。预期语法如下:
SELECT * FROM AI.PREDICT(
MODEL tabfm,
TABLE your_data
)
这一集成意味着数据团队无需管理独立的机器学习基础设施或模型部署,直接通过 SQL 即可应用 TabFM 预测 。截至公告日(2026 年 7 月 1 日),该集成被描述为“即将推出”,但尚未出现在 BigQuery 发布说明中
。Google 现有的 BigQuery ML 生态已支持 TimesFM 的
AI.FORECAST、自定义模型的 ML.PREDICT 以及 Hugging Face 第三方开放模型 ;TabFM 将是首个获得内置
AI.PREDICT 快捷方式的表格基础模型。
ML.PREDICT 函数需要注册模型对象 AI.PREDICT 语法可能是对标 TimesFM AI.FORECAST 的全新内置快捷命令,截至本文撰稿时尚未出现在发布说明中。Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
TabFM 是 Google Research 推出的零样本表格基础模型,无需针对新数据集训练、调参或特征工程,单次前向传播即可完成分类与回归预测。
TabFM 是 Google Research 推出的零样本表格基础模型,无需针对新数据集训练、调参或特征工程,单次前向传播即可完成分类与回归预测。 该模型采用创新的交替行列注意力 Transformer 架构,同时在行和列维度捕捉依赖关系,从而理解任意表格结构。
TabFM 完全基于数亿个由结构因果模型生成的合成数据集进行训练,避开了真实表格数据稀缺和隐私受限问题。