TabFM menggunakan seni bina transformer perhatian hibrid (perhatian baris-lajur berselang-seli) . Tidak seperti data teks yang satu dimensi, data jadual memerlukan pemahaman hubungan merentas baris dan lajur secara serentak. TabFM berselang-seli antara:
Mekanisme dua peringkat ini membina pembenaman dimensi tetap bagi baris dan lajur, membolehkan model digeneralisasikan kepada struktur jadual arbitrer semasa inferens . Pendekatan ini menggabungkan elemen daripada model asas jadual sebelumnya, termasuk perhatian baris/lajur gaya TabPFN dan pembelajaran dalam konteks gaya TabICL
.
TabFM dilatih sepenuhnya pada ratusan juta set data sintetik yang dijana oleh model kausal berstruktur (SCM) . Pendekatan ini mengelakkan masalah kekurangan dan kualiti data jadual sumber terbuka, yang kebanyakannya mengandungi maklumat sensitif atau proprietari yang tidak boleh digunakan secara bebas untuk prapelatihan berskala besar
. Dengan mengawal proses penjanaan data, Google memastikan korpus latihan yang pelbagai dan teragih dengan baik tanpa bergantung pada data perniagaan dunia sebenar
.
TabFM disahkan pada TabArena, sebuah penanda aras kediaman berperingkat Elo untuk kaedah ML jadual yang menampilkan papan pemuka awam di tabarena.ai . Menurut keputusan yang dilaporkan Google:
Skor Elo tepat bergantung pada keadaan papan pemuka langsung, tetapi angka Google sendiri menunjukkan TabFM-Ensemble di atas dalam kedua-dua panel klasifikasi dan regresi . Sehingga awal Julai 2026, kedudukan model tunggal teratas pada papan pemuka klasifikasi TabArena dipegang oleh TabPFN-3 (Elo 1721), dengan kaedah berasaskan ensemble seperti AutoGluon extreme (4j) sebagai siling keseluruhan
. Kemasukan TabFM mengubah landskap kompetitif itu.
TabFM menggunakan model dwi-lesen:
| Komponen | Lesen | Lokasi |
|---|---|---|
| Pemberat model | Lesen bukan komersial | Hugging Face (google/tabfm-1.0.0-pytorch) |
| Kod penggunaan & sampel | Apache 2.0 | GitHub (google-research/tabfm) |
Pemberat model dikeluarkan di bawah lesen bukan komersial, tersedia sumber — bermakna ia bukan sumber terbuka sepenuhnya mengikut definisi OSI atau rangka kerja empat peringkat G7 2026 . Kod inferens dan buku nota sampel, bagaimanapun, menggunakan lesen permisif Apache 2.0
. Corak ini mencerminkan pendekatan Google dengan model penyelidikan lain seperti Gemma (yang kemudiannya beralih ke Apache 2.0 untuk generasi baharu
) dan konsisten dengan cara Prior Labs mengeluarkan pemberat model TabPFN di bawah terma bukan komersial
.
Google merancang untuk mengintegrasikan TabFM terus ke dalam BigQuery dalam beberapa minggu selepas pengumuman . Pengguna BigQuery akan dapat menjalankan klasifikasi dan regresi zero-shot menggunakan arahan SQL
AI.PREDICT, mengikut corak sintaks fungsi inferens terurus sedia ada BigQuery ML (serupa dengan AI.FORECAST untuk TimesFM) . Sintaks yang dijangka adalah:
SELECT * FROM AI.PREDICT(
MODEL tabfm,
TABLE your_data
)
Integrasi ini akan membolehkan pasukan data menggunakan ramalan TabFM terus dalam SQL tanpa mengurus infrastruktur ML yang berasingan atau penggunaan model . Sehingga tarikh pengumuman (1 Julai 2026), integrasi ini digambarkan sebagai akan berlaku tetapi belum lagi dicerminkan dalam nota keluaran BigQuery
. Ekosistem BigQuery ML sedia ada Google sudah menyokong inferens terurus untuk TimesFM (
AI.FORECAST), model tersuai (ML.PREDICT), dan model terbuka pihak ketiga dari Hugging Face ; TabFM akan menjadi model asas jadual pertama yang menerima pintasan
AI.PREDICT terbina dalam.
AI.PREDICT yang didokumenkan untuk BigQuery ML kini menggunakan ML.PREDICT dengan objek model berdaftar AI.PREDICT untuk TabFM mungkin merupakan pintasan terbina dalam baharu yang serupa dengan AI.FORECAST untuk TimesFM, belum lagi didokumenkan dalam nota keluaran setakat penulisan ini.