TabFM là mô hình nền tảng bảng tính zero shot của Google, thực hiện phân loại và hồi quy trên các bảng chưa từng thấy chỉ trong một lượt truyền xuôi, sử dụng học trong ngữ cảnh với kiến trúc chú ý hàng cột luân phiên. Mô hình được huấn luyện hoàn toàn trên hàng trăm triệu bộ dữ liệu tổng hợp do các mô hình nhân quả...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's TabFM, how does it perform zero-shot classification and regression on tabular da. Article summary: Here is a comprehensive, source-backed overview of TabFM.. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Vào ngày 1 tháng 7 năm 2026, Google Research đã giới thiệu TabFM, một mô hình nền tảng (foundation model) dành cho dữ liệu dạng bảng (tabular data), có khả năng thực hiện phân loại và hồi quy zero-shot trên các bảng dữ liệu chưa từng thấy trước đây — hoàn toàn không cần huấn luyện, tinh chỉnh hay kỹ thuật đặc trưng thủ công . Mô hình này định hình lại bài toán dự đoán trên bảng dữ liệu như một vấn đề học trong ngữ cảnh (in-context learning): nó đọc toàn bộ tập dữ liệu, bao gồm cả các mẫu lịch sử và hàng cần dự đoán, như một ngữ cảnh duy nhất và tạo ra kết quả chỉ trong một lần truyền xuôi (single forward pass)
.
TabFM sử dụng một kiến trúc transformer lai ghép (hybrid-attention) với cơ chế chú ý luân phiên giữa hàng và cột . Không giống như dữ liệu văn bản chỉ có một chiều, dữ liệu dạng bảng yêu cầu hiểu đồng thời mối quan hệ giữa các hàng và các cột. TabFM luân phiên sự chú ý giữa:
Cơ chế hai giai đoạn này xây dựng các vector nhúng (embeddings) có chiều cố định cho các hàng và cột, cho phép mô hình tổng quát hóa với các cấu trúc bảng tùy ý tại thời điểm suy luận . Phương pháp này kết hợp các yếu tố từ các mô hình nền tảng bảng tính trước đó, bao gồm cơ chế chú ý hàng/cột kiểu TabPFN và học trong ngữ cảnh kiểu TabICL
.
TabFM được huấn luyện hoàn toàn trên hàng trăm triệu bộ dữ liệu tổng hợp được tạo ra bởi các mô hình nhân quả cấu trúc (SCMs) . Cách tiếp cận này giúp Google vượt qua vấn đề khan hiếm và chất lượng thấp của dữ liệu bảng tính mã nguồn mở, vốn thường chứa thông tin nhạy cảm hoặc độc quyền không thể sử dụng tự do cho việc tiền huấn luyện quy mô lớn
. Bằng cách kiểm soát quy trình tạo dữ liệu, Google đảm bảo một kho dữ liệu huấn luyện đa dạng và có sự phân bố tốt mà không cần dựa vào dữ liệu kinh doanh thực tế
.
TabFM đã được kiểm chứng trên TabArena, một chuẩn mực (benchmark) sống động, xếp hạng bằng Elo dành cho các phương pháp ML trên dữ liệu bảng, với bảng xếp hạng công khai tại tabarena.ai . Dựa trên các kết quả được Google báo cáo:
Điểm Elo chính xác phụ thuộc vào trạng thái hiện tại của bảng xếp hạng, nhưng các số liệu từ Google cho thấy TabFM-Ensemble đứng đầu ở cả hai bảng phân loại và hồi quy . Tính đến đầu tháng 7 năm 2026, vị trí dẫn đầu cho mô hình đơn lẻ trên bảng xếp hạng phân loại của TabArena thuộc về TabPFN-3 (Elo 1721), trong khi các phương pháp dựa trên ensemble như AutoGluon extreme (4h) là giới hạn trên tổng thể
. Sự xuất hiện của TabFM đang làm thay đổi cục diện cạnh tranh này.
TabFM sử dụng một mô hình cấp phép kép (dual-license):
| Thành phần | Giấy phép | Vị trí |
|---|---|---|
| Trọng số mô hình (weights) | Giấy phép phi thương mại | Hugging Face (google/tabfm-1.0.0-pytorch) |
| Mã nguồn sử dụng & mẫu | Apache 2.0 | GitHub (google-research/tabfm) |
Trọng số mô hình được phát hành theo giấy phép phi thương mại, mã nguồn có sẵn — có nghĩa là chúng không phải là mã nguồn mở hoàn toàn theo định nghĩa của OSI hay khuôn khổ bốn tầng của G7 năm 2026 . Tuy nhiên, mã nguồn suy luận và các notebook mẫu lại sử dụng giấy phép Apache 2.0 thông thoáng hơn
. Mô hình này tương tự như cách Google tiếp cận với các mô hình nghiên cứu khác như Gemma (sau này chuyển sang Apache 2.0 cho các thế hệ mới hơn
) và phù hợp với cách Prior Labs phát hành trọng số mô hình TabPFN dưới các điều khoản phi thương mại
.
Google có kế hoạch tích hợp TabFM trực tiếp vào BigQuery trong vài tuần sau thông báo . Người dùng BigQuery sẽ có thể chạy phân loại và hồi quy zero-shot bằng cách sử dụng lệnh SQL
AI.PREDICT, theo cú pháp tương tự như các hàm suy luận có sẵn của BigQuery ML (tương tự AI.FORECAST dành cho TimesFM) . Cú pháp dự kiến là:
SELECT * FROM AI.PREDICT(
MODEL tabfm,
TABLE your_data
)
Sự tích hợp này sẽ cho phép các nhóm dữ liệu áp dụng các dự đoán của TabFM trực tiếp trong SQL mà không cần quản lý cơ sở hạ tầng ML riêng biệt hoặc triển khai mô hình . Tính đến ngày công bố (1 tháng 7 năm 2026), sự tích hợp này được mô tả là sắp diễn ra nhưng chưa được phản ánh trong các ghi chú phát hành của BigQuery
. Hệ sinh thái BigQuery ML hiện tại của Google đã hỗ trợ suy luận có quản lý cho TimesFM (
AI.FORECAST), các mô hình tùy chỉnh (ML.PREDICT), và các mô hình mã nguồn mở từ bên thứ ba trên Hugging Face ; TabFM sẽ là mô hình nền tảng bảng tính đầu tiên nhận được lối tắt
AI.PREDICT tích hợp sẵn.
AI.PREDICT hiện được ghi nhận trong tài liệu BigQuery ML sử dụng cú pháp ML.PREDICT với một đối tượng mô hình đã đăng ký AI.PREDICT cho TabFM có thể là một lối tắt tích hợp mới tương tự như AI.FORECAST cho TimesFM, chưa được ghi nhận trong ghi chú phát hành tại thời điểm viết bài.Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
TabFM là mô hình nền tảng bảng tính zero shot của Google, thực hiện phân loại và hồi quy trên các bảng chưa từng thấy chỉ trong một lượt truyền xuôi, sử dụng học trong ngữ cảnh với kiến trúc chú ý hàng cột luân phiên.
TabFM là mô hình nền tảng bảng tính zero shot của Google, thực hiện phân loại và hồi quy trên các bảng chưa từng thấy chỉ trong một lượt truyền xuôi, sử dụng học trong ngữ cảnh với kiến trúc chú ý hàng cột luân phiên. Mô hình được huấn luyện hoàn toàn trên hàng trăm triệu bộ dữ liệu tổng hợp do các mô hình nhân quả cấu trúc (SCM) tạo ra, giải quyết vấn đề khan hiếm dữ liệu bảng tính mã nguồn mở.
Trên bảng xếp hạng TabArena, TabFM Ensemble đạt kết quả tốt nhất cho cả tác vụ phân loại và hồi quy, còn TabFM Single đứng thứ hai, cạnh tranh trực tiếp với các nền tảng tiên tiến khác.