LimiX 2 er en modell med 400 millioner parametere for strukturerte data. Ifølge utviklerne kan samme forhåndstrente kontrollpunkt brukes til klassifisering, regresjon og imputering av manglende verdier uten oppgavespe...
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is LimiX-2, the 400-million-parameter structured- and tabular-data foundation model released by Stable AI and Tsinghua University’s Pro. Article summary: LimiX-2 is a 400M-parameter, pretrained foundation model for heterogeneous structured/tabular data from Stable AI and Tsinghua’s Peng Cui group. Its core claim is that one frozen checkpoint can condition on an example ta. Topic tags: general, academic, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
LimiX-2 er en grunnmodell med 400 millioner parametere for strukturerte data og tabelldata, utviklet av Stable AI sammen med professor Peng Cuis gruppe ved Tsinghua-universitetet. Hovedpåstanden er ambisiøs: Ett forhåndstrent kontrollpunkt skal kunne brukes til klassifisering, regresjon og imputering – altså utfylling av manglende verdier – uten at modellparametrene finjusteres for hver enkelt oppgave. Den offisielle åpne utgivelsen er datert 16. september 2026. 1
5
Prosjektets offisielle Hugging Face-repositorium inneholder vektene i LimiX-2.ckpt og kode for inferanse. Den tekniske rapporten, LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence, er tilgjengelig på arXiv og er også lenket fra repositoriet. 1
5
Vanlige modeller for tabelldata trenes typisk for å predikere én bestemt målvariabel: Gitt kolonner og eksempler skal de anslå en klasse eller en tallverdi. LimiX-2 forsøker i stedet å lære den kontekstavhengige fellesstrukturen i tabellen, formulert som (p(x,y\mid D_{context})), ikke bare målprediksjonen (p(y\mid x,D_{context})).
Med dette perspektivet blir klassifisering, regresjon og utfylling av en tom celle varianter av samme problem: å utlede en ukjent verdi fra cellene som allerede er observert, samt kontekstradene i tabellen. 1
Treningen bygger på Context-Conditional Masked Modeling (CCMM). Hver treningsepisode deles i en kontekstgruppe og en spørringsgruppe av rader. Enkelte variabler i spørringsradene maskeres, mens resten av raden og konteksttabellen beholdes. Modellen belønnes både for å rekonstruere maskerte felt og for å predikere målvariabler.
Ifølge rapporten kan spørringsrader se kontekstrader, men ikke hverandre. Hensikten er å hindre informasjonsflyt mellom spørringseksemplene og å redusere hvor avhengig svaret er av sammensetningen av batchen. 1
LimiX-2 har separate utgangsbaner som allerede ligger i den forhåndstrente arkitekturen, fremfor nye oppgavehoder som må læres under tilpasning. For regresjon predikerer modellen en sannsynlighetsfordeling over 5 000 ordnede intervaller for målverdien og omgjør denne til et tallestimat. 1
Forskerne kaller tilnærmingen Contextual Mechanism Networks (CMN). Tanken er at god in-context-læring for tabeller bør fange opp hvordan variabler henger sammen og genereres, snarere enn bare å tilpasse en sammenheng mellom funksjoner og mål i ett bestemt datasett. 1
Derfor er LimiX-2 forhåndstrent på syntetiske tabeller fra strukturelle kausale modeller. Datagenereringen varierer blant annet grafstrukturer, mekanismer med én eller flere foreldrevariabler, valg av observerbare variabler og transformasjoner eller observasjonsprosesser. Rapporten beskriver også skalering, ikke-lineære transformasjoner og tilfeller der kontinuerlige mål gjøres om til klassifikasjonsmål. 1
Dette gir bred eksponering for ulike tabellformer, datatyper, mønstre av manglende data og betingede sammenhenger. Det er likevel ikke en garanti for at et konkret kunderegister, en produksjonsdatabase eller et norsk virksomhetsskjema ligner nok på modellens treningsfordeling.
LimiX-2 bygger videre på den tidligere LimiX-serien, som introduserte en mer generell tilnærming til strukturert datamodellering og BCCO-benchmarken. Den nye rapporten beskriver en kraftig oppskalering av modellen og en mer omfattende generator for syntetiske strukturelle kausale modeller, basert på skaleringsarbeidet fra det tidligere prosjektet. 1
2
Praktisk sett er ambisjonen større: LimiX-2 skal overføre kunnskap mellom svært ulike tabeller gjennom kontekst ved inferanse, i stedet for å trenes på nytt for hver arbeidsflyt innen klassifisering, regresjon eller imputering. 1
Tallene under er rapportert av forfatterne i LimiX-2-rapporten og det offisielle repositoriet:
| Benchmark | Rapportert samlet Elo | Rapportert plassering |
|---|---|---|
| TabArena | 1 935 | Førsteplass; 117,4 poeng over TabFM+ før avrunding |
| TALENT | 1 506 | Førsteplass; 35 poeng over neste rapporterte modell |
| BCCO | 1 432 | Førsteplass blant de sammenlignede metodene |
For hele TabArena oppgir repositoriet dessuten førsteplass på fire prediktive mål, 3,3 % «improvability», gjennomsnittlig rangering på 5,5 og 18,9 aggregerte seirer. 1
4
5
Rapporten viser sterke resultater for både regresjon og klassifisering, ikke bare én oppgavetype. Det er et lovende signal for fellesmodelleringen, men fortsatt benchmark-evidens under rapportens egne datasett, forhåndsbehandling, datasplitt, måltall og sammenligningsoppsett. 1
Forfatterne rapporterer også at oppmerksomhetsmønstre mellom variabler kan brukes til å gjenfinne kausale skjeletter i evalueringene. Det må tolkes snevert: Resultatet gjelder udirekte relasjoner under kontrollerte protokoller. Det beviser verken kausal retning, fravær av konfunderende faktorer eller kausale effekter i en vilkårlig bedriftsdatabase. 1
For team med blandede numeriske og kategoriske data kan modellen være aktuell som en rask baseline eller som en ekstra modell i et ensemble. Den er særlig interessant når man trenger flere av disse tingene i samme tabellmiljø:
Et godt benchmark-resultat er starten på en evaluering, ikke slutten.
Bruk et holdout-sett som ligner drift. Tilfeldige trening/test-splitt kan gi et for optimistisk bilde. Bruk tidsbaserte, enhetsbaserte, geografiske, gruppebaserte eller framtidige driftsperioder som holdout der det passer bruksområdet.
Sammenlign med godt justerte baseliner. Test LimiX-2 mot modellene og prosessene som faktisk er relevante, for eksempel tunet gradient boosting, AutoML og domenespesifikke modeller. Elo-resultater påvirkes av oppgavesamling, forhåndsbehandling, skåring, beregningsbudsjett og modellversjoner.
Test det reelle skjemaet. Identifikatorer, sjeldne eller kategorier med høy kardinalitet, teksttunge kolonner, tidsavhengighet, koblinger mellom flere tabeller, skiftende betydning i felter og ikke-tilfeldig manglende data kan kreve annen forhåndsbehandling eller en annen modell.
Revider for datalekkasjer. Felter som oppstår etter utfallet, framtidige registre, dupliserte enheter, målproxyer fra koblinger og informasjon på tvers av foldene må holdes utenfor evalueringen. Isolering mellom spørringsrader løser bare én mulig lekkasjekanal; den retter ikke lekkasjer som allerede finnes i kolonner eller datasplitt. 1
Mål driftskostnaden. Vurder latenstid, minnebruk, kostnad, kalibrering, overvåking, retreningsstrategi og gjeldende vilkår i repositoriet før produksjonssetting.
LimiX-2 er et interessant forsøk på å gjøre in-context-læring nyttig for hele livssyklusen til en tabell, ikke bare prediksjon av én målkolonne. De rapporterte resultatene gjør modellen til en troverdig kandidat for praktisk testing. Om den slår en nøye justert, spesialisert pipeline, kan imidlertid bare en realistisk og lekkasjesikker test på egne data avgjøre.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
LimiX 2 er en modell med 400 millioner parametere for strukturerte data. Ifølge utviklerne kan samme forhåndstrente kontrollpunkt brukes til klassifisering, regresjon og imputering av manglende verdier uten oppgavespe...
LimiX 2 er en modell med 400 millioner parametere for strukturerte data. Ifølge utviklerne kan samme forhåndstrente kontrollpunkt brukes til klassifisering, regresjon og imputering av manglende verdier uten oppgavespe... Vekter og inferansekode ble publisert 16. september 2026 i prosjektets offisielle Hugging Face repositorium, mens den tekniske rapporten også finnes på arXiv.
Modellen er forhåndstrent på syntetiske tabeller fra strukturelle kausale modeller.