LimiX 2 on 400 miljoonan parametrin malli rakenteiselle ja taulukkomuotoiselle datalle. Painot ja päättelykoodi julkaistiin virallisessa Hugging Face repositoriossa 16.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is LimiX-2, the 400-million-parameter structured- and tabular-data foundation model released by Stable AI and Tsinghua University’s Pro. Article summary: LimiX-2 is a 400M-parameter, pretrained foundation model for heterogeneous structured/tabular data from Stable AI and Tsinghua’s Peng Cui group. Its core claim is that one frozen checkpoint can condition on an example ta. Topic tags: general, academic, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
LimiX-2 on Stable AI:n ja Tsinghuan yliopiston professori Peng Cuin tutkimusryhmän kehittämä 400 miljoonan parametrin perusmalli rakenteiselle eli taulukkomuotoiselle datalle. Julkaisun keskeinen väite on kunnianhimoinen: yksi esikoulutettu mallipainojen tarkistuspiste voi tehdä luokittelua ja regressiota sekä täydentää puuttuvia sarakearvoja ilman tehtäväkohtaista parametrien hienosäätöä. Virallisen repositorion mukaan avoin julkaisu tehtiin 16. syyskuuta 2026. 1
5
Virallisessa Hugging Face -repositoriossa ovat saatavilla LimiX-2.ckpt-painot ja päättelykoodi. Tekninen raportti, LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence, löytyy arXivista, ja siihen viitataan myös repositoriossa. 1
5
Tavanomaiset taulukkomallinnusjärjestelmät on yleensä rakennettu ennustamaan tiettyä kohdetta: ominaisuuksien ja esimerkkirivien perusteella arvioidaan luokka tai numeerinen lopputulos. LimiX-2 pyrkii sen sijaan oppimaan taulukon kontekstisidonnaisen yhteisrakenteen, jota tekijät kuvaavat muodolla (p(x,y\mid D_{context})), eivätkä vain kohteen ehdollisena ennustamisena (p(y\mid x,D_{context})). Tällöin luokan ennustaminen, jatkuvan arvon arviointi ja peitetyn solun täyttäminen ovat saman perusongelman muotoja: havaitsematon arvo päätellään näkyvistä soluista ja kontekstiriveistä. 1
Mallia opetetaan menetelmällä Context-Conditional Masked Modeling (CCMM). Jokaisessa opetusjaksossa rivit jaetaan konteksti- ja kyselyjoukkoon. Kyselyrivien valittuja ominaisuuksia peitetään, mutta muut havaitut arvot ja kontekstitaulukko säilytetään. Opetus optimoi samanaikaisesti ominaisuuksien rekonstruointia ja kohteen ennustamista. Raportin mukaan kyselyrivit voivat kiinnittää huomiota kontekstiriveihin, mutteivät toisiinsa. Ratkaisun tarkoitus on estää tiedon kulkeutuminen kyselyesimerkkien välillä ja vähentää tulosten riippuvuutta siitä, miten kyselyerä on koottu. 1
LimiX-2:ssa tarvittavat tulostusreitit ovat jo esikoulutetussa arkkitehtuurissa; uusia tehtäväkohtaisia ennustuspäitä ei opeteta käyttöönoton yhteydessä. Raportin mukaan luokittelu ja regressio puretaan kohteen syvemmistä esityksistä, kun taas ominaisuuksien rekonstruointi käyttää matalampaa esitystä. Regressiossa malli ennustaa jakauman 5 000 järjestetyn kohdealueen yli ja muuntaa jakauman numeeriseksi arvioksi. 1
Tekijät kutsuvat lähestymistapaa nimellä Contextual Mechanism Networks (CMN). Ajatus on, että taulukoiden kontekstissa tapahtuvan oppimisen pitäisi tunnistaa, miten muuttujat syntyvät ja liittyvät toisiinsa, eikä vain sovittaa yhden skeeman ominaisuuksista kohteeseen johtavaa yhteyttä. 1
Tätä varten LimiX-2 esikoulutetaan synteettisillä taulukoilla, jotka on muodostettu rakenteellisista kausaalimalleista. Generointi vaihtelee graafien topologioita, yhden ja usean vanhemman mekanismeja, havaittaviksi valittuja muuttujia sekä muunnoksia ja havaintoprosesseja. Raportissa kuvataan esimerkiksi skaalauksia ja epälineaarisia muunnoksia; joskus jatkuva kohde muutetaan luokittelutehtäväksi. 1
Synteettisen aineiston monipuolisuuden tavoitteena on altistaa malli monille taulukkomuodoille, ominaisuustyypeille, puuttuvuusrakenteille ja ehdollisille riippuvuuksille ilman, että se muistaisi nimettyjä reaalimaailman aineistoja. Tämä ei silti takaa, että yksittäinen yrityksen tietomalli vastaa mallin esikoulutusjakaumaa.
LimiX-2 jatkaa aiempaa LimiX-tutkimuslinjaa, jossa esiteltiin yleinen lähestymistapa rakenteisen datan mallinnukseen ja BCCO-vertailuaineisto. LimiX-2:n raportti kuvaa selvästi suurempaa mallia ja laajennettua synteettistä, rakenteellisiin kausaalimalleihin perustuvaa datageneraattoria. Skaalausta on ohjattu aiemman projektin tuloksilla. 1
2
Käytännön ero on mittakaavassa ja tavoitellussa käyttöalueessa: LimiX-2 asemoidaan suureksi esikoulutetuksi malliksi, joka siirtyy erilaisten taulukoiden välillä päättelyhetken kontekstin avulla sen sijaan, että se opetettaisiin uudelleen jokaista luokittelu-, regressio- tai imputointityönkulkua varten. 1
Seuraavat Elo-pisteet ovat tekijöiden itsensä raportoimia LimiX-2-raportissa ja virallisessa repositoriossa:
| Vertailuaineisto | Raportoitu Elo | Raportoitu sijoitus verratuista menetelmistä |
|---|---|---|
| TabArena | 1 935 | Ensimmäinen; 117,4 pistettä ennen TabFM+:aa ennen pyöristystä |
| TALENT | 1 506 | Ensimmäinen; 35 pistettä seuraavaa raportoitua mallia edellä |
| BCCO | 1 432 | Ensimmäinen verratuista menetelmistä |
Koko TabArena-vertailussa repositorio raportoi lisäksi ykkössijan kaikilla neljällä ennustusmittarilla, 3,3 prosentin improvability-luvun, keskimääräisen sijoituksen 5,5 sekä 18,9 aggregoitua voittoa. 1
4
5
Raportin mukaan tulokset ovat vahvoja sekä regressiossa että luokittelussa, eivätkä kokonaispisteet nojaa vain yhteen tehtävätyyppiin. Tämä tukee yhteisrakenteen mallintamisen ideaa, mutta näyttö koskee edelleen raportin omia aineistoja, esikäsittelyjä, jakoja, mittareita ja vertailuasetelmia. 1
Tekijät raportoivat myös, että ominaisuuksiin kohdistuvat huomiointikuviot voivat heidän arvioinneissaan tukea kausaalisen luurangon palauttamista. Tulos on syytä lukea rajatusti: kyse on suunnattomien yhteyksien palauttamisesta tutkimuksen kontrolloiduissa asetelmissa. Se ei osoita kausaalista suuntaa, sulje pois sekoittavia tekijöitä eikä todista, että ominaisuuksien huomiointi paljastaisi syy-seurausvaikutuksia missä tahansa yritystietokannassa. 1
Numeerisia ja kategorisia sarakkeita yhdistäviä aineistoja käsitteleville tiimeille LimiX-2 voi olla kokeilemisen arvoinen nopeana vertailumallina tai osana malliyhdistelmää. Yhden tarkistuspisteen rajapinta on erityisen kiinnostava, jos samassa taulukkoympäristössä tarvitaan useita asioita:
Synteettinen esikoulutus on nimenomaan suunniteltu vaihtelemaan mekanismeja, graafirakenteita, muunnoksia ja havaittavia muuttujia. Skeemojen välinen siirrettävyys on siis julkaisun ydinhypoteesi, ei lupaus. 1
Vahva benchmark-tulos on arvioinnin alku, ei loppu.
Käytä tuotantoa vastaavaa testijoukkoa. Satunnainen opetus- ja testijako voi antaa liian optimistisen kuvan tuotantodatasta. Tee tarvittaessa ajallisia, entiteetti-, maantieteellisiä, ryhmä- tai käyttöönottokauteen perustuvia jakoja.
Vertaa viritettyihin perusmalleihin. Arvioi LimiX-2:ta yhdessä käyttötapaukseen sopivien nykyisten mallien ja prosessien kanssa. Näihin kuuluvat esimerkiksi viritetyt gradienttitehostusmallit, AutoML-järjestelmät ja toimialakohtaiset mallit. Benchmarkien Elo riippuu tarkasta tehtäväjoukosta, esikäsittelystä, pisteytyksestä, laskentabudjetista ja malliversioista.
Testaa omaa skeemaa. Tunnisteet, harvinaiset tai suuren kardinaliteetin kategoriat, tekstipainotteiset sarakkeet, ajallinen riippuvuus, usean taulun liitokset, muuttuvat merkitykset ja ei-satunnainen puuttuvuus voivat vaatia esikäsittelyä tai toisenlaista mallinnusta. Synteettinen kattavuus ei poista näitä riskejä.
Tarkasta tietovuodot. Pidä lopputuloksen jälkeen syntyneet kentät, tulevat tietueet, päällekkäiset entiteetit, liitosten tuomat kohdeproksit ja ristiinvalidointikertojen välinen tieto pois arvioinnista. Kyselyrivien eristäminen toisistaan ratkoo vain yhden mahdollisen vuotoreitin; se ei korjaa jo sarakkeissa tai aineistojaoissa olevaa vuotoa. 1
Selvitä tuotantorajoitteet. Mittaa viive, muistinkulutus, kustannus, kalibrointi, seurannan tarve ja uudelleenkoulutusstrategia sekä tarkista repositorion soveltuvat käyttöehdot ennen käyttöönottoa.
LimiX-2 on huomionarvoinen yritys tehdä kontekstissa tapahtuvasta oppimisesta hyödyllistä taulukon koko elinkaaren kannalta, ei vain kohteen ennustamisessa. Raportoidut tulokset tekevät siitä uskottavan ehdokkaan käytännön kokeiluun. Vasta realistinen, tietovuodoilta suojattu testi omalla aineistolla kertoo, voittaako se huolellisesti viritetyn tehtäväkohtaisen putken.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
LimiX 2 on 400 miljoonan parametrin malli rakenteiselle ja taulukkomuotoiselle datalle.
LimiX 2 on 400 miljoonan parametrin malli rakenteiselle ja taulukkomuotoiselle datalle. Painot ja päättelykoodi julkaistiin virallisessa Hugging Face repositoriossa 16.
Mallin benchmark kärkitulokset ovat tekijöiden raportoimia. Ennen tuotantokäyttöä sitä on verrattava omalla aineistolla realistisiin, vuotovapaisiin perusmalleihin.