LimiX 2, 16 सितंबर 2026 को जारी 400M पैरामीटर टेबुलर फाउंडेशन मॉडल है। लेखकों के अनुसार, एक ही फ्रीज़्ड चेकपॉइंट क्लासिफिकेशन, रिग्रेशन और मिसिंग वैल्यू इम्प्यूटेशन संभाल सकता है। [1][5] इसके वेट्स LimiX 2.ckpt, इन्फरेंस कोड और तकनीकी रिपोर्ट आधिकारिक Hugging Face रिपॉजिटरी तथा arXiv पर उपलब्ध हैं। [1][5] मॉडल का मु...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is LimiX-2, the 400-million-parameter structured- and tabular-data foundation model released by Stable AI and Tsinghua University’s Pro. Article summary: LimiX-2 is a 400M-parameter, pretrained foundation model for heterogeneous structured/tabular data from Stable AI and Tsinghua’s Peng Cui group. Its core claim is that one frozen checkpoint can condition on an example ta. Topic tags: general, academic, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
LimiX-2 संरचित या टेबल-आधारित डेटा के लिए बनाया गया 400 मिलियन पैरामीटर वाला फाउंडेशन मॉडल है। इसे Stable AI ने चिंगहुआ यूनिवर्सिटी के प्रोफेसर पेंग कुई के समूह के साथ विकसित किया है। इसका बड़ा दावा यह है कि एक ही प्रीट्रेंड, बिना टास्क-विशेष पैरामीटर फाइन-ट्यून किए चेकपॉइंट से क्लासिफिकेशन, रिग्रेशन और मिसिंग वैल्यू इम्प्यूटेशन—यानी खाली डेटा-सेल भरने—के काम किए जा सकते हैं। आधिकारिक रिपॉजिटरी के मुताबिक इसका ओपन रिलीज़ 16 सितंबर 2026 को हुआ था। 1
5
आधिकारिक Hugging Face रिपॉजिटरी में LimiX-2.ckpt वेट्स और इन्फरेंस कोड उपलब्ध हैं। इसकी तकनीकी रिपोर्ट, LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence, arXiv पर भी उपलब्ध है। 1
5
आम टेबुलर मॉडल किसी ज्ञात टारगेट पर केंद्रित होते हैं: फीचर और उदाहरण-पंक्तियां देकर लेबल या संख्यात्मक नतीजे का अनुमान लगाइए। LimiX-2 का लक्ष्य टेबल की संदर्भ-निर्भर संयुक्त संरचना को सीखना है। लेखक इसे केवल (p(y\mid x,D_{context})) सीखने के बजाय (p(x,y\mid D_{context})) सीखने के रूप में बताते हैं।
सरल शब्दों में, लेबल का अनुमान लगाना, कोई संख्यात्मक मान निकालना और किसी खाली सेल को भरना—तीनों को मॉडल एक जैसे सवाल की तरह देखता है: उपलब्ध सेल और संदर्भ की पंक्तियों से छिपे हुए मान का अनुमान लगाना। 1
इसके लिए मॉडल को Context-Conditional Masked Modeling (CCMM) से प्रशिक्षित किया गया है। हर ट्रेनिंग एपिसोड में पंक्तियों को दो हिस्सों में बांटा जाता है—कॉन्टेक्स्ट सेट और क्वेरी सेट। फिर क्वेरी पंक्तियों की कुछ फीचर वैल्यू छिपाई जाती हैं, जबकि बाकी दिखने वाले मान और संदर्भ-टेबल बनी रहती है। ट्रेनिंग में फीचर रिकंस्ट्रक्शन और टारगेट प्रेडिक्शन, दोनों को एक साथ पुरस्कृत किया जाता है।
रिपोर्ट के अनुसार, क्वेरी पंक्तियां कॉन्टेक्स्ट पंक्तियों को देख सकती हैं, लेकिन एक-दूसरे को नहीं। उद्देश्य यह है कि क्वेरी उदाहरणों के बीच जानकारी का अनचाहा प्रवाह न हो और नतीजे क्वेरी बैच की संरचना पर कम निर्भर रहें। 1
मॉडल में अलग-अलग आउटपुट पथ पहले से मौजूद हैं; किसी नए काम के लिए अलग टास्क हेड सीखने की बात नहीं कही गई है। क्लासिफिकेशन और रिग्रेशन टारगेट रिप्रेज़ेंटेशन को डिकोड करते हैं, जबकि फीचर रिकंस्ट्रक्शन अपेक्षाकृत उथले रिप्रेज़ेंटेशन का उपयोग करता है। रिग्रेशन के लिए मॉडल टारगेट को 5,000 क्रमबद्ध बिन में बांटकर एक वितरण का अनुमान लगाता है और उसे संख्यात्मक अनुमान में बदलता है। 1
लेखक इस पद्धति को Contextual Mechanism Networks (CMNs) कहते हैं। इसका आधार यह है कि टेबलों पर इन-कॉन्टेक्स्ट लर्निंग को केवल किसी एक स्कीमा में फीचर-से-लेबल संबंध फिट नहीं करना चाहिए, बल्कि यह समझना चाहिए कि अलग-अलग वेरिएबल कैसे बने और एक-दूसरे से कैसे जुड़े हैं। 1
LimiX-2 को स्ट्रक्चरल कॉज़ल मॉडल से बनाए गए सिंथेटिक टेबल डेटा पर प्रीट्रेन किया गया। डेटा-जनरेशन प्रक्रिया में ग्राफ की संरचना, एक या कई पैरेंट वाले मैकेनिज्म, दिखने वाले वेरिएबल का चयन और अलग-अलग ट्रांसफॉर्मेशन या ऑब्ज़र्वेशन प्रक्रियाएं बदली जाती हैं। रिपोर्ट में स्केलिंग, नॉन-लीनियर मैपिंग और कभी-कभी सतत टारगेट को क्लासिफिकेशन टारगेट में बदलने जैसे रूपांतरणों का भी उल्लेख है। 1
इस विविधता का उद्देश्य मॉडल को कई तरह की टेबल संरचनाओं, फीचर प्रकारों, मिसिंगनेस पैटर्न और सशर्त संबंधों से परिचित कराना है—बिना किसी नामित वास्तविक-वर्ल्ड डेटासेट को याद कराने के। हालांकि, इससे यह गारंटी नहीं मिलती कि किसी कंपनी का वास्तविक स्कीमा इसके प्रीट्रेनिंग वितरण से मेल खाएगा।
LimiX-2, पहले के LimiX रिसर्च क्रम का विस्तार है। उसी क्रम में सामान्य संरचित-डेटा मॉडलिंग का तरीका और BCCO बेंचमार्क पेश किया गया था। LimiX-2 की रिपोर्ट बड़े पैमाने के मॉडल और विस्तारित सिंथेटिक स्ट्रक्चरल-कॉज़ल डेटा-जनरेशन का वर्णन करती है, जिसे पहले के प्रोजेक्ट के स्केलिंग कार्य से दिशा मिली। 1
2
व्यावहारिक रूप से फर्क स्केल और लक्ष्य का है: LimiX-2 को ऐसा बड़ा प्रीट्रेंड मॉडल बताया गया है जो इन्फरेंस के दौरान कॉन्टेक्स्ट का उपयोग करके अलग-अलग टेबलों पर ट्रांसफर कर सके, बजाय इसके कि हर क्लासिफिकेशन, रिग्रेशन या इम्प्यूटेशन वर्कफ़्लो के लिए दोबारा ट्रेन किया जाए। 1
नीचे के आंकड़े पेपर और आधिकारिक रिपॉजिटरी में दिए गए लेखकों के स्वयं के रिपोर्ट किए गए ओवरऑल Elo स्कोर हैं:
| बेंचमार्क | रिपोर्टेड ओवरऑल Elo | तुलना किए गए मॉडलों में स्थिति |
|---|---|---|
| TabArena | 1,935 | पहला स्थान; राउंडिंग से पहले TabFM+ से 117.4 अंक आगे |
| TALENT | 1,506 | पहला स्थान; अगले रिपोर्टेड मॉडल से 35 अंक आगे |
| BCCO | 1,432 | तुलना किए गए मॉडलों में पहला स्थान |
पूरे TabArena बेंचमार्क पर रिपॉजिटरी चारों प्रेडिक्टिव मेट्रिक में पहला स्थान, 3.3% improvability, औसत रैंक 5.5 और 18.9 aggregated wins भी रिपोर्ट करती है। 1
4
5
पेपर में क्लासिफिकेशन और रिग्रेशन, दोनों में मजबूत प्रदर्शन की बात कही गई है; यानी ओवरऑल नतीजा सिर्फ एक प्रकार के टास्क से नहीं आया। यह संयुक्त-मॉडलिंग पद्धति के पक्ष में उत्साहजनक संकेत है, लेकिन ये परिणाम उन्हीं डेटासेट, प्रीप्रोसेसिंग, स्प्लिट, मेट्रिक और तुलना सेटिंग्स के अंतर्गत हैं जो पेपर में इस्तेमाल हुईं। 1
लेखक यह भी रिपोर्ट करते हैं कि फीचर-अटेंशन पैटर्न उनके परीक्षणों में कॉज़ल स्केलेटन रिकवरी में मदद कर सकते हैं। इसकी सीमा स्पष्ट है: यह नियंत्रित प्रोटोकॉल में वेरिएबल्स के बीच दिशाहीन संबंधों की रिकवरी का नतीजा है। इससे कारण की दिशा साबित नहीं होती, कन्फाउंडिंग खारिज नहीं होती, और न ही यह सिद्ध होता है कि किसी भी कारोबारी डेटाबेस में फीचर अटेंशन वास्तविक कारणात्मक प्रभाव बता देगा। 1
मिले-जुले संख्यात्मक और कैटेगरीकल डेटा पर काम करने वाली टीमों के लिए LimiX-2 एक तेज़ बेसलाइन या एन्सेम्बल में अतिरिक्त मॉडल के रूप में परीक्षण योग्य हो सकता है। इसका एकल-चेकपॉइंट इंटरफेस खासकर तब उपयोगी हो सकता है जब एक ही टेबल वातावरण में ये जरूरतें हों:
सिंथेटिक प्रीट्रेनिंग को मैकेनिज्म, ग्राफ संरचना, ट्रांसफॉर्मेशन और दिखने वाले वेरिएबल में बदलाव के लिए खास तौर पर डिजाइन किया गया है। इसलिए अलग स्कीमा में ट्रांसफर इस रिलीज़ की एक मुख्य परिकल्पना है, कोई पक्की गारंटी नहीं। 1
मजबूत बेंचमार्क परिणाम मूल्यांकन की शुरुआत होना चाहिए, अंत नहीं।
वास्तविक तैनाती जैसा होल्डआउट रखें। रैंडम ट्रेन/टेस्ट स्प्लिट उत्पादन-डेटा की स्थिति को गलत ढंग से आसान बना सकते हैं। जहां उचित हो, समय, एंटिटी, भौगोलिक क्षेत्र, समूह या वास्तविक डिप्लॉयमेंट अवधि के आधार पर होल्डआउट बनाएं।
ट्यून्ड बेसलाइन से तुलना करें। LimiX-2 को आपके उपयोग-केस के प्रासंगिक मौजूदा मॉडलों और प्रक्रियाओं के साथ जांचें—जैसे ट्यून्ड ग्रेडिएंट-बूस्टिंग, AutoML सिस्टम और डोमेन-विशेष मॉडल। Elo स्कोर टास्क संग्रह, प्रीप्रोसेसिंग, स्कोरिंग, कंप्यूट बजट और मॉडल वर्जन पर निर्भर है।
असल स्कीमा पर टेस्ट करें। आईडी, दुर्लभ या बहुत अधिक श्रेणियों वाले कैटेगरीकल कॉलम, टेक्स्ट-प्रधान कॉलम, समय-आधारित निर्भरता, मल्टी-टेबल जॉइन, बदलते अर्थ और non-random missingness के लिए अलग प्रीप्रोसेसिंग या किसी दूसरे मॉडलिंग तरीके की जरूरत हो सकती है। सिंथेटिक कवरेज इन जोखिमों को खत्म नहीं करता।
डेटा लीकेज का ऑडिट करें। नतीजे आने के बाद के कॉलम, भविष्य के रिकॉर्ड, डुप्लिकेट एंटिटी, जॉइन से बने टारगेट प्रॉक्सी और फोल्ड के बीच जानकारी को मूल्यांकन से बाहर रखें। क्वेरी पंक्तियों के बीच अलगाव केवल लीकेज के एक संभावित रास्ते को संबोधित करता है; कॉलम या डेटा स्प्लिट में पहले से मौजूद लीकेज को वह ठीक नहीं कर सकता। 1
प्रोडक्शन सीमाएं मापें। डिप्लॉयमेंट से पहले लेटेंसी, मेमोरी, लागत, कैलिब्रेशन, मॉनिटरिंग, रीट्रेनिंग रणनीति और रिपॉजिटरी की लागू शर्तों की जांच करें।
LimiX-2 टेबल डेटा के पूरे जीवनचक्र—सिर्फ टारगेट प्रेडिक्शन नहीं—के लिए इन-कॉन्टेक्स्ट लर्निंग को उपयोगी बनाने की उल्लेखनीय कोशिश है। रिपोर्टेड नतीजे इसे व्यावहारिक परीक्षण के लिए एक विश्वसनीय उम्मीदवार बनाते हैं। लेकिन यह किसी सावधानी से ट्यून्ड, समर्पित पाइपलाइन से बेहतर है या नहीं, इसका जवाब केवल आपके लक्ष्य डेटा पर वास्तविक परिस्थितियों जैसा, लीकेज-प्रतिरोधी परीक्षण ही दे सकता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
LimiX 2, 16 सितंबर 2026 को जारी 400M पैरामीटर टेबुलर फाउंडेशन मॉडल है। लेखकों के अनुसार, एक ही फ्रीज़्ड चेकपॉइंट क्लासिफिकेशन, रिग्रेशन और मिसिंग वैल्यू इम्प्यूटेशन संभाल सकता है। [1][5]
LimiX 2, 16 सितंबर 2026 को जारी 400M पैरामीटर टेबुलर फाउंडेशन मॉडल है। लेखकों के अनुसार, एक ही फ्रीज़्ड चेकपॉइंट क्लासिफिकेशन, रिग्रेशन और मिसिंग वैल्यू इम्प्यूटेशन संभाल सकता है। [1][5] इसके वेट्स LimiX 2.ckpt, इन्फरेंस कोड और तकनीकी रिपोर्ट आधिकारिक Hugging Face रिपॉजिटरी तथा arXiv पर उपलब्ध हैं। [1][5]
मॉडल का मुख्य विचार केवल टारगेट की भविष्यवाणी नहीं, बल्कि टेबल में फीचरों और टारगेट के संदर्भ निर्भर संयुक्त संबंध को सीखना है।