Encord के ऑपरेटर, जिन्हें 'पायलट' कहा जाता है, जर्मन न्यूरोसाइंस स्टार्टअप Zander Labs के हेडसेट पहनते हैं जो शारीरिक कार्यों के दौरान मस्तिष्क की गतिविधि को मापते हैं। जब एक पायलट Jenga के टॉवर को सावधानीपूर्वक तोड़ता है, तो हेडसेट इरादे (intent), त्रुटि का पता लगाने (error detection) और आश्चर्य (surprise) जैसी मानसिक स्थितियों को दर्शाने वाले संकेतों को कैप्चर करता है।
इसका लक्ष्य एक 'ब्रेन वेव-टैग्ड डेटासेट' तैयार करना है जो रोबोटिक मॉडल्स को यह समझने में मदद कर सके कि उन्नत तर्क कब लागू करना है या असफलता के तरीकों का पता कैसे लगाना है।
Encord के रोबोट लर्निंग हेड विनीथ वेलमुरुगन (Vineeth Velmurugan) इसे रोबोटिक्स में डेटा की कमी को हल करने की 'ब्लीडिंग एज' तकनीक बताते हैं। हालांकि, यह परीक्षण अभी जारी है और इसका परिणाम देखा जाना बाकी है। Encord एक प्रारंभिक डेटासेट बनाएगा, इसे ग्राहकों के रोबोटिक मॉडल पर चलाएगा और फिर तय करेगा कि इसे बड़े पैमाने पर लागू करना है या नहीं।
Encord अग्र-भुजा (forearm) पर लगे सेंसर का भी परीक्षण कर रहा है जो मांसपेशियों में विद्युत संकेतों (electrical signals) का पता लगाते हैं। हाथों के स्टैंडर्ड वीडियो में अक्सर उंगलियों की बारीक पोज़िशन दिखाई नहीं देती, इसलिए कंपनी इन EMG सिग्नलों से हाथ की 3D पोज़िशन का पुनर्निर्माण करने की उम्मीद करती है, ताकि मॉडल्स को मैनिपुलेशन की बेहतर समझ मिल सके।
अपनी R&D सुविधा में, Encord लीडर-फॉलोअर (leader-follower) रोबोटिक आर्म्स संचालित करता है। एक मानव ऑपरेटर एक आर्म को सीधे नियंत्रित करता है जबकि दूसरा आर्म उस हरकत की नकल करता है। इससे कॉफ़ी डालने, पोकर चिप्स को जमा करने, ईथरनेट केबल को प्लग और अनप्लग करने, और घरेलू वस्तुओं में हेरफेर जैसे कार्यों के लिए हाई-फिडेलिटी डेटा तैयार होता है। कथित तौर पर, हर ह्यूमनॉइड रोबोटिक्स कंपनी ने इन विशेष कार्य-विशिष्ट डेटासेट का अनुरोध किया है।
पायलट सिर पर कैमरा पहनते हैं जो वह रिकॉर्ड करता है जो वे देखते हैं। दुनिया भर के कई कारखानों से डेटा भी एकत्र किया जाता है। यह वास्तविक दुनिया के अवलोकन डेटा का एक बड़ा स्रोत प्रदान करता है।
Encord समर्पित फील्ड ऑपरेटरों को तैनात करता है और पुन: कॉन्फ़िगर करने योग्य प्रयोगशाला वातावरण (reconfigurable lab environments) संचालित करता है। यह LiDAR, पॉइंट क्लाउड और सिंक्रोनाइज़्ड मल्टीमॉडल सेंसर स्ट्रीम सहित एम्बॉडिमेंट-विशिष्ट डेटा एकत्र करता है। डेटा संग्रह प्रोटोकॉल इस तरह से डिज़ाइन किए गए हैं कि हर एपिसोड ग्राहक के प्रशिक्षण पाइपलाइन के अनुरूप वर्गीकृत, सिंक्रोनाइज़ और संरेखित (aligned) हो।
कंपनी एक 'डिप्लॉयमेंट फीडबैक लूप' के माध्यम से असफलता (Failure Mode) के आंकड़ों को भी कैप्चर करती है - जब कोई मॉडल फील्ड में विफल होता है, तो उसे रिमोट टेलीऑपरेशन के ज़रिए कैप्चर कर डेटा कलेक्शन पॉलिसी में फीड किया जाता है।
Zander Labs का दृष्टिकोण विशिष्ट विचारों को डिकोड करने के बजाय मोटे स्तर पर मस्तिष्क गतिविधि से मानसिक स्थितियों का अनुमान लगाता है (जैसे, एक पायलट कितना संज्ञानात्मक प्रयास कर रहा है)। परीक्षण में यह मान्य करना होगा कि क्या ये सिग्नल वास्तव में स्टैंडर्ड वीडियो और टेलीऑपरेशन डेटा की तुलना में रोबोटिक मॉडल के प्रदर्शन में सुधार करते हैं। यदि सुधार मामूली है, तो हर डेटा संग्रह सत्र में EEG जोड़ने की लागत उचित नहीं ठहराई जा सकती।
फिजिकल AI के लिए वीडियो, डेप्थ, LiDAR, ऑडियो, IMU और अब EEG/EMG जैसे सेंसरों को सटीक रूप से समय-संरेखित (time-aligned) और एक साथ एनोटेट किया जाना आवश्यक है। Encord ने MCAP और ROSBAG जैसे नेटिव फ़ॉर्मेट के लिए सपोर्ट बनाया है, लेकिन 2D, 3D और बायोसिग्नल स्ट्रीम को सिंक्रोनाइज़ करने की जटिलता एक कठिन इंजीनियरिंग समस्या बनी हुई है।
मॉडलों को विविध वातावरणों, प्रकाश व्यवस्थाओं, ऑपरेटरों और विफलता के मामलों के संपर्क की आवश्यकता होती है। Encord एक डिप्लॉयमेंट फीडबैक लूप को शामिल करता है, लेकिन विफलता डेटा को मजबूत फिजिकल AI के लिए आवश्यक माना जाता है, भले ही इसकी अनदेखी की जाती हो।
पर्याप्त 'एज केस' (अत्यधिक मामलों) के बिना, सबसे समृद्ध डेटा पर प्रशिक्षित मॉडल भी ठीक से काम नहीं करेंगे।
LLMs के विपरीत, जो इंटरनेट से स्क्रैप किए गए टेक्स्ट पर प्रशिक्षित होते हैं, फिजिकल AI के लिए महंगे हार्डवेयर, मानव ऑपरेटरों और नियंत्रित वातावरण द्वारा उत्पन्न स्वामित्व वाले, वास्तविक दुनिया के डेटा की आवश्यकता होती है। Encord का मॉडल डेटा के अधिक महंगे, विशिष्ट उत्पादन (manufacturing) की ओर एक जानबूझकर बदलाव है - यह वेब स्क्रैपिंग की तुलना में कम सस्ते में स्केल होता है।
Encord ने फरवरी 2026 में Wellington Management के नेतृत्व में $60 मिलियन की सीरीज़ C सहित कुल $110 मिलियन जुटाए हैं। कंपनी को सुविधाओं (Bay Area R&D लैब), रोबोटिक हार्डवेयर, प्रशिक्षित कर्मियों ('पायलट') और डेटा एनोटेशन बुनियादी ढांचे पर भारी खर्च करना होगा - वो भी तब जब अधिकांश ग्राहकों ने अभी तक पैमाने पर प्रोडक्शन रोबोट तैनात नहीं किए हैं।
सिमुलेशन (Simulation) बड़े सिंथेटिक डेटासेट सस्ते में उत्पन्न कर सकता है, लेकिन यह वास्तविक दुनिया की भौतिकी, एज केस और बारीक-बारीक हेरफेर को पकड़ने में विफल रहता है। Encord और दूसरों का दांव यह है कि केवल वास्तविक मानव प्रदर्शन डेटा (real human demonstration data) - अपनी लागत और गड़बड़ी के साथ - सामान्य-उद्देश्य वाली रोबोटिक्स के लिए आवश्यक सिम-टू-रियल (sim-to-real) अंतर को पाटेगा।
Encord का अनुमान है कि अगले चार वर्षों में 400 मिलियन से अधिक बुद्धिमान रोबोट ऑनलाइन आएंगे, जो फिजिकल AI उद्योग को वार्षिक $30 बिलियन से अधिक पहुंचा देंगे। यदि यह अपनाने की दर अपेक्षा से धीमी रही, तो महंगे कस्टम ट्रेनिंग डेटा की मांग वर्तमान बुनियादी ढांचे के खर्च को बनाए रखने के लिए पर्याप्त तेज़ी से नहीं बढ़ेगी।
Encord, रोबोटिक्स के लिए वास्तविक दुनिया के प्रशिक्षण डेटा की कमी को दूर करने के लिए टेलीऑपरेशन, एगोसेंट्रिक वीडियो और लैब-आधारित डेटा संग्रह के साथ-साथ प्रायोगिक बायोसिग्नल कैप्चर (मस्तिष्क तरंगों और मांसपेशियों के सेंसर) का बीड़ा उठा रहा है। यह दृष्टिकोण अभी पैमाने पर सिद्ध नहीं हुआ है: ब्रेन वेव ट्रायल का मूल्यांकन जारी है, और मुख्य आर्थिक व्यापार-नापसंद यह है कि भौतिक डेटा वेब-स्केल टेक्स्ट डेटा की तुलना में कहीं अधिक महंगा है।
सफलता इस बात पर निर्भर करती है कि क्या ये समृद्ध डेटा मोडैलिटी रोबोटिक मॉडल के प्रदर्शन में सार्थक सुधार लाती हैं और क्या फिजिकल AI बाजार अग्रिम निवेश को सही ठहराने के लिए पर्याप्त तेज़ी से बढ़ता है।