In China zijn volgens een analyse minstens 90 centra voor het verzamelen en trainen van data voor humanoïde robots operationeel of in aanbouw. Lightwheel AI werkt aan EgoSuite Open100K: een dataset van 100.000 uur met meer dan 15.000 taken en praktijksituaties; de eerste 10.000 uur zijn beschikbaar via Hugging Face.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the 2026 World Robot Conference in Beijing reveal about China’s shift from building humanoid-robot bodies to collecting the data ne. Article summary: The conference signaled a strategic shift: China’s humanoid-robot race is moving from demonstrating capable bodies toward building the data pipelines, sensors, compute components, and models needed for general-purpose em. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
De World Robot Conference 2026 in Beijing liet zien welke kant de Chinese humanoïde-robotindustrie opgaat. De aandacht verschuift van het bouwen van steeds betere robotlichamen naar het aanleggen van de infrastructuur die hun ‘brein’ moet trainen.
Volgens een analyse zijn in China minstens 90 centra voor het verzamelen en trainen van robotdata operationeel of in aanbouw. Dat wijst op een duidelijke verschuiving in de investeringslogica: data over fysieke interacties wordt gezien als een strategische grondstof. Tegelijkertijd maakte de conferentie duidelijk dat industriële hoeveelheden data nog niet bewijzen dat robots daardoor ook intelligentie ontwikkelen die overdraagbaar is tussen machines, taken en werkomgevingen. 13
Voor humanoïde robots zijn tekst en gewone beelden niet genoeg. Een robot moet leren wat mensen zien, hoe ze bewegen, hoe voorwerpen reageren en hoe handelingen zich in de tijd ontvouwen. Daarom zijn onder meer video vanuit het eerstepersoonsperspectief, houdingsinformatie, dieptegegevens, tastsignalen en data over de toestand van de robot waardevolle bouwstenen voor zogeheten embodied AI: kunstmatige intelligentie die in een lichaam en een fysieke omgeving opereert.
Lightwheel AI gaf die visie een concreet gezicht met EgoSuite-Open100K, een dataset die uiteindelijk 100.000 uur aan menselijke activiteiten vanuit het eerstepersoonsperspectief moet omvatten. Het project beslaat meer dan 15.000 taken en praktijksituaties. De opnames combineren beelden van hoofd- en polscamera’s met hand- en lichaamshoudingen, semantische labels en diepte-informatie. De eerste 10.000 uur zijn beschikbaar via Hugging Face; het project mikt daarnaast op verspreiding via AtomGit. 1
12
Het voordeel is duidelijk: menselijke demonstraties kunnen een brede doorsnede van alledaagse bewegingen en handelingen leveren zonder dat elke demonstratie met een dure fysieke robot hoeft te worden opgenomen. Maar menselijke ervaring is niet automatisch hetzelfde als robotervaring. Mensen corrigeren hun evenwicht, wrijving en contact met voorwerpen grotendeels intuïtief. Een robot moet die krachten juist via zijn eigen sensoren en aandrijvingen waarnemen en aansturen.
Tian Feng van het Intelligent Industries Research Institute van SenseTime beschreef zes methoden die naast elkaar worden ingezet. Daaronder vallen teleoperatie, bewegingsregistratie, synthetische data en dataverzameling op echte productielijnen. 13
Elke methode belicht een ander deel van het probleem:
Volgens de tijdens de conferentie aangehaalde informatie kan dataverzameling zonder fysiek robotlichaam ongeveer een vijfde kosten van het verzamelen van demonstraties met echte robots. De keerzijde is dat de data mogelijk vooral laat zien hoe ingehuurde dataverzamelaars een taak uitvoeren, en niet hoe ervaren vakmensen dat werk in de praktijk doen. 13
Dat maakt menselijke data niet waardeloos. Het betekent wel dat zulke data waarschijnlijk één laag vormen in een bredere trainingsmix, samen met teleoperatie, robotstatusgegevens, simulaties en feedback uit echte toepassingen.
De conferentie maakte duidelijk dat robotica-infrastructuur tegenwoordig meer omvat dan motoren, batterijen en robotframes. Ook de apparatuur waarmee demonstraties en sensorimotorisch gedrag worden vastgelegd, wordt onderdeel van de keten. Denk aan camera’s, handschoenen, tactiele interfaces, microcontrollers, geheugenchips en analoge componenten. 13
Dat kan een goedkopere route bieden naar grote hoeveelheden trainingsmateriaal. Tegelijk ontstaat een standaardisatieprobleem. Data die met verschillende sensoren, kalibratieprocedures, actie-indelingen, middleware en labelingsystemen is verzameld, laat zich niet automatisch combineren.
Zo ontstaat wat waarnemers ‘eilanddata’ noemen: bruikbare informatie die opgesloten blijft in de hardware- en softwareomgeving waarin ze is gemaakt. Open datasets kunnen dat probleem verkleinen, maar openheid alleen is geen garantie voor hergebruik. Daarvoor zijn onder meer gedeelde dataschema’s, kalibratiemetadata, tijdsconventies, interfaces en evaluatieprotocollen nodig. Pas dan kan een grotere hoeveelheid data uitgroeien tot een gezamenlijke technologische capaciteit. 13
Een andere open vraag is of het bekende patroon uit taalmodellen—meer data en grotere modellen leiden tot betere prestaties—ook opgaat voor robotica.
Het GEN-0-rapport van Generalist AI uit november 2025 geeft daarop een bemoedigend, maar beperkt antwoord. In de experimenten van het bedrijf hadden kleinere modellen moeite om steeds diversere sensorimotorische data te verwerken. Generalist AI noemde dat verschijnsel ‘ossificatie’: het model raakt als het ware verstard en neemt nieuwe informatie steeds moeilijker op. Bij grotere modellen bleef de prestatie verbeteren; het rapport signaleerde een mogelijke omslag rond 7 miljard parameters. 36
Dat is interessante experimentele informatie, maar nog geen algemeen aanvaarde schaalwet voor robotica. Het resultaat komt uit de modellen, datasets en evaluatiemethode van één bedrijf. Bovendien heeft robotica een extra uitdaging die taalmodellen niet op dezelfde manier kennen: een model moet handelen via een specifiek lichaam, in een specifieke omgeving en onder echte fysieke beperkingen.
De praktische vraag is daarom niet alleen hoe groot een model is. Belangrijker is of de trainingsdata de juiste fysieke signalen bevat en of het aangeleerde gedrag werkt op andere robotlichamen en in echte taken.
China’s productieschaal geeft het land een belangrijk voordeel bij het inzetten van robots voor experimenten en dataverzameling. Maar aantallen kunnen een vertekend beeld geven wanneer de meeste machines vooral worden gebruikt om mogelijkheden te demonstreren, in plaats van terugkerende economische waarde te leveren.
Interact Analysis rapporteerde dat de wereldwijde productie van humanoïde robots in 2025 boven de 20.000 exemplaren uitkwam. Slechts ongeveer 10 procent werd ingezet in toepassingen in de echte wereld; de meeste robots gingen naar onderzoek, dataverzameling of entertainment. Volgens dezelfde analyse was China de motor achter zowel het aanbod als de eerste toepassingen. 21
Die context is belangrijk voor de snelle groei van datacentra. Overheidssteun, grootschalige aankopen en programma’s waarbij data wordt teruggekocht, kunnen het aantal robots, locaties en opgenomen uren snel laten stijgen. Ze kunnen helpen een lerend ecosysteem op te bouwen, maar bewijzen op zichzelf niet dat klanten willen betalen voor robots die betrouwbaar kosten verlagen, de productie verhogen of werk uitvoeren dat mensen moeilijk kunnen doen.
De conferentie in Beijing liet niet zien dat China het probleem van fysieke intelligentie al heeft opgelost. Wel bleek dat de sector op uitzonderlijke schaal de onderdelen voor een mogelijke oplossing bijeenbrengt:
Ook Lightwheel’s voorgestelde ecosysteem wijst op zo’n terugkoppellus: open datastandaarden, dataverzameling die door evaluaties wordt gestuurd en een gezamenlijke ontwikkeling van data en modellen. 1
De belangrijkste conclusie is daarom bescheidener dan de stelling dat China al een robotbrein heeft gebouwd. China bouwt de fabrieken, meetinstrumenten en datasets die zo’n brein mogelijk moeten maken. Of die infrastructuur uiteindelijk breed inzetbare humanoïde robots oplevert, hangt af van de kwaliteit en fysieke nauwkeurigheid van de data, de compatibiliteit tussen hardware en de vraag of robots buiten demonstraties en onderzoekscentra blijvende economische waarde kunnen creëren.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
In China zijn volgens een analyse minstens 90 centra voor het verzamelen en trainen van data voor humanoïde robots operationeel of in aanbouw.
In China zijn volgens een analyse minstens 90 centra voor het verzamelen en trainen van data voor humanoïde robots operationeel of in aanbouw. Lightwheel AI werkt aan EgoSuite Open100K: een dataset van 100.000 uur met meer dan 15.000 taken en praktijksituaties; de eerste 10.000 uur zijn beschikbaar via Hugging Face.
Menselijke demonstraties zijn goedkoper dan dataverzameling met fysieke robots, maar missen belangrijke informatie zoals gewrichtskoppel en contactkrachten.