Kiinassa toimii tai rakennetaan vähintään 90 humanoidirobottien datankeruu ja koulutuskeskusta – investointien painopiste siirtyy robottien kehoista niiden opettamiseen. Lightwheel AI:n EgoSuite Open100K tavoittelee 100 000 tuntia ensimmäisen persoonan ihmistoimintaa yli 15 000 tehtävässä ja tosielämän keruutilantee...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the 2026 World Robot Conference in Beijing reveal about China’s shift from building humanoid-robot bodies to collecting the data ne. Article summary: The conference signaled a strategic shift: China’s humanoid-robot race is moving from demonstrating capable bodies toward building the data pipelines, sensors, compute components, and models needed for general-purpose em. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Pekingissä järjestetty vuoden 2026 World Robot Conference antoi tilannekuvan siitä, mihin Kiinan humanoidirobottiala on etenemässä. Huomio ei kiinnity enää vain yhä kyvykkäämpien robottien rakentamiseen, vaan myös datainfrastruktuuriin, jonka pitäisi auttaa kouluttamaan niiden ”aivoja”.
Interact Analysisin tutkimukseen viitaten raportoitiin, että Kiinassa toimii tai on rakenteilla vähintään 90 humanoidirobottien datankeruu- ja koulutuskeskusta. Luku kertoo investointien painopisteen muuttumisesta. Samalla konferenssi toi esiin olennaisen eron: teollisen mittakaavan datantuotanto ei vielä todista, että datasta syntyy eri robotteihin, tehtäviin ja työympäristöihin siirtyvää älykkyyttä. 13
Humanoidirobotti tarvitsee muutakin kuin kuvia ja tekstiä. Hyödyllinen fyysinen älykkyys edellyttää tietoa siitä, mitä ihminen näkee, miten hän liikkuu, miten esineet reagoivat ja miten toiminta etenee ajan kuluessa.
Siksi ensimmäisen persoonan video, kehon asento, syvyystieto, tuntoaistimukset ja robotin oma tiladata ovat tärkeitä aineksia niin sanotuille kehollisen tekoälyn malleille.
Lightwheel AI teki ajatuksesta konkreettisen julkaisemalla EgoSuite-Open100K-datasetin. Hankkeen tavoitteena on koota 100 000 tuntia ensimmäisen persoonan ihmistoimintaa yli 15 000 tehtävässä ja yli 15 000 tosielämän keruutilanteessa. Aineistossa käytetään päähän ja ranteeseen kiinnitettyjä kameroita sekä käden ja koko kehon asentotietoa, semanttisia merkintöjä ja syvyystietoa. Ensimmäiset 10 000 tuntia ovat saatavilla Hugging Facessa, ja aineistoa on tarkoitus jakaa myös AtomGitissä. 1
12
Hyöty on ilmeinen: ihmisten toiminnasta voidaan kerätä laaja kuvaus arkipäiväisistä liikkeistä ja esineiden käsittelystä ilman, että jokainen esimerkki täytyy tallentaa kalliilla fyysisellä robotilla.
Ihmisen toiminta ei kuitenkaan automaattisesti vastaa robotin kokemusta. Ihminen korjaa tasapainoa, kitkaa ja kosketusta luonnostaan. Robotin on sen sijaan havaittava ja hallittava nämä ilmiöt oman kehonsa, antureidensa ja ohjausjärjestelmiensä kautta.
SenseTimen Intelligent Industries Research Instituten tutkija Tian Feng kuvasi kuutta rinnakkain käytettävää datankeruun tapaa. Niihin kuuluvat muun muassa etäohjaus, liikkeenkaappaus, synteettinen data ja tiedon kerääminen oikeilla tuotantolinjoilla. 13
Eri menetelmät tallentavat eri osan ongelmasta:
Raportoitu kustannusero on huomattava: robottikehosta riippumaton ihmisen toiminnan tallennus voi maksaa noin viidenneksen fyysisillä roboteilla tehtävään demonstraatiokeruuseen verrattuna. Vastapainona aineisto saattaa kuvata palkattujen datankerääjien tapaa suorittaa tehtävä, ei sitä, miten kokenut työntekijä sen tekisi. 13
Tämä ei tarkoita, että ihmisten data pitäisi hylätä. Se tarkoittaa, että sitä on käsiteltävä yhtenä kerroksena laajemmassa kokonaisuudessa, johon kuuluvat myös etäohjaus, robotin tiladata, simulointi ja todellisista käyttöönottoa kerätty palaute.
Konferenssin laajempi viesti oli, että robotiikan infrastruktuuriin kuuluu nyt myös demonstraatioiden ja sensorimotorisen toiminnan tallentamiseen tarvittava laitteisto – ei vain moottoreita, akkuja ja robottirunkoja.
Esillä olivat esimerkiksi ORBBECin robottikehosta riippumattomat ensimmäisen persoonan ja käsikäyttöiset kuvausjärjestelmät, BrainCon datakäsineet ja tuntoaistilla varustetut näppärät kädet sekä GigaDevicen mikro-ohjain-, muisti- ja analogiatuotteet. Yhdessä ne viittaavat laitteistopinoon, jolla demonstraatioita voidaan kerätä aiempaa edullisemmin. Tuotekohtaisia suorituskykyväitteitä ei kuitenkaan tässä yhteydessä ole riippumattomasti vertailtu. 13
Samalla syntyy standardointiongelma. Eri antureilla, kalibrointitavoilla, toiminta-avaruuksilla, väliohjelmistoilla ja merkintäkäytännöillä kerättyä dataa ei välttämättä voi yhdistää suoraan.
Tästä syntyy alan käyttämä ilmiö, ”saarekedata”: hyödylliset tallenteet jäävät kiinni niitä tuottaneeseen laitteisto- ja ohjelmistopinoon. Avoin datasetti voi lievittää ongelmaa, mutta avoimuus yksin ei takaa uudelleenkäyttöä. Tarvitaan yhteisiä tietomalleja, kalibrointitietoja, ajoitusstandardeja, rajapintoja ja arviointimenetelmiä, jotta datan määrä voi muuttua yhteiseksi kyvykkyydeksi. 13
Avoimeksi jää myös se, siirtyykö kieli- ja näkömalleista tuttu kaava – suurempi datamäärä ja suuremmat mallit tuottavat kyvykkäämpiä järjestelmiä – robotiikkaan.
Generalist AI:n marraskuussa 2025 julkaisema GEN-0-raportti antaa rohkaisevan mutta rajallisen vastauksen. Yhtiön kokeissa pienemmät mallit eivät kyenneet hyödyntämään yhä monipuolisempaa sensorimotorista dataa. Yhtiö kutsui ilmiötä ”jähmettymiseksi” (ossification). Suuremmilla malleilla suorituskyky parani edelleen, ja raportti sijoitti mahdollisen murroskohdan noin seitsemään miljardiin parametriin. 36
Kyse on merkittävästä havainnosta, mutta ei vielä koko robotiikka-alaa koskevasta skaalauslaista. Tulos perustuu yhden yhtiön malleihin, dataan ja arviointitapaan.
Robotiikassa on lisäksi ongelma, jota tekstimallit eivät kohtaa samalla tavalla: mallin on toimittava tietyn kehon, tietyn ympäristön ja todellisten fyysisten rajoitteiden kautta.
Käytännön kysymys ei siis ole vain se, onko malli riittävän suuri. Olennaista on, sisältääkö koulutusdata oikeat fyysiset signaalit ja siirtyykö opittu toimintamalli erilaisiin robottikehoihin ja todellisiin työtehtäviin.
Kiinan valmistuskapasiteetti antaa sille selvän edun robottien käyttöönotossa kokeita ja datankeruuta varten. Toimitusluvut voivat silti johtaa harhaan, jos suurinta osaa koneista käytetään edelleen kyvykkyyksien esittelyyn eikä toistuvaa taloudellista arvoa tuottavaan työhön.
Interact Analysisin mukaan humanoidirobottien maailmanlaajuinen tuotanto ylitti 20 000 kappaletta vuonna 2025, mutta vain noin 10 prosenttia niistä otettiin käyttöön todellisissa sovelluksissa. Suurin osa päätyi tutkimukseen, datankeruuseen tai viihteeseen. Kiina oli analyysin mukaan sekä tarjonnan että varhaisen käyttöönoton moottori. 21
IDC:n luvut puolestaan viittaavat siihen, että 78,4 prosenttia vuoden 2025 humanoidirobottien toimituksista meni esittelyihin, tutkimukseen tai datankeruuseen, kun tuotantolinjasovellusten osuus jäi pieneksi. Tätä tarkkaa jakaumaa on syytä tulkita varovasti, koska sen taustalla olevaa julkaisua ei ole tässä voitu riippumattomasti varmistaa.
Taustalla on tärkeä ero: valtion tuki, suurostot ja datan takaisinosto-ohjelmat voivat kasvattaa robottien, keskusten ja tallennettujen tuntien määrää nopeasti. Ne voivat auttaa rakentamaan oppimisekosysteemiä, mutta eivät yksin osoita, että asiakkaat maksavat roboteista, jotka luotettavasti pienentävät kustannuksia, kasvattavat tuotantoa tai tekevät työtä, johon ihmiset eivät helposti pysty. 13
Pekingin konferenssi ei osoittanut, että Kiina olisi jo ratkaissut kehollisen älykkyyden ongelman. Se osoitti, että maa kokoaa mahdollisen ratkaisun osia poikkeuksellisen suuressa mittakaavassa:
Lightwheelin ehdottama ekosysteemi viittaa samaan kehään: avoimiin datastandardeihin, arviointiin perustuvaan keruuseen sekä datan ja mallien yhteissuunnitteluun. 1
Johtopäätös on siksi rajatumpi kuin väite siitä, että ”Kiina on rakentanut robottiaivot”. Kiina rakentaa tehtaita, mittalaitteita ja datasettejä, joiden on tarkoitus tehdä tällaiset aivot mahdollisiksi.
Se, tuottaako infrastruktuuri laajasti hyödyllisiä humanoidirobotteja, riippuu datan laadusta, sen fyysisestä uskollisuudesta, laitteistojen yhteensopivuudesta ja ennen kaikkea siitä, pystyvätkö robotit luomaan pysyvää arvoa tutkimuslaboratorioiden ja esittelytilaisuuksien ulkopuolella.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kiinassa toimii tai rakennetaan vähintään 90 humanoidirobottien datankeruu ja koulutuskeskusta – investointien painopiste siirtyy robottien kehoista niiden opettamiseen.
Kiinassa toimii tai rakennetaan vähintään 90 humanoidirobottien datankeruu ja koulutuskeskusta – investointien painopiste siirtyy robottien kehoista niiden opettamiseen. Lightwheel AI:n EgoSuite Open100K tavoittelee 100 000 tuntia ensimmäisen persoonan ihmistoimintaa yli 15 000 tehtävässä ja tosielämän keruutilanteessa; ensimmäiset 10 000 tuntia ovat saatavilla Hugging Facessa.
Ihmisten liikedata on edullista ja laajaa, mutta siitä voi puuttua robotille tärkeää tietoa, kuten nivelvääntöä, kosketusvoimaa ja robotin oman kehon dynamiikkaa.