Paneldeltagare på WAIC 2026 menade att kinesiska startups inom världsmodeller kan tävla på andra villkor än i kapplöpningen om störst AI modeller och mest beräkningskraft. Grundidén är ett kretslopp: världsmodeller hjälper robotar att förutse följder av handlingar, medan robotar ger den interaktionsdata och återkopp...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did WAIC 2026 panelists from Muka Robotics, Shengshu Technology, EvoPhys.ai, and Chengwei Capital argue that Chinese world-model startup. Article summary: The panel’s argument was not that China has matched U.S. frontier-AI resources, but that world models change the source of advantage: progress depends less exclusively on raw compute and more on efficient model design, a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Världsmodeller har seglat upp som ett nyckelområde inom fysisk AI – alltså AI som inte bara skapar trovärdiga videor, utan försöker förstå hur en miljö förändras och vad som händer när en robot agerar i den.
På WAIC 2026, World Artificial Intelligence Conference i Shanghai, argumenterade en panel med bland andra Muka Robotics, Shengshu Technology, EvoPhys.ai och Chengwei Capital för att kinesiska startups kan konkurrera utan att kopiera den amerikanska vägen med allt större modeller och allt fler grafikprocessorer.
Poängen var inte att Kina skulle ha samma tillgång till toppmodern beräkningskapacitet som USA. I stället menade paneldeltagarna att framsteg för världsmodeller i högre grad kan avgöras av inlärningseffektivitet, data från verkliga robotinteraktioner och snabba tester på fysiska maskiner. WAIC:s omfattning ger ett sammanhang till resonemanget: enligt en rapport deltog över 200 företag inom kroppslig AI och robotik. 8
Panelens tes var att den vanliga jämförelsen med amerikanska AI-labb är mindre användbar i ett område där både teknik och marknad fortfarande håller på att ta form. Ett team med mindre datorkraft kan enligt detta synsätt ändå vara konkurrenskraftigt om det kan samla in relevant data från den fysiska världen billigt, träna modeller som använder blandade datatyper effektivt och snabbt prova vad som fungerar – och inte fungerar – på riktiga robotar.
Muka Robotics resultat i WorldArena, som i rapportering beskrivs som en topplacering med 32 GPU:er, lyftes fram som exempel på en sådan effektivitetstanke. Resultatet är dock ett företagsrapporterat benchmarkutfall och inte en oberoende granskning av övergripande tekniskt ledarskap. 3
Skillnaden är viktig i praktiken. En videomodell kan bedömas utifrån hur trovärdigt resultatet ser ut. En världsmodell för robotik kan däremot prövas mot verkligheten: lyckas roboten med den åtgärd modellen har förutsett, trots friktion, kontakt, rörelse och föränderliga objekt? Felaktiga antaganden om fysiken blir snabbt synliga när systemet används på en fysisk maskin.
Panelens resonemang bygger på ett återkopplingskretslopp mellan världsmodeller och kroppslig intelligens:
WAIC visade varför panelen anser att detta kan vara relevant i Kina. Shanghais officiella guide till konferensen beskrev över 300 robotar i dynamiska tillämpningar, medan annan rapportering räknade fler än 200 deltagande företag inom kroppslig AI och robotik. 10
8
Det bevisar inte att något land har ett avgörande dataövertag. Men det förklarar den strategiska logiken: en stor och varierad robotsektor kan ge fler tillfällen att både samla interaktionsdata och kontrollera om en modells fysiska förutsägelser faktiskt är användbara.
Panelen pekade också på en Shenzhen-liknande samordning inom hårdvara. När komponentleverantörer, systemintegratörer, robottillverkare och mjukvaruteam finns nära varandra – geografiskt och kommersiellt – kan avståndet mellan ett modellfel och ett nytt experiment bli kortare.
Fördelen handlar då inte enbart om billigare hårdvara. Det handlar om att snabbt kunna ändra en sensoruppsättning, ett robotverktyg, en rutin för datainsamling eller en robotkonfiguration och därefter föra tillbaka den nya datan till träningen. För fysisk AI är modellkvaliteten tätt sammanflätad med maskinerna, sensorerna och miljöerna som används för att samla in och validera data.
Detta är fortfarande en strategisk hypotes, inte ett bevis på tekniskt försprång. En snabb leveranskedja kan påskynda experiment, men löser inte automatiskt frågor om generalisering, säkerhet, tillförlitlighet eller lönsamhet.
Shengshu Technologys arbete med så kallade world-action-modeller ger ett konkret exempel på den arkitekturdrivna väg som beskrevs i panelen. I forskningen kring MotuBrain modelleras video och handlingar i ett gemensamt generativt ramverk. Policymodellering, världsmodellering, videogenerering, invers dynamik och gemensam video-handlingsprognos blir där olika sätt att använda samma modell. 32
Shengshu beskriver MotuBrain som en modell som samtidigt hanterar förståelse, förutsägelse och handling, med målet att utnyttja heterogena data bättre och förbättra överföring mellan uppgifter. 33 Enkelt uttryckt är ambitionen att minska klyftan mellan att observera världen, bedöma hur den utvecklas och välja nästa handling.
Det betyder inte att en enskild publicerad arkitektur har avgjort fältet. Men det illustrerar varför panelen ser modellutformning som en möjlig hävstång: om samma ramverk kan återanvända information från video, handlingar och fysiska förutsägelser behöver kapacitet inte växa i ett enkelt ett-till-ett-förhållande till mängden datorkraft.
EvoPhys.ai presenterades som ett angreppssätt på samma flaskhals från ett annat håll: att lära sig fysiska regelbundenheter ur grundläggande interaktioner, i stället för att främst förlita sig på enorma mängder kuraterad videodata. Tanken är att modellen ska få en starkare förankring i krafter, kontakt, rörelse och konsekvenserna av handlingar.
Liknande arbete syntes på WAIC. TrendForce rapporterade att Moore Threads visade upp fullständig träning av Pekinguniversitetets EvoPhys-World – beskriven som en 5D-världsmodell – på inhemsk datorinfrastruktur. 9 Det bekräftar aktiv utveckling inom området, men styrker inte oberoende panelens bredare påståenden om relativ prestanda, dataeffektivitet eller nationellt ledarskap.
Panelens metafor fångar två sidor av samma argument.
Om världsmodeller blir ett grundlager för robotar, autonoma system och simulering kan tidiga aktörer påverka viktiga standarder: vilken data som ska samlas in, hur fysiskt resonemang ska utvärderas, vilka robotplattformar som ska stödjas och vilka tillämpningar som faktiskt skapar värde. Avsaknaden av en etablerad global ledare eller färdig produktmall kan ge utrymme för bolag som rör sig först.
Samma avsaknad av mall ökar genomföranderisken. Startups måste fatta dyra beslut om datapipelines, hårdvaruplattformar, modellarkitekturer, utvärderingsmetoder, kunder och affärsmodeller innan marknaden har visat vilka val som håller över tid. Dessutom är validering i den fysiska världen ofta långsammare och dyrare än att testa en rent mjukvarubaserad modell.
Panelens argument ska därför inte läsas som att Kina redan har vunnit kapplöpningen om världsmodeller. Det är snarare en tes om hur konkurrensen kan förändras: i ett nytt fält där modeller måste lära av och agera i den fysiska världen kan iterationshastighet, datakvalitet och arkitektur bli strategiska faktorer vid sidan av datorkraft.
Tesens hållbarhet kommer att avgöras mindre av konferensbudskap och mer av resultat på fyra områden:
De tillgängliga källorna belägger ett stort robot- och kroppslig-AI-deltagande på WAIC samt Shengshus publicerade world-action-formulering. De visar däremot inte oberoende de specifika jämförelserna av beräkningskapacitet, det påstådda antalet möjliga robotföretag som datakällor eller ett branschomfattande kinesiskt försprång. De påståendena bör därför ses som en ambitiös strategisk tes, vars trovärdighet avgörs av upprepningsbara resultat i verkliga miljöer. 8
10
32
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Paneldeltagare på WAIC 2026 menade att kinesiska startups inom världsmodeller kan tävla på andra villkor än i kapplöpningen om störst AI modeller och mest beräkningskraft.
Paneldeltagare på WAIC 2026 menade att kinesiska startups inom världsmodeller kan tävla på andra villkor än i kapplöpningen om störst AI modeller och mest beräkningskraft. Grundidén är ett kretslopp: världsmodeller hjälper robotar att förutse följder av handlingar, medan robotar ger den interaktionsdata och återkoppling som modellerna behöver för att förbättras.
Möjligheten innebär också en risk: utan en beprövad global affärsmodell måste bolagen själva hitta rätt dataflöden, arkitektur, utvärderingar och kommersiella användningsområden.