Uczestnicy panelu WAIC 2026 argumentowali, że w modelach świata kluczowe mogą być efektywność uczenia, dane z interakcji fizycznych i szybkie testy na robotach, a nie tylko liczba GPU. Roboty mają tworzyć zamkniętą pętlę rozwoju: modele pomagają przewidywać skutki działań, a wdrożone maszyny dostarczają danych i wer...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did WAIC 2026 panelists from Muka Robotics, Shengshu Technology, EvoPhys.ai, and Chengwei Capital argue that Chinese world-model startup. Article summary: The panel’s argument was not that China has matched U.S. frontier-AI resources, but that world models change the source of advantage: progress depends less exclusively on raw compute and more on efficient model design, a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Modele świata stają się jednym z głównych tematów tzw. fizycznej AI — systemów, które mają nie tylko generować przekonujące wideo, ale również reprezentować zmiany w otoczeniu i przewidywać skutki działań. Podczas WAIC 2026, czyli Światowej Konferencji Sztucznej Inteligencji w Szanghaju, przedstawiciele Muka Robotics, Shengshu Technology, EvoPhys.ai i Chengwei Capital przekonywali, że chińskie startupy mogą rywalizować w tej dziedzinie inaczej niż przez prostą próbę dorównania amerykańskim laboratoriom skalą modeli.
Nie twierdzili, że Chiny dysponują takim samym dostępem do najnowocześniejszej mocy obliczeniowej. Ich teza była inna: postęp modeli świata może coraz bardziej zależeć od efektywności uczenia, danych z realnych interakcji oraz szybkiego testowania na robotach. W takim układzie gęsty ekosystem firm sprzętowych i robotycznych może mieć znaczenie porównywalne z samą liczbą GPU. Skala obecności robotyki na WAIC daje kontekst tej argumentacji: w jednym z opisów wydarzenia wskazano udział ponad 200 firm z obszaru ucieleśnionej AI i robotyki. 8
Paneliści uznali, że porównywanie się z amerykańskimi laboratoriami budującymi modele bazowe jest mniej użyteczne w dziedzinie, która wciąż ustala własne standardy techniczne i biznesowe. Zespół dysponujący mniejszą mocą obliczeniową może pozostać konkurencyjny, jeśli tanio pozyskuje wartościowe dane z fizycznego świata, sprawnie wykorzystuje różnorodne zbiory danych i szybko sprawdza błędy na realnych maszynach.
Jako ilustrację podejścia stawiającego na efektywność przywoływano zgłoszony przez Muka Robotics wynik WorldArena: według relacji firma osiągnęła wysoką pozycję, używając 32 GPU. Jest to jednak wynik raportowany przez firmę, a nie niezależnie zweryfikowany miernik ogólnego przywództwa technologicznego. 3
Różnica ma praktyczne znaczenie. Model wideo można oceniać przede wszystkim po wiarygodności obrazu. Ucieleśniony model świata można natomiast skonfrontować z tym, czy przewidywane przez niego działanie robota rzeczywiście kończy się powodzeniem mimo ograniczeń fizycznych. Błędne przewidywanie kontaktu, ruchu albo stanu obiektu ujawnia się, gdy model steruje robotem lub wspiera jego sterowanie.
Sednem argumentu jest sprzężenie zwrotne między modelami świata a ucieleśnioną inteligencją:
Dlatego paneliści zwracali uwagę na skalę ekspozycji robotyki w Chinach. Oficjalny przewodnik WAIC opisywał ponad 300 robotów prezentowanych w dynamicznych scenariuszach zastosowań, a inne relacje mówiły o ponad 200 firmach z sektora ucieleśnionej AI i robotyki obecnych na wydarzeniu. 10
8
Nie dowodzi to, że jakikolwiek kraj ma już rozstrzygającą przewagę w danych. Wyjaśnia jednak logikę strategiczną panelu: duża i różnorodna baza robotów może zapewniać więcej okazji zarówno do zbierania danych o interakcjach, jak i do sprawdzania, czy fizyczne przewidywania modelu są użyteczne.
Panel wskazywał także na koordynację w stylu Shenzhen: dostawcy komponentów, integratorzy, producenci robotów i zespoły programistyczne mogą działać wystarczająco blisko — geograficznie i handlowo — by skrócić drogę od wykrycia błędu modelu do kolejnego eksperymentu.
W tej perspektywie korzyścią nie jest wyłącznie tańszy sprzęt. Chodzi o możliwość szybkiej zmiany konfiguracji czujników, chwytaka, procedury zbierania danych albo samego robota, a następnie sprawnego włączenia nowych danych do treningu. W fizycznej AI jakość modelu jest ściśle związana z maszynami, sensorami i środowiskami, które służą do zbierania i weryfikacji danych.
Pozostaje to jednak strategiczną hipotezą, a nie udowodnioną gwarancją przewagi technologicznej. Sprawny łańcuch dostaw może przyspieszać eksperymenty, ale sam nie rozwiązuje problemów generalizacji, bezpieczeństwa, niezawodności ani opłacalności wdrożeń.
Prace Shengshu Technology nad modelem world-action pokazują konkretny przykład podejścia skoncentrowanego na architekturze. Badanie MotuBrain opisuje wspólną generatywną formulację dla wideo i działań: modelowanie polityki sterowania, modelowanie świata, generowanie wideo, dynamika odwrotna oraz wspólne przewidywanie wideo i akcji stają się różnymi trybami wnioskowania jednego modelu. 32
Shengshu podaje, że MotuBrain wspólnie modeluje rozumienie, przewidywanie i działanie, aby lepiej wykorzystywać heterogeniczne dane oraz wzmacniać transfer między zadaniami. 33 W praktyce jest to próba ograniczenia podziału między systemem obserwującym otoczenie, systemem prognozującym jego zmianę i systemem wybierającym działanie.
Nie oznacza to, że pojedyncza opublikowana architektura rozstrzygnęła kierunek rozwoju branży. Pokazuje jednak, dlaczego uczestnicy panelu upatrują w projektowaniu modeli dźwigni rozwoju: jeśli jedna struktura potrafi wykorzystywać wiedzę z zadań wideo, działania i przewidywania fizycznego, wzrost użytecznych zdolności nie musi być prostą funkcją rosnącej mocy obliczeniowej.
EvoPhys.ai przedstawiano jako projekt mierzący się z tym samym ograniczeniem z innej strony: poprzez uczenie prawidłowości fizycznych na podstawie elementarnych interakcji, zamiast opierać się przede wszystkim na ogromnych, starannie przygotowanych zbiorach wideo. Zamierzonym efektem ma być model lepiej osadzony w zjawiskach takich jak siła, kontakt, ruch i konsekwencje działania.
Na WAIC było widać aktywność zbliżoną do tego kierunku. TrendForce podał, że Moore Threads zaprezentował pełny trening EvoPhys-World Uniwersytetu Pekińskiego — opisywanego jako model świata 5D — na krajowej infrastrukturze obliczeniowej. 9 Potwierdza to rozwój takich prac, ale nie jest niezależnym potwierdzeniem szerszych twierdzeń panelu o przewadze wydajności, efektywności danych czy przywództwie Chin.
Metafora Góry Tai oddaje dwie strony tej samej historii.
Jeżeli modele świata staną się kluczową warstwą dla robotów, systemów autonomicznych i symulacji, wczesne zespoły mogą współkształtować istotne standardy: jakie dane zbierać, jak oceniać rozumowanie fizyczne, które roboty wspierać i jakie zastosowania przynoszą realną wartość. Brak ustalonego globalnego lidera oraz gotowego produktu może stworzyć przestrzeń dla pionierów.
Brak wzorca zwiększa zarazem ryzyko wykonawcze. Startupy muszą podejmować kosztowne decyzje dotyczące potoków danych, platform sprzętowych, architektur modeli, metod oceny, klientów i modeli biznesowych, zanim rynek pokaże, które wybory okażą się trwałe. Weryfikacja w fizycznym świecie może być też wolniejsza i droższa niż ocena systemu działającego wyłącznie w oprogramowaniu.
Dlatego wypowiedzi panelu nie należy odczytywać jako ogłoszenia, że Chiny już wygrały wyścig modeli świata. To raczej teza o naturze konkurencji: w rodzącej się dziedzinie, gdzie modele muszą uczyć się ze świata fizycznego i w nim działać, tempo iteracji, jakość danych i architektura mogą stać się strategicznie równie ważne jak moc obliczeniowa.
Wiarygodność tej wizji zweryfikują nie konferencyjne deklaracje, lecz wyniki w czterech obszarach:
Dostępne źródła potwierdzają dużą obecność robotyki na WAIC oraz opublikowaną przez Shengshu formulację world-action. Nie ustanawiają natomiast niezależnie konkretnych porównań mocy obliczeniowej przedstawianych przez panel ani ogólnobranżowej przewagi Chin. Najuczciwiej traktować te twierdzenia jako ambitną tezę strategiczną, której wartość zależeć będzie od powtarzalnych wyników w realnym świecie. 8
10
32
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Uczestnicy panelu WAIC 2026 argumentowali, że w modelach świata kluczowe mogą być efektywność uczenia, dane z interakcji fizycznych i szybkie testy na robotach, a nie tylko liczba GPU.
Uczestnicy panelu WAIC 2026 argumentowali, że w modelach świata kluczowe mogą być efektywność uczenia, dane z interakcji fizycznych i szybkie testy na robotach, a nie tylko liczba GPU. Roboty mają tworzyć zamkniętą pętlę rozwoju: modele pomagają przewidywać skutki działań, a wdrożone maszyny dostarczają danych i weryfikują prognozy w rzeczywistych warunkach.
To ambitna teza strategiczna, nie dowód na wygraną Chin: otwarty rynek wymusza kosztowne decyzje o danych, sprzęcie, metodach oceny i modelu biznesowym.