PhiZero používá přístup „nejdřív uvažuj, potom vykresli“: budoucí vývoj scény nejprve zapíše pomocí diskrétních tokenů fyzického jazyka. Tokenizer se zaměřuje na přechody mezi stavy, nikoli na opakované kódování textur, osvětlení a pozadí.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is CASIA’s PhiZero world model, published in the August 21, 2026 arXiv paper “PhiZero: A World Model Built Around Physical Language,” h. Article summary: PhiZero is CASIA’s proposed “reason-then-render” world model: it first represents predicted world-state changes as a short sequence of learned discrete “physical-language” tokens, then renders those changes into video. I. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
PhiZero, který navrhli výzkumníci z Institutu automatizace Čínské akademie věd (CASIA), je světový model postavený na naučené diskrétní reprezentaci nazvané fyzický jazyk. Namísto přímého předvídání každého budoucího snímku v hustém vizuálním prostoru nejprve odhaduje, jak se mění stav světa, a teprve poté tyto změny vykreslí do videa. 1
2
Toto rozdělení řeší jednu z hlavních slabin predikce v pixelovém prostoru: vzhled a dynamika se mohou vzájemně „zamotat“. Model dokáže věrně napodobit textury, světlo i pozadí, ale přitom chybně odhadne samotný pohyb nebo interakci objektů. PhiZero proto staví dynamiku do role hlavního předmětu predikce a vzhled řeší odděleně jako podmínku pro následné vykreslení. 1
2
PhiZero pracuje v režimu reason-then-render, tedy „nejdřív uvažuj, potom vykresli“:
Pojem „fyzický jazyk“ neznamená běžná slova ani věty srozumitelné člověku. Jde o naučené symboly, jejichž kombinace zachycují změny ve scéně — například pohyb a interakce — místo prostého popisu vzhledu jednotlivých snímků. Reprezentace vzniká samořízeným učením z videí z reálného světa. 1
2
3
Zjednodušeně lze architekturu shrnout takto:
První snímek = jak scéna vypadá; tokeny fyzického jazyka = jak se mění; dekodér = jak tuto změnu zobrazit.
Tokenizer zpracovává časový vývoj videa, místo aby každý budoucí snímek posuzoval jako samostatný vizuální cíl. Jeho dotazový bottleneck vytahuje kompaktní sadu vlastností na úrovni přechodů a soustředí reprezentaci na vývoj stavu, nikoli na každý obrazový detail. 1
To je první rozdíl oproti běžnému videokodeku. Tokenizer se snaží zachytit rozdíl mezi stavy, takže nemusí znovu a znovu přenášet statické informace, jako jsou povrchové textury nebo vzhled pozadí.
Spojité vlastnosti přechodů následně procházejí konečnou skalární kvantizací neboli FSQ. Ta je převádí na diskrétní indexy a vytváří konečnou slovní zásobu, která slouží jako fyzický jazyk PhiZero. 1
2
Díky diskrétní podobě může sekvenci tokenů autoregresivně předpovídat model podobný jazykovému modelu. Nemusí tedy skládat dlouhý proud vizuálních latentních tokenů, ale krátkou trajektorii přechodů mezi stavy.
Slovo „jazyk“ zde označuje funkci reprezentace: jde o kompaktní sekvenci, nad níž lze provádět predikci a uvažování. Jednotlivé tokeny ale nemusí být lidsky interpretovatelné jako pojmy typu „gravitace“ nebo „odboč doleva“.
Dekodér PhiZero dostává čistý první snímek jako zdroj vysokofrekvenčních informací o vzhledu. Sekvence fyzického jazyka dodává informaci o tom, co se má po tomto okamžiku změnit, zatímco dekodér rekonstruuje vizuální detaily potřebné pro výsledné video. 2
Model tak rozděluje práci praktickým způsobem. Přechodové tokeny nemusejí svou omezenou kapacitu spotřebovat na každou texturu, světelné podmínky, identitu objektů nebo detail pozadí. Velkou část tohoto kontextu poskytne přímo první snímek.
Popsaný trénink navíc používá zahřívací fázi s čistým šumem, aby se dekodér při učení rekonstrukce nemohl opírat o částečně dostupné informace z budoucích snímků. Musí se tedy naučit využívat podmínku prvního snímku a kontext fyzického jazyka. 2
U přibližně čtyřsekundového klipu o 33 snímcích uvádí článek reprezentaci pomocí 256 diskrétních tokenů fyzického jazyka ze slovní zásoby o zhruba 25 000 symbolech. Reprezentace Wan2.2 VAE naproti tomu používá 44 800 spojitých vizuálních tokenů. V tomto příkladu se tak délka sekvence zmenšila přibližně 175krát, při zachování konkurenceschopné kvality rekonstrukce. 1
Číslo je ale potřeba číst opatrně. Porovnává počet tokenů reprezentace, nikoli celkový počet bitů, využití paměti, latenci ani náklady na kompletní inferenci. PhiZero stále potřebuje rozsáhlý difuzní nebo flow-matching dekodér a pro vykreslení klipu také počáteční obrazový snímek. Nejsilnější tvrzení se proto týká abstrakce a komprese pro uvažování, nikoli záruky 175krát vyšší rychlosti nebo stejně velké úspory hardwarových nákladů. 1
2
Robotický systém by mohl pomocí kompaktní sekvence přechodů předpovědět důsledky akce ještě předtím, než vytvoří detailní vizuální předpověď. To může zpřehlednit plánování a simulaci podmíněnou akcí, zejména pokud se stejná dynamika přenáší mezi různými vizuálními styly. Projekt zmiňuje mimo jiné interaktivní modelování světa, simulaci podmíněnou akcí a přenos pohybu. 2
4
Potenciální přínos nespočívá v tom, že by robot automaticky získal úplnou teorii fyziky. PhiZero mu nabízí užší mezikrok: nejprve reprezentovat a skládat pravděpodobné změny ve světě a teprve potom věnovat výpočetní kapacitu obrazovým detailům.
Stejné oddělení je relevantní i pro dopravní situace. Pro systém může být důležitější předpovědět, jak se budou v čase vyvíjet vozidla a další účastníci provozu — zda začnou brzdit, pojedou dál, dají přednost nebo se vzájemně ovlivní — než přesně reprodukovat strukturu vozovky či aktuální osvětlení kamery.
Jde však o architektonický důsledek návrhu, nikoli o důkaz, že je PhiZero připraven pro bezpečnostně kritické řízení. Video může působit uceleně a přitom obsahovat chybnou trajektorii. Naučené tokeny navíc samy o sobě nejsou interpretovatelnými ani ověřitelnými fyzikálními veličinami.
Tradiční vizuální reprezentace připomínají komprimovaný videosoubor: zachovávají tolik informací, aby bylo možné znovu sestavit snímky. PhiZero se snaží o něco bližšího krátkému programu popisujícímu trajektorii. Sekvence fyzického jazyka je mezivrstva, kterou předpovídá vizuálně-jazykový reasoner, a dekodér z ní následně vytvoří obrazové body. 1
2
4
Tento posun by mohl zpřístupnit skládání a přenos uvažovaných dynamik. Systém by mohl přechodové vzorce upravovat, porovnávat nebo přenášet, aniž by pokaždé nejprve generoval všechny vizuální detaily. Zda se tato výhoda projeví v širokém spektru úloh, závisí na tom, jak dobře naučená reprezentace zachová dynamiku důležitou pro konkrétní použití.
PhiZero nabízí konkrétní způsob, jak ve světovém modelu vytvořit explicitní úzké hrdlo pro dynamiku: naučit diskrétní reprezentace přechodů, předpovídat je z počáteční scény a záměru a výsledek vykreslit až poté. Porovnání 256 tokenů s 44 800 tokeny ukazuje, proč je taková abstrakce lákavá. 1
Přístup ale nedokazuje, že je vyřešeno fyzické porozumění. Naučená slovní zásoba může zachycovat užitečné pravidelnosti, aniž by se dala čistě převést na fyzikální proměnné. A vizuálně přesvědčivé video zůstává nedokonalým testem toho, zda byl skutečný stav světa předpovězen správně.
Nejstřízlivější závěr je proto užší: PhiZero představuje slibnou výzkumnou architekturu, která odděluje to, jak scéna vypadá, od toho, jak se mění.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
PhiZero používá přístup „nejdřív uvažuj, potom vykresli“: budoucí vývoj scény nejprve zapíše pomocí diskrétních tokenů fyzického jazyka.
PhiZero používá přístup „nejdřív uvažuj, potom vykresli“: budoucí vývoj scény nejprve zapíše pomocí diskrétních tokenů fyzického jazyka. Tokenizer se zaměřuje na přechody mezi stavy, nikoli na opakované kódování textur, osvětlení a pozadí.
U zhruba čtyřsekundového klipu autoři uvádějí 256 tokenů namísto 44 800 spojitých vizuálních tokenů, tedy přibližně 175krát kratší sekvenci; nejde však automaticky o 175násobné zrychlení nebo úsporu hardwarových nákladů.