Robotům stačí krátké video: HOST a GEN-1.5 mění způsob, jak se učí nové dovednosti
HOST od Beijing Institute of Technology, X Square Robot a Tsinghua University získává novou dovednost v průměru za 29 sekund a při testu 50 úloh dosáhl průměrné úspěšnosti 62 % [1][17]. GEN 1.5 od Generalist AI používá krátkou demonstraci jako takzvaný fyzický prompt; firma uvádí 3–12 sekund videa a průměrnou úspěšn...
HOST od Beijing Institute of Technology, X Square Robot a Tsinghua University získává novou dovednost v průměru za 29 sekund a při testu 50 úloh dosáhl průměrné úspěšnosti 62 % [1][17].
GEN 1.5 od Generalist AI používá krátkou demonstraci jako takzvaný fyzický prompt; firma uvádí 3–12 sekund videa a průměrnou úspěšnost 59 % na 10 úlohách, zatím však chybí srovnatelná nezávislá validace [1][4].
Nejde o učení z ničeho: oba systémy využívají rozsáhlé předchozí trénování a novou ukázku zpracují až při použití, bez aktualizace parametrů.
HOST překonal nejsilnější zero shot baseline o 45 % a podle autorů získává dovednosti zhruba 507× rychleji než klasické dolaďování s 50 robotickými ukázkami na úlohu [1].
How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from GeneralAI-generated editorial hero image for How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
openai.com
Dva nové přístupy ukazují podobný směr: robot se nemusí pro každou jednotlivou úlohu znovu trénovat. Místo toho využije znalosti získané během rozsáhlého předchozího tréninku a krátké lidské video zpracuje jako kontext, podle něhož okamžitě naplánuje své pohyby.
Neznamená to, že se robot učí bez předchozích dat. Náročné učení je přesunuto do fáze vývoje základního modelu. Uživatel pak nemusí pro každou novou činnost shromažďovat stovky robotických demonstrací ani spouštět nové dolaďování parametrů.
Rychlé srovnání
Oblast
HOST
GEN-1.5
Hlavní princip
Jednorázová politika vizuální imitace propojuje lidské video s aktuálním stavem robota. Sleduje fázi úkolu a z vlastní perspektivy předpovídá, jaký výsledek má následovat, místo prostého kopírování trajektorie lidské ruky .
Velký multimodální model pro robotiku chápe krátkou senzorimotorickou demonstraci jako „fyzický prompt“ v kontextu a následně generuje akce robota .
Vstupy a výstupy
Lidské video, jazykový pokyn, pozorování robota a propriocepce, tedy údaje o poloze a pohybu jeho vlastního těla. Výstupem jsou akce bez aktualizace parametrů .
Až přibližně 30 sekund multimodální paměti, video, jazyk, senzory a propriocepce; model podle zveřejněných údajů vytváří akční trajektorie s frekvencí 100 Hz.
Tréninkový základ
Dvě fáze: předtrénování na 193 462 robotických trajektoriích z 229 úloh a následná adaptace na 5 847 dvojicích lidských videí a robotických trajektorií .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Robotům stačí krátké video: HOST a GEN-1.5 mění způsob, jak se učí nové dovednosti"?
HOST od Beijing Institute of Technology, X Square Robot a Tsinghua University získává novou dovednost v průměru za 29 sekund a při testu 50 úloh dosáhl průměrné úspěšnosti 62 % [1][17].
What are the key points to validate first?
HOST od Beijing Institute of Technology, X Square Robot a Tsinghua University získává novou dovednost v průměru za 29 sekund a při testu 50 úloh dosáhl průměrné úspěšnosti 62 % [1][17]. GEN 1.5 od Generalist AI používá krátkou demonstraci jako takzvaný fyzický prompt; firma uvádí 3–12 sekund videa a průměrnou úspěšnost 59 % na 10 úlohách, zatím však chybí srovnatelná nezávislá validace [1][4].
What should I do next in practice?
Nejde o učení z ničeho: oba systémy využívají rozsáhlé předchozí trénování a novou ukázku zpracují až při použití, bez aktualizace parametrů.
Generalist AI uvádí více než osm měsíců průběžného trénování na datech z reálných fyzických interakcí; v předtrénování podle firmy nebyla použita simulační data .
Délka jediné demonstrace
Získání nové dovednosti trvá v průměru přibližně 29 sekund .
Firma uvádí 3–12 sekund jediné demonstrace .
Je nutné klasické retrénování?
Ne. Dovednost se získává při použití, bez aktualizace parametrů pro konkrétní úlohu .
U jednorázového promptování ne. Generalist AI uvádí, že nejsou potřeba gradientové aktualizace ani fine-tuning .
Rozsah testu
50 nových manipulačních úloh s různými předměty, nástroji a typy pohybu; každá úloha byla vyzkoušena 20krát .
Veřejné ukázky zahrnují například otevření sklenice, rozepnutí pouzdra, smetení předmětu do misky, vložení fixu do kelímku nebo nasypání šroubků. Firma ale nezveřejnila srovnatelně přesně popsaný testovací soubor.
Úspěšnost
Průměrně 62 % na nových úlohách .
Generalist AI uvádí 59 % průměrné úspěšnosti při one-shot učení na 10 různých manipulačních úlohách . Výsledek však není nezávisle ověřený ani přímo srovnatelný s HOST.
Dodatečná adaptace
Autoři uvádějí lepší výsledek než nejsilnější zero-shot demonstrační baseline a také překonání supervised fine-tuningu se 50 robotickými ukázkami na úlohu .
Pokud samotný prompt nestačí, firma nabízí few-shot adaptaci: 1–10 gradientových kroků s 1–5 minutami dat, přibližně 10–50 demonstracemi .
Efektivita
Přibližně 507× rychlejší získání dovednosti než při supervised fine-tuningu s 50 robotickými ukázkami na úlohu .
Místo často tisíců gradientových kroků má stačit 3–12sekundová demonstrace, případně 1–10 adaptačních kroků. Jde však o tvrzení firmy, nikoli o nezávisle změřené srovnání .
Jak funguje HOST
HOST, zkratka pro Human-to-robot One-Shot Skill AcquisiTion, nepřevádí lidský pohyb jednoduše do souřadnic robotického ramene. Takový postup by byl citlivý na rozdíly mezi lidským tělem, kamerou, robotem a prostředím.
Systém se místo toho snaží určit, v jaké fázi úkolu se člověk ve videu nachází a jaký další stav má robot dosáhnout. Robot porovnává vlastní pozorování s průběhem demonstrace, předpovídá očekávaný výsledek a z něj odvozuje potřebné akce. Video se tak stává aktivním vodítkem pro řízení, nikoli jen záznamem pohybu.
Významné je, že se model při osvojování nové úlohy nepřepisuje. Tím se omezuje riziko takzvaného katastrofického zapomínání, kdy by se robot při učení nové činnosti zhoršil v dříve zvládnutých úkolech. HOST byl podle autorů testován na 50 dosud neviděných úlohách a dosáhl 62% průměrné úspěšnosti .
Robustnost však nebyla bezchybná. Při změnách osvětlení, objektů, scény a při rušení člověkem se podle zveřejněných výsledků výkon snížil o 1 %, 4 %, 6 % a 9 % .
Co přináší GEN-1.5
GEN-1.5 staví na širším pojetí robotického základního modelu. Demonstrace se vloží do jeho kontextového okna jako krátký „fyzický prompt“ a model se pokusí úkol provést bez vytvoření nové, pro danou činnost speciálně natrénované politiky.
Generalist AI uvádí schopnosti jako imitaci člověka robotem, přenos ukázky ze simulace do reálného světa, spojování více promptovaných chování nebo improvizaci při použití nástrojů . Příklady zveřejněné firmou zahrnují otevření nádoby, rozepnutí pouzdra či přesunutí předmětu do misky.
Důležitá je ale jedna nuance: GEN-1.5 není ve všech situacích striktně „bez trénování“. Pro snadnější úkoly má stačit jednorázové promptování bez aktualizace parametrů. U obtížnějších úloh může systém použít few-shot adaptaci s několika gradientovými kroky a několika minutami dat .
Firma uvádí průměrnou úspěšnost 59 % na 10 rozmanitých manipulačních úlohách při one-shot učení . Veřejně dostupné informace ale nepopisují dostatečně podrobně protokol, počet pokusů, výběr úloh ani baseline, takže číslo nelze férově postavit vedle výsledku HOST jako přímé měřítko.
Proč je tento směr důležitý
Tradiční robotika často vyžaduje přesné naprogramování každého kroku, návrh odměny, dlouhý sběr teleoperačních dat nebo opakovaný fine-tuning pro každé nové prostředí. Přístup HOST a GEN-1.5 se blíží způsobu, jakým se učí člověk: někdo úkol ukáže a robot se pokusí pochopit cíl, postup i důležité interakce.
Největší změna se týká rozhraní mezi člověkem a robotem. Místo programování by mohlo v řadě případů stačit krátké video. Základní model dodá obecné znalosti o fyzice, uchopování a pohybu; demonstrace určí, co má robot tentokrát udělat.
HOST tento rozdíl vyjadřuje konkrétními čísly: průměrnou dobou 29 sekund a tvrzeným 507násobným zrychlením oproti supervised fine-tuningu s 50 robotickými demonstracemi na úlohu . Skutečná úspora ale závisí na tom, kolik práce a výpočetních prostředků bylo zapotřebí k vytvoření původního základního modelu.
Co zatím výsledky nedokazují
HOST není důkazem spolehlivosti v otevřeném světě. Jde o akademický preprint a kontrolovaný laboratorní test 50 vybraných úloh. Průměrná úspěšnost 62 % zároveň znamená, že robot v současné podobě selže přibližně ve značné části pokusů . Výkon v domácnostech, průmyslu, dlouhých vícefázových úkolech nebo bezpečnostně kritických situacích zůstává neověřený.
GEN-1.5 má slabší nezávislou ověřitelnost. Informace o modelu, délce trénování, absenci simulačních dat, délce promptu i adaptačních možnostech pocházejí především od Generalist AI nebo z materiálů navazujících na její oznámení .
Chybí společný veřejný benchmark. U GEN-1.5 nejsou dostatečně doloženy standardizovaný počet úloh, přesný protokol pokusů, agregovaná one-shot úspěšnost, srovnání s baselinem, zveřejnění modelu a dat ani reprodukce třetí stranou.
Celkový obraz je proto opatrně optimistický. HOST poskytuje konkrétní akademický důkaz, že robot může získat novou manipulační dovednost z jediného videa bez aktualizace parametrů v definovaném testu. GEN-1.5 naznačuje, že podobné chování může vzniknout jako schopnost široce předtrénovaného robotického modelu pracovat s kontextem.
Směr je přesvědčivý, ale praktický závěr je zatím skromnější: učení pozorováním se v robotice skutečně prosazuje, nenahrazuje však ještě důkladné ověřování úloh, bezpečnostní inženýrství ani adaptaci na nepředvídatelné prostředí.