HOST від Beijing Institute of Technology, X Square Robot і Tsinghua University навчає робота нової маніпуляції в середньому за 29 секунд без оновлення параметрів моделі та показав 62% успішності на 50 нових завданнях. GEN 1.5 від Generalist AI використовує демонстрацію тривалістю 3–12 секунд як «фізичну підказку» в...
Research answer

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Робототехніка поступово відходить від підходу, за якого кожне нове завдання вимагає окремого збору даних, сотень демонстрацій і тривалого донавчання. HOST та GEN-1.5 пропонують іншу модель: попередньо навчений робот отримує коротке відео як контекст і намагається виконати побачену дію одразу, під час роботи.
Це не означає, що роботи навчилися без попереднього досвіду. Найскладніша й найдорожча частина — масштабне базове навчання — відбувається заздалегідь. Натомість для нового користувача конкретне завдання може задаватися одним коротким показом, без повного перенавчання системи.
HOST — фреймворк Human-to-robot One-Shot Skill Acquisition, розроблений дослідниками Beijing Institute of Technology, X Square Robot і Tsinghua University. У препринті систему описують як спосіб опановувати нові маніпуляційні навички на етапі виконання, не змінюючи параметри політики робота.
На відміну від простого копіювання рухів людини, HOST намагається зіставити поточний стан робота з етапом виконання завдання у відео. Система враховує людську демонстрацію, мовну інструкцію, зображення з камер, нещодавні спостереження робота та його пропріоцептивні дані — інформацію про положення й рух власних суглобів. Далі вона прогнозує, яким має бути результат із перспективи самого робота, і виводить потрібні дії.
Підготовка HOST відбувалася у два етапи: попереднє навчання на 193 462 роботизованих траєкторіях для 229 завдань і подальша адаптація на 5 847 парах «відео людини — траєкторія робота». Після цього під час перевірки нове завдання можна було задати без оновлення параметрів моделі.
У додаткових тестах HOST зберігав більшу частину базового результату за зміни освітлення, предметів, сцени та під час втручання людини. Зниження показника становило відповідно 1%, 4%, 6% і 9%.
Водночас 62% — це не рівень, за якого роботу можна беззастережно доручати будь-яке нове завдання. Результат показує працездатність ідеї на визначеному наборі тестів, а не універсальну надійність у реальному світі.
GEN-1.5 від Generalist AI побудована навколо великої мультимодальної моделі для фізичної взаємодії. Вона приймає відео, мовні команди, сенсорні та пропріоцептивні дані, зберігає до 30 секунд мультимодального контексту й генерує траєкторії дій із частотою 100 Гц.
Коротка демонстрація тривалістю 3–12 секунд подається моделі як так званий physical prompt — фізична підказка. Після цього робот намагається виконати завдання без градієнтних оновлень і fine-tuning.
Generalist AI заявляє, що GEN-1.5 навчалася понад вісім місяців на реальних даних фізичної взаємодії, без симуляційних даних на етапі попереднього навчання. Саме це масштабне попереднє навчання, за задумом компанії, дає моделі базове розуміння маніпуляцій ще до того, як вона побачить нову демонстрацію.
У публічних прикладах фігурують відкривання банки, розстібання чохла, змітання предмета в миску, наливання болтів, потрапляння маркера в контейнер, використання інструментів і комбінування дій.
Компанія повідомляє про 59% середньої успішності на 10 різноманітних маніпуляційних завданнях після однієї демонстрації. Однак ці результати походять переважно з матеріалів Generalist AI та її публічних оголошень, тому їх складно безпосередньо порівнювати з академічною оцінкою HOST.
GEN-1.5 також має запасний режим. Якщо однієї демонстрації недостатньо, модель може адаптуватися за 1–10 градієнтних кроків, використовуючи 1–5 хвилин даних — орієнтовно 10–50 демонстрацій. Отже, твердження «без навчання» стосується саме режиму one-shot prompting, а не всіх можливих сценаріїв роботи системи.
Людина зазвичай не програмує кожен рух окремо, коли навчає когось простій дії. Вона показує результат і послідовність, а учень використовує попередній досвід, щоб відтворити їх у новій ситуації. HOST і GEN-1.5 наближають роботів до такого інтерфейсу: замість написання коду, проєктування винагороди чи збору великого набору роботизованих демонстрацій користувач може просто показати, що потрібно зробити.
Ключова зміна полягає в перенесенні витрат. Масштабне навчання не зникає — воно відбувається раніше й використовується багатьма наступними завданнями. Для конкретної нової навички робот уже не обов’язково проходить повний цикл оптимізації. Саме тому «навчання за секунди» точніше називати отриманням нової навички під час виконання на основі попередньо навчених здібностей.
Такий підхід також може допомогти уникати катастрофічного забування: якщо параметри не змінюються, додавання нового завдання не має стирати раніше набуті навички. Для HOST це є частиною заявленої переваги над традиційним донавчанням.
HOST має сильнішу академічну основу, але залишається результатом контрольованого лабораторного дослідження. 50 завдань і 20 спроб на кожне — змістовна перевірка, однак цього недостатньо для висновків про домашні середовища, промислові процеси, довгі послідовності дій або безпекові сценарії. Середня успішність 62% також означає, що система ще часто помиляється.
GEN-1.5 складніше оцінити незалежно. Дані про архітектуру, тривалість навчання, демонстраційний режим, результати та додаткову адаптацію переважно опубліковані самою Generalist AI або поширені через її оголошення.
Для GEN-1.5 наразі немає настільки ж чітко описаного публічного протоколу з кількістю завдань, кількістю повторів, базовими моделями, агрегованим результатом і незалежним відтворенням. Тому її демонстрації свідчать про перспективний потенціал, але ще не встановлюють перевірену межу можливостей.
У підсумку HOST показує, що набуття навички з одного людського відео без оновлення параметрів може працювати на визначеному наборі нових маніпуляцій. GEN-1.5, своєю чергою, вказує, що масштабне попереднє навчання може породити подібну здатність як контекстну функцію універсальнішої embodied-моделі. Напрям справді важливий, але роботи поки не готові замінити повноцінну перевірку завдань, інженерію безпеки та адаптацію до непередбачуваного середовища.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
HOST від Beijing Institute of Technology, X Square Robot і Tsinghua University навчає робота нової маніпуляції в середньому за 29 секунд без оновлення параметрів моделі та показав 62% успішності на 50 нових завданнях.
HOST від Beijing Institute of Technology, X Square Robot і Tsinghua University навчає робота нової маніпуляції в середньому за 29 секунд без оновлення параметрів моделі та показав 62% успішності на 50 нових завданнях. GEN 1.5 від Generalist AI використовує демонстрацію тривалістю 3–12 секунд як «фізичну підказку» в контексті моделі; компанія повідомляє про 59% середньої успішності на 10 завданнях, але незалежна перевірка обмежена.
Обидві системи не вчаться «з нуля»: їхня швидкість стала можливою завдяки масштабному попередньому навчанню на фізичних даних.