HOST и GEN-1.5: как роботы учатся новым навыкам по одной демонстрации
HOST от Beijing Institute of Technology, X Square Robot и Tsinghua University осваивает новую манипуляцию в среднем за 29 секунд и показал среднюю успешность 62% на 50 новых задачах. GEN 1.5 от Generalist AI использует демонстрацию длительностью 3–12 секунд как «физическую подсказку»; компания сообщает о среднем рез...
HOST от Beijing Institute of Technology, X Square Robot и Tsinghua University осваивает новую манипуляцию в среднем за 29 секунд и показал среднюю успешность 62% на 50 новых задачах.
GEN 1.5 от Generalist AI использует демонстрацию длительностью 3–12 секунд как «физическую подсказку»; компания сообщает о среднем результате 59% на 10 разнообразных задачах, однако независимая проверка ограничена.
Обе системы не обновляют параметры модели при обучении по одной демонстрации: большая часть вычислительно дорогого обучения выполняется заранее, а видео задаёт новую задачу уже во время работы.
Результаты важны для перехода от программирования и сбора множества роботизированных демонстраций к более естественному подходу: человеку достаточно показать роботу, что нужно сделать.
How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from GeneralAI-generated editorial hero image for How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General.
Промпт ИИ
Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
openai.com
Обе разработки демонстрируют один и тот же важный сдвиг: робот может использовать короткую человеческую демонстрацию не как новые данные для длительного дообучения, а как контекст для немедленного выполнения задачи. Предварительно обученная модель уже обладает общими представлениями о физических действиях, а видео уточняет, какую именно манипуляцию нужно выполнить сейчас.
Главное различие между HOST и GEN-1.5
Параметр
HOST
GEN-1.5
Разработчики
Beijing Institute of Technology, X Square Robot и Tsinghua University
Generalist AI
Основной подход
Одноэтапная система визуальной имитации: робот сопоставляет собственное выполнение с этапом задачи на человеческом видео и прогнозирует нужный результат.
Мультимодальная embodied-модель, воспринимающая сенсомоторную демонстрацию как контекстную «физическую подсказку» и генерирующая действия робота.
Входные данные
Видео человека, текстовая инструкция, наблюдения робота и данные о положении его суставов; параметры модели во время выполнения не обновляются.
До 30 секунд мультимодального контекста, включая видео, язык, сенсорные данные и проприоцепцию; на выходе — траектории действий с частотой 100 Гц.
Основа обучения
Два этапа: предварительное обучение на 193 462 роботизированных траекториях по 229 задачам и адаптация на 5 847 самостоятельно собранных парах «видео человека — траектория робота».
Компания заявляет о более чем восьми месяцах непрерывного обучения на данных реального физического взаимодействия; симуляционные данные, по её утверждению, не использовались на этапе предварительного обучения.
Длительность одной демонстрации
Studio Global AI
Продолжайте свое исследование
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Каков краткий ответ на вопрос «HOST и GEN-1.5: как роботы учатся новым навыкам по одной демонстрации»?
HOST от Beijing Institute of Technology, X Square Robot и Tsinghua University осваивает новую манипуляцию в среднем за 29 секунд и показал среднюю успешность 62% на 50 новых задачах.
Какие ключевые моменты необходимо проверить в первую очередь?
HOST от Beijing Institute of Technology, X Square Robot и Tsinghua University осваивает новую манипуляцию в среднем за 29 секунд и показал среднюю успешность 62% на 50 новых задачах. GEN 1.5 от Generalist AI использует демонстрацию длительностью 3–12 секунд как «физическую подсказку»; компания сообщает о среднем результате 59% на 10 разнообразных задачах, однако независимая проверка ограничена.
Что мне делать дальше на практике?
Обе системы не обновляют параметры модели при обучении по одной демонстрации: большая часть вычислительно дорогого обучения выполняется заранее, а видео задаёт новую задачу уже во время работы.
В среднем около 29 секунд до приобретения нового навыка.
От 3 до 12 секунд по заявлению Generalist AI.
Требуется ли обычное дообучение
Нет: навык приобретается во время вывода, без обновления параметров под конкретную задачу.
Нет в режиме one-shot: компания заявляет об отсутствии градиентных обновлений и fine-tuning.
Охват задач
50 новых манипуляционных задач с разными объектами, инструментами и базовыми типами действий; по 20 испытаний на каждую задачу.
В публичных демонстрациях показаны открывание банки, расстёгивание чехла, сметание предмета в миску, помещение маркера в стакан, пересыпание болтов и варианты использования инструментов. Сопоставимого по описанию тестового набора в открытом доступе нет.
Успешность
В среднем 62% на новых задачах.
Generalist AI сообщает о среднем показателе 59% на 10 разнообразных манипуляционных задачах в режиме обучения по одной демонстрации; независимого подтверждения этой цифры пока недостаточно.
Сравнение с базовыми методами
По данным авторов, результат на 45% выше сильнейшего zero-shot-метода имитации и превосходит supervised fine-tuning с 50 роботизированными демонстрациями на задачу.
Компания утверждает, что при недостаточности одной подсказки возможна few-shot-адаптация: от 1 до 10 градиентных шагов на 1–5 минутах данных, то есть примерно на 10–50 демонстрациях.
Заявленная эффективность
Приобретение навыка примерно в 507 раз быстрее, чем supervised fine-tuning с 50 демонстрациями робота на каждую задачу.
Вместо традиционного обучения, которое может занимать десятки тысяч градиентных шагов, достаточно подсказки длиной 3–12 секунд либо 1–10 шагов адаптации для более сложных случаев. Это заявление компании, а не результат независимого стандартизированного бенчмарка.
Как работает HOST
HOST расшифровывается как Human-to-robot One-Shot Skill AcquisiTion — «одношаговое приобретение навыка от человека роботом». Важная особенность системы в том, что она не пытается буквально перенести траекторию человеческой руки на механическую руку робота.
Вместо этого HOST использует видео как ориентир по ходу выполнения задачи. Робот оценивает, на каком этапе находится сам, сопоставляет этот этап с демонстрацией и прогнозирует, каким должен выглядеть следующий результат с его собственной точки зрения. Затем система выводит действия, которые должны привести к этому результату.
Такой подход помогает учитывать различия между человеком и роботом: у них разные камеры, размеры конечностей, суставы и способы захвата. Роботу не нужно копировать каждое движение человека — ему нужно воспроизвести цель и последовательность взаимодействий с объектом.
В эксперименте HOST проверили на 50 ранее не встречавшихся задачах, выполняя по 20 попыток каждой. Средняя успешность составила 62%. Это показывает, что перенос навыка между объектами, инструментами и типами манипуляций уже возможен, но одновременно подчёркивает: примерно в четырёх случаях из десяти система всё ещё ошибается.
Авторы также проверяли устойчивость к изменениям освещения, объектов, сцены и вмешательству человека. По их данным, относительно базового результата в 62% потери составили соответственно 1%, 4%, 6% и 9%.
Что предлагает GEN-1.5
Generalist AI описывает GEN-1.5 как крупную embodied foundation model — базовую модель для физических действий робота. Её ключевая идея напоминает работу языковых моделей с контекстом: вместо обновления весов модели в неё помещается короткая демонстрация, после чего система пытается выполнить увиденную задачу.
Компания называет такой фрагмент видео «physical prompt», или физической подсказкой. Робот получает несколько секунд наблюдения, а затем сразу начинает действовать. Среди заявленных примеров — открывание банки, расстёгивание чехла и перемещение предмета в миску. Также Generalist AI заявляет о переносе действий от человека к роботу, соединении нескольких подсказанных навыков и выполнении в реальном мире задач, показанных в симуляции.
Однако GEN-1.5 не следует понимать как систему, которая никогда не обучается. В режиме одной демонстрации обновление параметров не требуется. Но для более трудных задач компания предлагает альтернативный режим few-shot-адаптации — несколько градиентных шагов на нескольких минутах данных.
Почему это не «обучение из ничего»
Самая важная оговорка касается слова «без обучения». Ни HOST, ни GEN-1.5 не начинают с пустого места.
До первого показа видео модели уже прошли дорогостоящее предварительное обучение на больших массивах данных о действиях роботов и людей. Это обучение формирует базовые знания о захвате, движении, контакте с поверхностями и последовательности действий. Короткая демонстрация затем не создаёт эти способности заново, а активирует и направляет уже имеющиеся.
Иными словами, стоимость обучения не исчезает — она переносится на более ранний этап и распределяется между множеством будущих задач. Для конечного пользователя это всё равно может стать огромным упрощением: вместо сбора сотен роботизированных траекторий и запуска отдельной оптимизации достаточно показать нужное действие один раз.
HOST делает эту разницу количественно заметной: в среднем 29 секунд на приобретение навыка и заявленное ускорение в 507 раз по сравнению с fine-tuning на 50 роботизированных демонстрациях.
Что эти проекты меняют в обучении роботов
Традиционный робот обычно требует подробного программирования, специальной настройки под задачу или большого набора демонстраций, собранных с помощью телеприсутствия. Такой процесс дорог, медленен и часто плохо переносится на новый объект или рабочее место.
HOST и GEN-1.5 предлагают более естественный интерфейс: не программировать, а показывать. Человек демонстрирует цель и порядок действий, а предварительно обученная система сама подбирает подходящую траекторию для конкретного робота.
Это приближает обучение машин к человеческому наблюдательному обучению, но пока только на ограниченном уровне. Человек может быстро понять задачу даже при изменении обстановки, инструмента или последовательности действий. Роботам же по-прежнему трудно справляться с длинными сценариями, неоднозначными инструкциями, неожиданными препятствиями и физически опасными ситуациями.
Ограничения и уровень доказательности
HOST — результат академического препринта, а не гарантия надёжности в реальном мире. Эксперименты проходили в контролируемой лабораторной среде на 50 отобранных новых задачах. Средняя успешность 62% пока не подтверждает готовность системы для любых бытовых, промышленных или критически важных сценариев. Нужны более долгие испытания и независимые воспроизведения.
Данные по GEN-1.5 заметно сложнее проверить независимо. Сведения о модели, длительности обучения, отсутствии симуляционных данных, продолжительности подсказки и возможностях адаптации опубликованы Generalist AI или распространены через её объявления.
Для GEN-1.5 пока нет сопоставимого открытого бенчмарка. В публичных материалах недостаточно информации о стандартизированном числе задач, протоколе испытаний, совокупной успешности в режиме one-shot, базовых моделях, доступности кода и данных или сторонних репликациях. Поэтому демонстрации GEN-1.5 — это свидетельство перспективной способности, но ещё не независимо подтверждённый рекорд.
В совокупности HOST даёт более конкретное академическое свидетельство того, что робот способен приобрести новый навык по одному видео без обновления параметров — на заранее определённом наборе манипуляций. GEN-1.5, в свою очередь, указывает на возможность появления такого поведения как контекстной способности крупной универсальной физической модели.
Направление действительно меняется: роботов постепенно учат не только через код и массовый сбор специализированных данных, но и через наблюдение. Однако до полноценной замены тестирования, инженерии безопасности и адаптации в неограниченной среде ещё далеко.
Generalist AI: GEN-1 Robot Learning for Cobots | The Bot Scout