Если робот выполняет задачу в несколько этапов, ему недостаточно видеть только то, что происходит сейчас. Нужно помнить предыдущие действия, замечать отклонения и понимать, как продолжить работу после ошибки. Для этого Songyan Dynamics выпустила под брендом Scalabot модель HERON-CRA — вторую в серии HERON после HERON-World Model. Её возможности пока следует оценивать по представленным демонстрациям и заявлениям компании, а не как независимо подтверждённый результат.
6
14
15
Как связаны компоненты модели
Память о ходе задачи. Компонент Context Expert преобразует сведения о расположении и значении объектов на предыдущих этапах в структурированные токены контекста. Описание «4D» здесь означает трёхмерное пространство с учётом времени. Такая история должна помогать модели выбирать следующее действие, опираясь не только на последний кадр, но и на то, как менялась обстановка.
6
9
Коррекция действий. RL Engine — лёгкий компонент обучения с подкреплением, описанный как остаточная схема «актор — критик». Он учится вносить поправки в действия базовой модели, а модель оценки отслеживает продвижение к цели. Это задумано для более точного управления и восстановления после ошибок. Однако доступные данные не позволяют отдельно измерить вклад именно RL Engine в итоговый результат.
5
9
Перенос и дополнительные тренировки. Предварительное обучение на данных роботов с разным устройством призвано облегчить перенос навыков между ними. Удачные и неудачные попытки в реальном мире также могут задавать начальные состояния для HERON-World Model, которая генерирует воображаемые последовательности дальнейших событий для обучения. Это предложенная схема совместной работы двух моделей, а не доказательство того, что смоделированное будущее надёжно предсказывает поведение физического робота.
7
14
15
Что показали испытания — и чего они не показали
Scalabot сообщает, что в её тесте успешность складывания носков выросла с 38,5% до 97,8%. Это заметное заявленное улучшение в конкретной задаче, но не универсальный показатель успешности роботизированных манипуляций. В предоставленных материалах нет независимо проверенных данных о числе попыток, условиях испытания и исходных показателях для сравнения.
12
Демонстрация приготовления кофе показывает, зачем роботу может понадобиться память о нескольких последовательных шагах. Показанные перенос навыка между роботами и реакция на помехи иллюстрируют другие цели разработки. Сами по себе эти примеры не устанавливают, как часто система добивается успеха с незнакомыми предметами, на других роботах или при разнообразных нарушениях хода задачи.
4
6
15
Главный вопрос — повторяемость результатов. Чтобы оценить надёжность HERON-CRA за пределами демонстраций, нужны независимые сопоставимые испытания. Отдельные проверки памяти, корректирующего обучения, предварительного обучения и воображаемых сценариев помогли бы также выяснить, какой вклад вносит каждый компонент.
4
14
15