Роботові недостатньо бачити лише те, що відбувається зараз. Якщо завдання складається з багатьох кроків, йому потрібно враховувати попередні дії, помічати відхилення від плану й вирішувати, що робити далі. Для цього бренд Scalabot компанії Songyan Dynamics представив HERON-CRA — другу модель у серії HERON після HERON-World Model. Її архітектура об’єднує пам’ять про хід завдання, механізм коригування дій і підхід до перенесення навичок між роботами. Поки що результати слід розглядати як демонстрації та заяви компанії, а не як незалежно підтверджену надійність системи.
6
14
15
Як пов’язані складові HERON-CRA
Пам’ять про завдання. Компонент Context Expert перетворює попередню просторову й смислову інформацію на структуровані токени, пов’язані в часі. Тому модель вибору дії може спиратися не лише на поточне зображення, а й на те, як змінювалася ситуація. Позначення «4D» тут означає тривимірний простір, простежений у часі.
6
9
Коригування рухів. RL Engine — описаний у матеріалах легкий компонент навчання з підкріпленням за схемою «актор — критик». Він має навчатися поправок до базової стратегії дій, а не замінювати її повністю. Окрема модель оцінює поступ у виконанні завдання. Ідея полягає в тому, щоб робот міг точніше діяти й виправляти відхилення, але наявні дані не дають змоги визначити, яку частку поліпшення забезпечує саме цей компонент.
5
9
Перенесення навичок і «репетиції». Попереднє навчання на даних від роботів різної конструкції покликане допомогти переносити навички між ними. Крім того, успіхи й невдачі в реальному середовищі можуть ставати початковими станами для HERON-World Model: вона генерує «уявні» траєкторії для подальшого навчання. Це задуманий цикл взаємодії двох моделей, а не доказ того, що змодельовані події стабільно відтворюють поведінку фізичного робота.
7
14
15
Що показали випробування
За повідомленням Scalabot, у тесті зі складання шкарпеток частка успішних спроб зросла з 38,5% до 97,8%. Це заявлений результат для конкретного завдання, а не загальний показник успішності роботизованих маніпуляцій. У наданих матеріалах немає незалежно перевірених відомостей про кількість спроб, умови тесту та базу порівняння.
12
Демонстрація приготування кави ілюструє, навіщо роботам пам’ятати попередні кроки тривалого завдання. Покази перенесення навичок між роботами та реагування на збурення так само ілюструють цілі системи — застосувати вивчене на іншій платформі й скоригувати дію, коли щось пішло не так. Однак самі демонстрації не встановлюють, як часто це вдається в незнайомих умовах, на інших роботах чи за різних перешкод.
4
6
15
Головне застереження: продумана архітектура й показова демонстрація — не те саме, що підтверджена надійність. Щоб оцінити HERON-CRA поза представленими прикладами, потрібні незалежні порівнювані випробування, зокрема тести, які окремо вимірюють внесок пам’яті, коригувального навчання, попереднього навчання та «уявних» траєкторій.
4
14
15