Исследователи из Пекинского технологического института, Университета Цинхуа и компании X Square Robot открыли код системы HOST, которая переносит показанную человеком операцию на двурукого робота без дополнительной настройки модели. В экспериментах системе требовалось в среднем 29 секунд на получение нового навыка. В это время входит запись демонстрационного ролика, а не продолжительное обучение весов нейросети.
Робот не копирует положение человеческих рук. Такой способ плохо работает из-за разницы в строении тела, расположении камер и скорости движений. HOST сначала определяет, до какого этапа задания дошел робот, затем прогнозирует, как должна выглядеть следующая стадия уже с его камер, и лишь после этого рассчитывает команды для манипуляторов.
Это решает проблему, которую легко пропустить при обычном просмотре видео. Человек может завершить один этап за три секунды, а робот потратит на него десять. Простая синхронизация по времени приведет к тому, что система начнет ориентироваться на неподходящий фрагмент демонстрации. HOST сопоставляет видео и действия по ходу выполнения задачи. В исследовании средняя ошибка такого сопоставления снизилась с 0,079 до 0,006.
Фраза об обучении по одному ролику верна только для новой операции после завершения базовой подготовки модели. На первом этапе HOST получил 193 462 траектории роботов по 229 заданиям. Затем использовались еще 5847 человеческих видео, связанных с выполнением тех же задач роботами. Единственный ролик во время применения системы не заменяет эту базу: он задает последовательность действий для уже подготовленной модели.

HOST проверили на 50 ранее не встречавшихся операциях. Каждую выполняли по 20 раз со случайным расположением предметов. Средняя успешность 62% относится к набору задач, использованному для сравнения с другими методами. Лучший вариант с дополнительной настройкой по 50 роботизированным демонстрациям набрал 56%, а подготовка одной операции занимала около четырех часов. Авторы рассчитали, что HOST получает навык в 507 раз быстрее. Это результаты самих разработчиков, а не независимого тестирования.
Отказ от изменения параметров модели дает еще один полезный эффект. Новая операция хранится как внешнее видео, поэтому ее добавление не переписывает ранее освоенные навыки. В сравнении три системы с дополнительной настройкой сохранили от 20 до 43% прежней результативности, тогда как показатели HOST почти не изменились.
До домашнего робота, которому достаточно один раз показать уборку стола, HOST пока далеко. Все испытания проводились на одной платформе с двумя манипуляторами ARX R5, параллельными захватами и тремя RGB-камерами. Перенос метода на роботов с другим строением не проверен. Обычное видео также не передает усилие контакта, поэтому плохо описывает операции, где результат зависит от точного давления или силы захвата. Эти ограничения указаны в опубликованной исследователями работе.
HOST интересен не обещанием мгновенно превратить любую машину в универсального помощника. Метод отделяет базовое обучение от конкретной инструкции: большая модель готовится заранее, а новая последовательность передается ей видеозаписью. Один ролик здесь работает скорее как исполняемая инструкция, чем как полноценный учебный курс.
