Исследователи из Пекинского технологического института, Университета Цинхуа и компании X Square Robot открыли код системы HOST, которая переносит показанную человеком операцию на двурукого робота без дополнительной настройки модели. В экспериментах системе требовалось в среднем 29 секунд на получение нового навыка. В это время входит запись демонстрационного ролика, а не продолжительное обучение весов нейросети.
Робот не копирует положение человеческих рук. Такой способ плохо работает из-за разницы в строении тела, расположении камер и скорости движений. HOST сначала определяет, до какого этапа задания дошел робот, затем прогнозирует, как должна выглядеть следующая стадия уже с его камер, и лишь после этого рассчитывает команды для манипуляторов.
Это решает проблему, которую легко пропустить при обычном просмотре видео. Человек может завершить один этап за три секунды, а робот потратит на него десять. Простая синхронизация по времени приведет к тому, что система начнет ориентироваться на неподходящий фрагмент демонстрации. HOST сопоставляет видео и действия по ходу выполнения задачи. В исследовании средняя ошибка такого сопоставления снизилась с 0,079 до 0,006.
Фраза об обучении по одному ролику верна только для новой операции после завершения базовой подготовки модели. На первом этапе HOST получил 193 462 траектории роботов по 229 заданиям. Затем использовались еще 5847 человеческих видео, связанных с выполнением тех же задач роботами. Единственный ролик во время применения системы не заменяет эту базу: он задает последовательность действий для уже подготовленной модели.

