Робот из США научился импровизировать и использовал банан вместо щетки

Карина Гетьман Автор статьи
Американский стартап Generalist AI представил м...

AI Изображение создано с помощью ИИ и носит иллюстративный характер

Американский стартап Generalist AI представил мультимодальную модель GEN-1.5 для управления роботами. Она обучается новым действиям по короткой демонстрации, помещенной в контекстное окно, или с помощью небольшой донастройки градиентным методом. В ходе тестов робот под управлением GEN-1.5 проявил способность к импровизации, например, использовал банан вместо щетки, чтобы собрать кубики в чашу. Описание опубликовано в блоге компании. Об этом пишет сайт N + 1.

Традиционные алгоритмы управления роботами представляли собой заранее заданные программы, которые хорошо работают на заводском конвейере, но могут дать сбой при неожиданных ситуациях. С развитием нейросетей появилась возможность обучать роботов методом проб и ошибок в симуляции и на записанных демонстрациях. Однако для освоения новых навыков обычно требовалось дополнительное обучение на большом объеме данных.

Поворотный момент наступил с выходом модели GPT-3, которая решала незнакомые задачи по примерам, подаваемым в контекстное окно без обновления весов. Разработчики Generalist AI применили аналогичный подход в физическом мире. Модель GEN-1.5 обучали более восьми месяцев на записях взаимодействий с объектами в жилых домах, на складах и фабриках. Она обрабатывает видео, показания сенсоров, текстовые команды и данные о положении частей робота, удерживая в контексте около 30 секунд данных и генерируя команды с частотой 100 герц.

Для обучения новому действию достаточно короткой демонстрации — от 3 до 12 секунд видео с камер и сенсомоторных данных. Этот фрагмент можно создать в симуляции или показать человеком на камеру. GEN-1.5 не копирует движения буквально, а определяет цель действия и воспроизводит ее с помощью собственного «тела» в текущем окружении, что позволяет выполнять задачи при другом положении или размере предметов.

В тестах GEN-1.5 управляла стационарным роботом с двумя руками-манипуляторами. После одной демонстрации в контекстном окне без дополнительного обучения робот успешно справлялся с заданиями в среднем в 59 процентах случаев. После десяти шагов градиентного спуска на пяти минутах данных успешность поднималась до 83 процентов. Один шаг дообучения на одной минуте данных давал 66,5 процента успешных выполнений.

Отдельно проверяли способность модели выходить за пределы показанных траекторий. После дообучения на демонстрациях, где щеткой сметали кубик в чашу, роботу положили вместо щетки банан — модель использовала его как импровизированную щетку. При замене на совок робот менял стратегию и сбрасывал кубик в чашу. В тестах на открывание банки модель задействовала обе руки, хотя в обучающих примерах использовалась одна. После донастройки навык переносился на незнакомые бутылки и емкости, а также модель могла объединять несколько действий в последовательность.

Модель может использовать демонстрации, выполненные в симуляции, или наблюдать за человеком, показывающим действие перед камерами. Пока возможности ограничены сравнительно простыми задачами, а навыки из контекста менее устойчивы, чем после дообучения. Авторы рассчитывают, что масштабирование предварительного обучения сократит объем данных и вычислений, необходимых для освоения новых задач.

Последние новости Крыма уже в твоем телефоне - подписывайся на телеграм-канал «Крым Live»