1 октября 2026 года компания Runway, известная своей платформой генеративного видео, представила Praxis-1 — первую открытую world action model («модель мира-действия») для управления реальными роботами. Ключевая идея: робот учится физике и моторике, просматривая гигантские объёмы обычного видео из интернета, а не только скудные записи с дистанционного управления роботами.
Суть подхода: бесконечное видео вместо дорогих демонстраций
Каждый робототехнический проект упирается в одну проблему: реальных данных мало, а их сбор стоит огромных денег. Для редких сценариев — например, вождению или домашней робототехнике — собрать достаточный объём демонстраций физически невозможно.
Видео, однако, практически бесконечно. Люди снимают и загружают больше повседневной жизни за день, чем любая робототехническая лаборатория могла бы записать через дистанционное управление. Runway использовала свою большую видео-модель, которая уже понимает, как ведут себя объекты, как движутся руки и как выглядит задача на полпути, и превратила её в общую политику управления для роботов.
Ключевые результаты
Один контроллер для разных тел. Praxis-1 работает на разных «воплощениях» — двуруких манипуляторах, шестиосевых руках и мобильных базах — без переобучения под каждое устройство.
Сопоставимая точность с робототехническими данными. В эксперименте по размещению объектов (93 пары оценок) конечная ошибка после дообучения составила:
- 16,1 см при предобучении на веб-видео
- 16,0 см при предобучении на видео с дистанционного управления роботом
Разница в 0,1 см находится в пределах погрешности — это означает, что обычное видео может заменить дорогостоящие робототехнические данные на этапе предобучения.
Симуляция предсказывает реальность с корреляцией 0,95. Это позволяет проверять политики в виртуальной среде без постоянного занятия физического робота.
Партнёры и статус
Praxis-1 уже тестируется на оборудовании партнёров: Noble Machines (двурукая манипуляция), Standard Bots (рука RO1 с 6 степенями свободы) и Ultra (мобильная база). Веса модели планируется опубликовать в ближайшие месяцы в открытом доступе — но точная дата пока не названа.
Что пока не получается
Разработчики честно перечисляют четыре категории задач, с которыми модель пока справляется плохо:
- Много одинаковых объектов: выбрать один конкретный среди десятка похожих
- Захламлённые сцены: разобраться с наложением и перекрытием предметов
- Прозрачные объекты: лёд, пластик — нет чётких визуальных подсказок о расстоянии
- Мягкие ткани: одежда без фиксированных точек захвата
Причина в том, что визуальная информация передаётся роботу неполно — пиксели показывают, как рука поднимает чашку, но не дают углов суставов или силы захвата. Для этого и нужно дообучение на робототехнических данных, механизм которого Runway не раскрывает.
