Стартап World Labs, основанный «крёстной матерью ИИ» Фей-Фей Ли, представил мультимодальную модель мира Atlas. Система, объединяющая текст, фото, видео и 3D-данные, позволяет генерировать детализированные трёхмерные сцены и кинематографичные видео в разрешении 1440p. Atlas умеет реконструировать реальные помещения по нескольким снимкам со смартфона, генерировать интерактивные симуляции для обучения роботов и моделировать движение камеры с любых ракурсов. Модель позиционируют как основу для развития «пространственного интеллекта» .

Архитектура и принцип работы

Atlas построен на архитектуре мультимодального авторегрессионного диффузионного трансформера (multimodal autoregressive diffusion transformer) . В отличие от генераторов видео, которые полагаются на текстовые описания для управления камерой, Atlas принимает геометрию и траектории камеры как нативные входные данные, что обеспечивает точное управление перспективой .

Ключевая инновация — механизм «пространственного контекста» (Spatial Context). Каждое входное изображение привязывается к конкретной 3D-позиции в пространстве. Это позволяет модели понимать, откуда был сделан снимок, и генерировать новые ракурсы с учётом геометрии сцены, а не просто интерполировать пиксели .

Ключевые возможности

1. Генерация с контролем камеры

Atlas может принимать от одной до шести опорных фотографий и генерировать видео длительностью до 1 минуты в разрешении 1440p, следуя точно заданной траектории камеры . Пользователь может указать конкретные координаты и углы обзора — система точно воспроизведёт желаемый ракурс. В тестах Atlas показал высокую точность выполнения инструкций: в слепом человеческом сравнении его предпочли модели Gemini Omni Flash в 81% случаев .

2. 3D-реконструкция реальных сцен

Модель способна восстанавливать трёхмерную структуру пространства по одной или нескольким фотографиям. Чем больше входных изображений, тем точнее реконструкция: с 2–3 снимками Atlas даёт достаточно точный результат, а при наличии более 100 изображений создаёт практически точную цифровую копию локации . Выходные данные могут быть представлены в виде облака точек (point cloud) или 3D-гауссианов (3D Gaussian splats) — формата, пригодного для рендеринга в реальном времени .

3. «Реальное-в-симуляцию» (Real-to-Sim) для роботов

Одно из ключевых применений Atlas — превращение реальных пространств в симуляции для обучения роботов. По снятым на обычный смартфон видео модель воссоздаёт виртуальную среду, в которой можно менять освещение, расположение объектов, прокладывать разные маршруты . Система генерирует цветные изображения (RGB) и карты глубины с датчиков, позволяя тестировать алгоритмы навигации без физического оборудования .

4. Генерация изображений и 360° панорам

Atlas также может генерировать статичные изображения и 360-градусные панорамы по текстовому описанию, обрабатывая сложные промпты и поддерживая различные визуальные стили .

Финансирование и доступность

World Labs привлёк более $1,2 млрд от инвесторов, включая Nvidia, AMD и Autodesk, что подтверждает интерес к технологиям «пространственного интеллекта» . На данный момент Atlas доступен в режиме раннего доступа для ограниченного круга партнёров; широкая публика сможет получить доступ через несколько недель .