Atlas — мультимодальна модель World Labs для просторового інтелекту, яка працює з текстом, зображеннями, відео та 3D даними. Модель має генерувати зображення й відео з керованою траєкторією камери, відновлювати сцени за кількома фотографіями та створювати нові ракурси.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Atlas, the multimodal AI world model launched by Fei-Fei Li’s World Labs, and how does it work, what 3D generation and reconstructio. Article summary: Atlas is World Labs’ next-generation “omni” world model: a single pretrained system that natively accepts text, images, video, and 3D/camera information to generate, reconstruct, and simulate spatially consistent environ. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Atlas — це нова мультимодальна модель World Labs, яку компанія описує як «omni world model» для просторового інтелекту. Вона має нативно працювати з текстом, зображеннями, відео та 3D-інформацією в межах однієї системи. Її завдання — не просто створити правдоподібний відеокадр, а змоделювати простір так, щоб об’єкти, ракурси й рух камери залишалися узгодженими. 9
Це відрізняє Atlas від багатьох звичайних генераторів зображень і відео. Такі системи часто оптимізують кожен кадр передусім за візуальною правдоподібністю. Atlas же позиціонується як модель, де важливими є просторові зв’язки: що саме розташоване в сцені, з якої точки це видно та як вигляд зміниться під час руху камери.
World Labs називає Atlas мультимодальним авторегресійним дифузійним трансформером, попередньо навченим з нуля. Модель пов’язує візуальні дані з їхнім положенням у спільному просторовому контексті, а потім генерує нові кадри, ракурси або 3D-результати, які мають відповідати цьому контексту. 9
Користувач може надати одне або кілька референсних зображень, інформацію про камеру чи заздалегідь спроєктовану траєкторію її руху. Після цього Atlas здатен відтворювати потрібні ракурси, зокрема частини сцени, яких не було безпосередньо видно на вихідних матеріалах.
Однак невидимі ділянки не «зчитуються» як перевірені фізичні вимірювання. Модель відновлює їх на основі доступних візуальних даних і власних навчених припущень про те, як зазвичай виглядають об’єкти та простори.
У підсумку Atlas має дві пов’язані ключові можливості:
Ту саму просторову репрезентацію World Labs планує використовувати і для симуляцій — наприклад, зі зміною освітлення, руху, фону або конфігурації об’єктів у середовищі для подальших робототехнічних завдань. 9
За описом World Labs, Atlas підтримує кілька режимів генерації:
Компанія називає керування камерою «піксельно точним». У цьому випадку траєкторія камери є частиною самого процесу генерації, а не редагуванням, накладеним після створення відео. Потенційно це дає змогу змінювати композицію кадру, синтезувати рухи камери або створювати нові сцени на основі невеликої кількості візуальних референсів. 9
Практична цінність підходу — у поєднанні творчого контролю та просторових даних. Текст може описати, що має бути в сцені, а зображення й геометрія камери — підказати, де саме розташовані об’єкти та під яким кутом їх потрібно показати. Тому Atlas намагається зайняти проміжне місце між генеративним відео та традиційним 3D-виробництвом.
World Labs заявляє, що Atlas може реконструювати реальні сцени за одним або кількома десятками вхідних зображень. За словами компанії, у багатьох випадках для достатньо точного результату може вистачити двох або трьох фотографій. Якщо ж пріоритетом є деталізація, а не відновлення невидимих зон за припущеннями, модель здатна врахувати понад 100 ракурсів. 9
Очікується, що результат включатиме як зображення з нових точок огляду, так і явні 3D-представлення. Тобто Atlas має не просто створити відеоряд, який добре виглядає з одного заданого кута, а змоделювати сцену достатньо повно, щоб показувати її з інших позицій.
Тут є важливе застереження. Якщо простір відзнятий лише частково, приховані поверхні все одно доведеться домислювати. Реконструкція може виглядати переконливо, але помилятися щодо предмета за перешкодою, розмірів, прихованої кімнати або геометрії поверхні. Тому високу візуальну якість Atlas не слід автоматично сприймати як гарантовано точну, придатну для інженерних вимірювань реконструкцію.
World Labs стверджує, що Atlas перевершує спеціалізовані сучасні моделі 3D-реконструкції у внутрішніх оцінюваннях компанії. У презентації запуску наведено кількісні результати для двох основних напрямів — генерації з урахуванням камери та 3D-реконструкції. Водночас сама компанія зазначає, що жоден окремий бенчмарк не може повністю охопити весь спектр можливостей універсальної моделі. 9
Це важливі результати, але вони залишаються заявами виробника, а не незалежно підтвердженим галузевим консенсусом. У доступних матеріалах немає повного відтворюваного пакета оцінювання з усіма протоколами наборів даних, балами кожної моделі, оцінками невизначеності, вагами моделі та реплікаціями сторонніх дослідників.
Додаткові перевірки особливо потрібні для таких сценаріїв:
Marble — уже наявний користувацький продукт World Labs для створення постійних 3D-світів, якими можна досліджувати та користуватися. Він приймає текст, одне або кілька зображень, відео, панорами та спрощені 3D-структури, після чого генерує середовища для перегляду й подальшої роботи. 6
Atlas — не просто нова назва функції Marble, а наступне покоління моделі, що має лежати в основі цієї продуктової лінійки. World Labs заявляє, що Atlas працюватиме у майбутніх версіях Marble та інших продуктах компанії. 9
Отже, розподіл ролей виглядає так: Atlas постачає більш універсальну просторову модель, а Marble залишається доступним середовищем для створення та перегляду постійних 3D-світів. Документація Marble описує створення таких світів із тексту, зображень і відео, після чого їх можна досліджувати та використовувати в інших робочих процесах. 6
World Labs запустила World API як публічний інтерфейс для генерації досліджуваних 3D-світів із тексту, зображень, панорам, мультиракурсних даних і відео. Документація описує асинхронний процес: застосунок надсилає запит на генерацію, а після завершення отримує готовий світ. 8
3
Це не те саме, що завантажувана локальна версія Atlas або модель для роботи в реальному часі. Опублікований API зосереджений на асинхронній генерації та отриманні результату. Доступні матеріали не підтверджують наявність публічного ендпоінта саме для Atlas, локальних ваг моделі чи режиму реального часу. 3
8
9
Для розробників це означає, що поточний публічний інструментарій — Marble і API-орієнтований процес генерації світів, а не обов’язково прямий доступ до всіх можливостей Atlas, описаних у дослідницькому анонсі.
World Labs розглядає Atlas як універсальну просторову систему для кількох ринків.
Керована камерою генерація може допомогти художникам змінювати композицію відзнятого матеріалу, створювати віртуальні рухи камери та отримувати нові кадри з невеликої кількості референсів. Головна обіцянка тут — не поодинокий ефектний кадр, а контрольована просторова варіативність. 9
Marble уже зосереджений на постійних середовищах, які можна досліджувати. Atlas потенційно розширить цей напрям, давши дизайнерам модель для генерації або реконструкції сцен із збереженням ракурсів і просторових зв’язків. 6
9
Архітектурні, промислові та креативні команди можуть використовувати текст, зображення й інші референси для створення просторових концептів, якими можна переміщатися. Керування точкою огляду може спростити перевірку та ітеративне доопрацювання ідей порівняно з набором не пов’язаних між собою рендерів. 6
9
World Labs також описує сценарій «real-to-sim» — створення симульованих середовищ зі звичайних відеозаписів, генерацію RGB- і depth-даних із перспективи робота, а також зміну об’єктів, освітлення, руху та фону для навчання навігації й маніпуляцій. 9
Це амбітний напрям, але сама по собі візуальна реалістичність не доводить наявності точної фізики, надійних розмірів або достатньої ефективності перенесення навичок із симуляції в реальний світ. Такі твердження потребують окремих оцінювань для конкретних завдань.
У матеріалах запуску Atlas не представлений як широко доступний продукт. World Labs збирає заявки на ранній доступ, тоді як Marble і World API залишаються документованими публічними варіантами. 9
8
У переглянутих матеріалах немає стандартного прайсингу Atlas, інформації про розмір моделі, навчальні дані, апаратну конфігурацію, затримку під час інференсу, пропускну здатність або вартість обчислень для однієї генерації. 9
Для команд, які розглядають Atlas як виробничий інструмент, це принципові питання. Вражаюча демонстрація не показує, чи буде такий процес доступним у великому масштабі, достатньо швидким для інтерактивної роботи та стабільним на великій кількості різних сцен.
Atlas варто розуміти як спробу World Labs об’єднати генеративне відео, 3D-реконструкцію та просторове моделювання в одній мультимодальній системі. Її ключова ідея — зробити положення камери та 3D-контекст повноцінними вхідними даними, а не розглядати кожен згенерований кадр як незалежне зображення.
Заявлені можливості виглядають масштабно: керована генерація зображень і відео, реконструкція за кількома ракурсами, явні 3D-результати та потенційне створення середовищ для робототехнічних симуляцій. Проте в доступних матеріалах Atlas залишається системою раннього доступу. До появи незалежних оцінювань, даних про ціну, швидкодію та фізичну точність найсильніші твердження World Labs варто сприймати як перспективний напрям досліджень і продуктову заявку, а не як остаточно доведену готовність до промислової експлуатації.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Atlas — мультимодальна модель World Labs для просторового інтелекту, яка працює з текстом, зображеннями, відео та 3D даними.
Atlas — мультимодальна модель World Labs для просторового інтелекту, яка працює з текстом, зображеннями, відео та 3D даними. Модель має генерувати зображення й відео з керованою траєкторією камери, відновлювати сцени за кількома фотографіями та створювати нові ракурси.
World Labs заявляє про відео до однієї хвилини у роздільності 1440p і перевагу Atlas над спеціалізованими моделями 3D реконструкції у власних оцінюваннях.