За повідомленням AgiBot, WITA Omni Preview набрала 85,21 у Daily Omni та посіла перше або спільне перше місце в шести з восьми показників. Daily Omni перевіряє, чи вміє ШІ пов’язувати звук із подіями в кадрі, визначати їхню послідовність і міркувати на основі обох каналів.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did AgiBot’s WITA-Omni Preview full-modal model achieve a leading 85.21 score and six first-place results out of eight indicators on the. Article summary: AgiBot’s result is best understood as a strong benchmark outcome enabled by native audio-video temporal reasoning, not as independently proven evidence of superior real-world robot intelligence. Daily-Omni is designed to. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
AgiBot повідомляє, що її WITA-Omni Preview досягла середнього результату 85,21 у бенчмарку аудіовізуального міркування Daily-Omni. Модель, за опублікованими результатами, була першою або розділила перше місце у шести з восьми показників, випередивши протестовані системи Qwen, Gemini, Doubao та NVIDIA. 1
18
23
Найобережніше пояснення цього результату — не просто більший масштаб моделі, а відповідність заявленого підходу тому, що саме перевіряє Daily-Omni: здатності пов’язувати звук, події в кадрі та момент, коли вони відбуваються.
Це важливий крок для мультимодального ШІ. Водночас один бенчмарк не доводить, що робот із такою моделлю буде загалом надійним у непередбачуваних соціальних чи фізичних ситуаціях.
Daily-Omni — це тест запитань і відповідей за відео зі звуком, призначений для оцінювання мультимодального міркування з часовим узгодженням. Набір даних містить 684 відео з повсякденними ситуаціями та 1 197 запитань із варіантами відповіді у шести типах завдань. 17
27
Тут недостатньо просто впізнати предмет у кадрі або розшифрувати сказане. Модель має встановити, які візуальні та звукові події сталися одночасно, визначити їхній порядок і використати докази з обох модальностей. У публічній таблиці Daily-Omni є показники аудіовізуального узгодження, порівняння, розуміння контексту, послідовності подій, висновування, міркування, а також окремі результати для відео тривалістю 30 і 60 секунд. 20
23
Наприклад, правильна відповідь може залежати від того, чи відрізнить система дві схожі на вигляд дії за звуком або чи зрозуміє, що звук пролунав до, під час або після видимої дії.
AgiBot описує WITA-Omni Preview як втілену, повномодальну модель для спільного розуміння тексту, зображень, аудіо та відео. 5
9 Це прямо відповідає задуму Daily-Omni: тест винагороджує моделі, які зберігають зв’язки між модальностями та подіями в часі, а не обробляють звук і відео як ізольовані сигнали.
17
20
Заявлений результат особливо сильний у категоріях аудіовізуального узгодження, порівняння, послідовності подій і для 30- та 60-секундних фрагментів. 1
18 Саме тут має допомагати спільне представлення трьох речей: що сталося, що було чути і коли це сталося.
AgiBot та публікації про модель також згадують навчання на десятках мільйонів годин відкритих і власних мультимодальних даних, включно з даними, що зберігають природний часовий зв’язок мовлення, зображення, руху та міміки. 5
6
9 Проте у відкритому доступі немає даних про розмір моделі, повний склад навчальних даних, абляційні дослідження, параметри інференсу чи деталі незалежно відтворюваного оцінювання. Тому пояснення причин результату 85,21 є правдоподібним, але не доведеним.
AgiBot описує WITA-Omni через архітектуру Thinker–Talker–Actor — «мислитель», «мовець» і «виконавець». Вона розширює звичну схему міркування й мовлення фізичними та виразними діями. 5
12
Заявлена мета такого дизайну — синхронізувати мовлення, дію та вираз на одній часовій шкалі, а не створювати їх як не пов’язані між собою етапи. 12
У звичайному робототехнічному конвеєрі обробка часто відбувається послідовно: сприйняття сцени формує висновок, мовна система готує відповідь, планувальник обирає дію, а модуль анімації чи керування її виконує. Кожна передача між етапами додає очікування — через це слова робота, жести й рухи можуть виглядати запізнілими або неузгодженими.
Паралельна схема Thinker–Talker–Actor має уникати частини такого режиму «зупинися й чекай». Поки модель і далі інтерпретує слова, рухи людини та оточення, вона потенційно може вже почати словесне підтвердження й запланувати відповідний жест або вираз. У принципі це дає природнішу черговість реплік і кращу відповідність між тим, що робот каже, та тим, як він рухається.
Але це архітектурна логіка, а не незалежно виміряний ефект: доступні джерела описують синхронізовані виходи, проте не наводять числового скорочення наскрізної затримки. 12
WITA-Omni — лише один рівень ширшої концепції втіленого ШІ від AgiBot. Її GE-Sim 2.0 (Genie Envisioner-Sim 2.0) — це замкнений відеосимулятор світу для роботизованих маніпуляцій. Маючи попередні кадри з кількох ракурсів і траєкторію дії, він генерує майбутні багаторакурсні сценарії, узгоджені із заданою поведінкою робота. Проєкт повідомляє, що модель донавчали на масштабних даних реальних роботів: телеоперації, взаємодії з фізичним контактом і розгортання політик безпосередньо на роботі. 11
Умовно ці компоненти мають різні ролі:
AgiBot також заявляла, що GE-Sim 2.0 очолює бенчмарк WorldArena. Однак у наявних матеріалах це твердження компанії, і його варто оцінювати окремо від результату Daily-Omni. 4
36
Результат Daily-Omni є корисним свідченням того, що WITA-Omni добре працює з чітко визначеним класом завдань: часовим аудіовізуальним міркуванням. Для взаємодії людини з роботом це доречно, адже системі треба співвідносити мовлення, звуки довкола, видимі дії та їхній час. 17
27
Але результат у бенчмарку не встановлює надійність у реальному застосуванні. Сам по собі він не вимірює безпечність керування, стійкість маніпуляцій, відновлення після помилок, довготривале планування, соціальну доречність у різних культурах або роботу в незнайомих умовах.
Найточніший висновок вужчий: заявлене лідерство WITA-Omni узгоджується з моделлю, спроєктованою для синхронного мультимодального розуміння та вираження. Щоб перетворити цю перевагу на підставу довіряти роботам у неструктурованих соціальних просторах, потрібні докази, що виходять далеко за межі Daily-Omni.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
За повідомленням AgiBot, WITA Omni Preview набрала 85,21 у Daily Omni та посіла перше або спільне перше місце в шести з восьми показників.
За повідомленням AgiBot, WITA Omni Preview набрала 85,21 у Daily Omni та посіла перше або спільне перше місце в шести з восьми показників. Daily Omni перевіряє, чи вміє ШІ пов’язувати звук із подіями в кадрі, визначати їхню послідовність і міркувати на основі обох каналів.
Архітектура Thinker–Talker–Actor має синхронізувати мультимодальне міркування, потокове мовлення, жести та вирази на спільній часовій шкалі.