AgiBot oppgir at WITA Omni Preview fikk 85,21 % gjennomsnittlig treffsikkerhet på Daily Omni og første eller delt førsteplass i seks av åtte mål. Daily Omni tester om en modell kan koble lyd og bilde til riktig tidspunkt, forstå rekkefølgen på hendelser og resonnere på tvers av modaliteter.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did AgiBot’s WITA-Omni Preview full-modal model achieve a leading 85.21 score and six first-place results out of eight indicators on the. Article summary: AgiBot’s result is best understood as a strong benchmark outcome enabled by native audio-video temporal reasoning, not as independently proven evidence of superior real-world robot intelligence. Daily-Omni is designed to. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
AgiBots WITA-Omni Preview skal ha oppnådd en gjennomsnittsscore på 85,21 % på den audiovisuelle resonnementstesten Daily-Omni. Ifølge de publiserte resultatene ledet modellen seks av åtte delmål mot evaluerte systemer fra blant andre Qwen, Gemini, Doubao og NVIDIA. 1
18
23
Den mest nærliggende forklaringen er ikke nødvendigvis bare modellstørrelse. WITA-Omni er, slik AgiBot beskriver den, utviklet for å knytte sammen lyd, visuelle hendelser og tidspunkt – nettopp egenskapene Daily-Omni tester.
Det er et interessant framskritt for multimodal KI. Men det er ikke alene dokumentasjon på at en robot med modellen vil fungere pålitelig i åpne, sosiale eller fysisk krevende miljøer.
Daily-Omni er en test for audiovisuelle spørsmål og svar, utformet for å måle tidsmessig samordnet multimodalt resonnement. Datasettet omfatter 684 videoer fra hverdagslige situasjoner og 1 197 flervalgsspørsmål fordelt på seks oppgavetyper. 17
27
Utfordringen er mer enn å kjenne igjen en gjenstand i et bilde eller skrive ut tale. Modellen må avgjøre hvilke hendelser i bilde og lyd som skjer samtidig, forstå hva som skjer før og etter, og bruke informasjon fra begge kilder for å svare. Den offentlige resultatoversikten omfatter samordning mellom lyd og bilde, sammenligning, kontekstforståelse, hendelsesrekkefølge, slutning, resonnement og delsett med 30- og 60-sekunders videoer. 20
23
Et riktig svar kan altså kreve at modellen skiller mellom to like visuelle hendelser med ulik lyd – eller forstår om en lyd kom før, under eller etter en synlig handling.
AgiBot beskriver WITA-Omni Preview som en «embodied-native», fullmodal modell for samlet forståelse av tekst, bilder, lyd og video. 5
9 Det samsvarer godt med Daily-Omnis oppbygning: Testen belønner modeller som bevarer sammenhengen mellom modaliteter over tid, framfor å behandle lyd og video som uavhengige inndata.
17
20
Det rapporterte resultatet var særlig sterkt innen samordning av lyd og bilde, sammenligning, hendelsesrekkefølge og videoene på 30 og 60 sekunder. 1
18 Dette er nettopp områder der en felles representasjon av hva som skjedde, hva som ble hørt og når det skjedde kan være en fordel.
AgiBot og omtaler av modellen viser også til trening på titalls millioner timer med åpne og proprietære multimodale data, inkludert data som skal bevare den naturlige timingen mellom tale, bilder, bevegelse og ansiktsuttrykk. 5
6
9 Samtidig mangler offentlig rapportering om modellstørrelse, full treningsmiks, ablasjonsstudier, innstilllinger ved kjøring og uavhengig reproduserbare evalueringsdetaljer. Derfor kan man ikke slå fast hvilken enkelt teknisk beslutning som forklarer scoren på 85,21. Forklaringen er plausibel, men ikke bevist.
AgiBot beskriver WITA-Omni med en Thinker–Talker–Actor-arkitektur. Den utvider det velkjente mønsteret med resonnering og tale til også å omfatte fysiske og uttrykksfulle handlinger. 5
12
Det uttalte målet er synkronisering: Tale, handling og uttrykk skal samordnes på én tidslinje, ikke produseres som isolerte trinn. 12
En tradisjonell robotløsning kan være i stor grad sekvensiell: Sanser tolkes først, deretter produserer en språkmodell et svar, en planlegger velger handling, og til slutt utfører en animasjons- eller kontrollmodul bevegelsen. Hver overlevering kan skape ventetid og få robotens ord, gester og bevegelser til å virke frakoblet.
Et parallelt Thinker–Talker–Actor-oppsett er ment å redusere noe av denne ventingen. Mens modellen fortsatt tolker en persons ord, bevegelser og omgivelser, kan den begynne på en muntlig bekreftelse og planlegge et passende fysisk uttrykk. I prinsippet kan det gi mer naturlig turveksling og bedre samsvar mellom det roboten sier og hvordan den beveger seg.
Dette er imidlertid en arkitektonisk begrunnelse, ikke en uavhengig kvantifisert effekt. De tilgjengelige kildene beskriver synkroniserte utdata, men oppgir ingen målt reduksjon i total forsinkelse. 12
WITA-Omni er ett lag i AgiBots bredere satsing på kroppslig, eller «embodied», KI. GE-Sim 2.0 (Genie Envisioner-Sim 2.0) er en lukket videosimulator for robotmanipulering. Med historiske bilder fra flere kameravinkler og en handlingsbane som inndata genererer den framtidige flerkameraforløp som følger den angitte robotatferden. Prosjektet opplyser at modellen er trent på omfattende data fra virkelige roboter, inkludert fjernstyring, kontaktintensiv samhandling og kjøring av robotpolicyer direkte på maskinen. 11
Konseptuelt kan de tre delene ha ulike roller:
AgiBot har også opplyst at GE-Sim 2.0 leder WorldArena-testen. Den rangeringen er imidlertid en selskapsopplysning i materialet som er tilgjengelig her, og bør vurderes separat fra Daily-Omni-resultatet. 4
36
Daily-Omni-resultatet er relevant dokumentasjon på at WITA-Omni gjør det godt på en tydelig avgrenset kategori oppgaver innen tidsmessig audiovisuelt resonnement. Evnen til å koble tale, omgivelseslyder, synlige handlinger og timing er relevant når roboter skal samhandle med mennesker. 17
27
Men en benchmarkscore dokumenterer ikke pålitelig bruk i virkeligheten. Den måler ikke i seg selv sikker styring, robust manipulering, evne til å hente seg inn etter feil, planlegging over lang tid, sosialt passende atferd på tvers av kulturer eller driftssikkerhet under ukjente forhold.
Den mest presise konklusjonen er derfor smalere: WITA-Omnis rapporterte ledelse er forenlig med en modell som er utviklet for synkronisert multimodal forståelse og uttrykk. Å omsette dette fortrinnet til roboter man kan stole på i ustrukturerte sosiale miljøer krever dokumentasjon langt utover Daily-Omni.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
AgiBot oppgir at WITA Omni Preview fikk 85,21 % gjennomsnittlig treffsikkerhet på Daily Omni og første eller delt førsteplass i seks av åtte mål.
AgiBot oppgir at WITA Omni Preview fikk 85,21 % gjennomsnittlig treffsikkerhet på Daily Omni og første eller delt førsteplass i seks av åtte mål. Daily Omni tester om en modell kan koble lyd og bilde til riktig tidspunkt, forstå rekkefølgen på hendelser og resonnere på tvers av modaliteter.
AgiBots Thinker–Talker–Actor oppsett skal samordne forståelse, løpende tale og fysiske uttrykk på én tidslinje, men offentlig tilgjengelig materiale dokumenterer ingen konkret forsinkelsesgevinst.