AgiBotin mukaan WITA Omni Preview saavutti Daily Omni vertailussa keskimäärin 85,21 %:n tuloksen ja sijoittui ensimmäiseksi tai jaetulle ensimmäiselle sijalle kuudessa kahdeksasta mittarista. Daily Omni mittaa äänen ja kuvan ajallisesti kohdistettua yhteispäättelyä: mallin on yhdistettävä nähty, kuultu ja tapahtumie...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did AgiBot’s WITA-Omni Preview full-modal model achieve a leading 85.21 score and six first-place results out of eight indicators on the. Article summary: AgiBot’s result is best understood as a strong benchmark outcome enabled by native audio-video temporal reasoning, not as independently proven evidence of superior real-world robot intelligence. Daily-Omni is designed to. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
AgiBotin WITA-Omni Preview saavutti yhtiön raportoimien tulosten mukaan 85,21 prosentin keskiarvon Daily-Omni-ääni- ja videopäättelytestissä. Malli johti kuutta kahdeksasta raportoidusta mittarista verrattuna arvioituihin Qwenin, Geminin, Doubaon ja NVIDIAn järjestelmiin. 1
18
23
Vakuuttavin selitys ei ole pelkkä mallin mahdollinen koko, vaan se, että sen ilmoitettu rakenne ja koulutuksen painotus vastaavat hyvin sitä, mitä Daily-Omni mittaa: äänen, näkyvien tapahtumien ja niiden ajoituksen yhdistämistä.
Tulos on merkittävä askel multimodaaliselle tekoälylle. Se ei silti yksin osoita, että mallia käyttävä robotti olisi laajasti luotettava ennakoimattomissa sosiaalisissa tai fyysisissä ympäristöissä.
Daily-Omni on ääni- ja videokysymyksiin perustuva vertailutesti, joka arvioi ajallisesti kohdistettua multimodaalista päättelyä. Aineistossa on 684 arkielämän videota ja 1 197 monivalintakysymystä kuudessa tehtäväluokassa. 17
27
Haaste ei ole vain esineen tunnistaminen kuvasta tai puheen litterointi. Mallin on pääteltävä, mitkä ääni- ja näköhavainnot tapahtuvat yhtä aikaa, missä järjestyksessä tapahtumat etenevät ja miten molempien tiedonlähteiden perusteella vastataan kysymykseen. Julkisessa tulostaulukossa ovat mukana muun muassa ääni–kuva-kohdistus, vertailu, kontekstin ymmärtäminen, tapahtumajärjestys, päättely sekä 30 ja 60 sekunnin video-osuudet. 20
23
Käytännössä oikea vastaus voi edellyttää esimerkiksi sen erottamista, näyttääkö kaksi tapahtumaa samalta mutta kuulostaa erilaiselta — tai tapahtuiko ääni ennen näkyvää toimintaa, sen aikana vai sen jälkeen.
AgiBot kuvailee WITA-Omni Preview'ta kehollistuneeksi, kaikki modaliteetit kattavaksi malliksi, joka ymmärtää yhdessä tekstiä, kuvia, ääntä ja videota. 5
9 Painotus vastaa suoraan Daily-Omnin asetelmaa: testi palkitsee mallia, joka säilyttää eri havaintokanavien väliset suhteet myös ajan kuluessa sen sijaan, että se käsittelisi äänen ja videon toisistaan irrallisina syötteinä.
17
20
Raportoitu tulos oli erityisen vahva ääni–kuva-kohdistuksessa, vertailussa, tapahtumajärjestyksessä sekä 30 ja 60 sekunnin videoissa. 1
18 Juuri näissä tehtävissä yhteinen esitys siitä, mitä tapahtui, mitä kuultiin ja milloin, voi tuoda etua.
AgiBot ja mallia käsittelevät raportit kertovat koulutuksesta, jossa on käytetty kymmeniä miljoonia tunteja avointa ja yhtiön omaa multimodaalista dataa. Lisäksi datan tarkoituksena on ollut säilyttää puheen, kuvien, liikkeen ja ilmeiden luontainen ajoitus. 5
6
9 Julkisuudessa ei kuitenkaan ole mallin kokoa, täydellistä koulutusdatan koostumusta, ablaatiotutkimuksia, päättelyasetuksia tai riippumattomasti toistettavia arviointiyksityiskohtia. Siksi yksittäistä teknistä valintaa ei voida osoittaa 85,21 tuloksen varmaksi syyksi: selitys on uskottava, ei todistettu.
AgiBot kuvaa WITA-Omnia Thinker–Talker–Actor-arkkitehtuurilla. Se laajentaa tutumpaa päättelyn ja puheen mallia fyysisiin ja ilmeellisiin ulostuloihin. 5
12
Suunnittelun tavoitteena on synkronointi: puhe, toiminta ja ilmeet tuotetaan samalla aikajanalla, eivät toisistaan erillisinä vaiheina. 12
Perinteinen robottijärjestelmä voi olla pitkälti sarjallinen: havaintojärjestelmä tulkitsee tilanteen, kielimalli muodostaa vastauksen, suunnittelija valitsee toiminnon ja ohjaus- tai animaatiokerros toteuttaa sen. Jokainen vaihto voi lisätä odotusta ja saada puheen, eleet ja liikkeen näyttämään toisistaan irrallisilta.
Rinnakkainen Thinker–Talker–Actor-malli pyrkii välttämään osan tästä pysähdy ja odota -ketjusta. Kun malli edelleen tulkitsee ihmisen sanoja, liikkeitä ja ympäristöä, se voi jo aloittaa sanallisen kuittauksen ja ajoittaa siihen sopivan fyysisen ilmaisun. Periaatteessa tämä voi tehdä vuoronvaihdosta luontevampaa ja yhdistää robotin sanat paremmin sen liikkeisiin.
Kyse on kuitenkin arkkitehtuurillisesta perustelusta, ei riippumattomasti mitatusta hyödystä: saatavilla olevat lähteet kuvaavat synkronoituja ulostuloja, mutta eivät ilmoita mitattua päästä päähän -viiveen pienenemistä. 12
WITA-Omni on yksi osa laajempaa kehollistuneen tekoälyn kokonaisuutta. AgiBotin GE-Sim 2.0 (Genie Envisioner-Sim 2.0) on robottimanipulointiin tarkoitettu suljetun silmukan videomaailmasimulaattori. Kun sille annetaan monikamerainen kuvahistoria ja toimintarata, se luo tulevista tilanteista monikameraisia ennusteita, jotka noudattavat määriteltyä robottikäyttäytymistä. Projektin mukaan malli on koulutettu uudelleen laajalla oikean robottidatalla, johon sisältyy etäohjausta, kosketusrikkaita vuorovaikutuksia ja robotilla ajettujen toimintapolitiikkojen käyttöönottoa. 11
Kolmen osan roolit voi jäsentää näin:
AgiBot on myös ilmoittanut GE-Sim 2.0:n johtavan WorldArena-vertailua. Kyseinen sijoitus on kuitenkin saatavilla olevassa aineistossa yhtiön oma väite, joten sitä on arvioitava erillään Daily-Omni-tuloksesta. 4
36
Daily-Omni-tulos on hyödyllinen näyttö siitä, että WITA-Omni pärjää hyvin rajatussa ääni- ja videopohjaisten, ajallista päättelyä vaativien tehtävien luokassa. Ihmisen ja robotin välisessä vuorovaikutuksessa kyky yhdistää puhe, ympäristön äänet, näkyvät toiminnat ja ajoitus on olennaista. 17
27
Vertailutestin pistemäärä ei kuitenkaan osoita luotettavaa toimintaa todellisessa maailmassa. Se ei sellaisenaan mittaa turvallista ohjausta, käsittelytehtävien kestävyyttä, virheistä toipumista, pitkän aikavälin suunnittelua, sosiaalista sopivuutta eri kulttuureissa tai toimintavarmuutta tuntemattomissa oloissa.
Tiivein johtopäätös on rajatumpi: WITA-Omnin raportoitu johtoasema sopii yhteen sellaisen mallisuunnittelun kanssa, jossa multimodaalinen ymmärrys ja ilmaisu synkronoidaan. Tämän edun muuttaminen luotettaviksi roboteiksi jäsentymättömiin sosiaalisiin tiloihin vaatii näyttöä, jota Daily-Omni ei yksin tarjoa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
AgiBotin mukaan WITA Omni Preview saavutti Daily Omni vertailussa keskimäärin 85,21 %:n tuloksen ja sijoittui ensimmäiseksi tai jaetulle ensimmäiselle sijalle kuudessa kahdeksasta mittarista.
AgiBotin mukaan WITA Omni Preview saavutti Daily Omni vertailussa keskimäärin 85,21 %:n tuloksen ja sijoittui ensimmäiseksi tai jaetulle ensimmäiselle sijalle kuudessa kahdeksasta mittarista. Daily Omni mittaa äänen ja kuvan ajallisesti kohdistettua yhteispäättelyä: mallin on yhdistettävä nähty, kuultu ja tapahtumien järjestys.
WITA Omnin Thinker–Talker–Actor rakenne pyrkii synkronoimaan multimodaalisen päättelyn, asteittain tuotetun puheen sekä eleet ja fyysisen toiminnan yhdelle aikajanalle.