OpenAI:n GPT‑5.5 on tämän hetken vahvin yleismalli agenttimaisissa työnkuluissa. Keskeiset tulokset:
Terminal‑Bench mittaa monimutkaisia komentorivityönkulkuja, joissa vaaditaan suunnittelua ja työkalujen käyttöä. GPT‑5.5:n 82,7 % on korkein julkaistu tulos.
GDPval testaa tietotyötä 44 eri ammatissa; malli päihittää tai vastaa ammattilaisia noin 85 prosentissa vertailuista.
Anthropicin Claude Opus 4.7 on erityisen vahva ohjelmistokehityksessä:
SWE‑bench mittaa mallin kykyä korjata todellisia ohjelmistovirheitä avoimen lähdekoodin projekteissa. Opus 4.7:n 87,6 % on merkittävä parannus edeltäjäänsä verrattuna ja nostaa sen koodausagenttien kärkijoukkoon.
Vaikka Terminal‑Bench‑tulos jää GPT‑5.5:stä, koodaukseen keskittyvissä vertailuissa se on vahvimmasta päästä.
Googlen Gemini 3.5 Flash on poikkeuksellinen, koska se on suunniteltu nopeaksi ja kustannustehokkaaksi, mutta se kilpailee silti kärkimallien kanssa:
Google väittää mallin olevan noin neljä kertaa nopeampi kuin vastaavat kärkimallit, samalla kun se päihittää oman edeltäjänsä Gemini 3.1 Pron useissa vertailuissa.
Käytännössä Gemini 3.5 Flashin suurin vahvuus on nopeuden ja kyvykkyyden tasapaino: se tarjoaa lähes kärkitason tuloksia, mutta suunniteltu tuotantokäyttöön ja alhaiseen viiveeseen.
DeepSeek V4 on merkittävä, koska se on yksi kyvykkäimmistä avoimen painon malleista. Malliperheeseen kuuluu kaksi versiota:
V4‑Pro saavuttaa maksimaalisessa päättelytilassa:
Nämä tulokset lähestyvät johtavia suljettuja malleja koodauksessa.
Toisaalta Yhdysvaltain kansallisen standardointi-instituutin (NIST) CAISI‑ohjelman riippumaton arvio osoitti, että mallin kyvykkyys on noin kahdeksan kuukautta jäljessä kärkeä, mikä paljastaa eron omien ja riippumattomien tulosten välillä.
xAI:n Grok 4.3 on parantunut huomattavasti edeltäjistään, erityisesti agenttitehtävissä:
GDPval‑AA:n yli 300 Elo-pisteen nousu kertoo todellisesta edistymisestä.
Silti kolmannen osapuolen analyysit asettavat sen yleisesti alle uusimpien OpenAI:n ja Anthropicin järjestelmien.
Minkään yksittäisen mallin ei voi sanoa dominoivan kaikilla osa-alueilla. Sen sijaan kärki on erikoistunut:
Nämä johtopäätökset ovat suuntaa-antavia. Jokainen toimija korostaa eri testejä, ja vertailuasetelmat muuttuvat, kun riippumattomia tuloksia kertyy lisää.
Tekoälymallien vertailu mutkistuu useista syistä:
Todellinen järjestys selviää vasta kuukausien riippumattoman testauksen jälkeen.
Vuonna 2026 tekoälymallien kärki on selvästi erikoistunut. Valinta riippuu siitä, mitä tehtävää ollaan ratkaisemassa: koodausta, monivaiheisia agentteja, nopeutta vai avoimuutta. Riippumattomat testit ratkaisevat lopullisen paremmuuden – ja ne ovat vasta tulossa.