| GPT-5.5 (Pro) | 30,00 $ | 180,00 $ | — | 1M |
| Qwen3.7-Max | 2,50 $ | 7,50 $ | 0,25 $ (90 % alennus) | 1M |
| Kimi K2.6 | 0,60–0,95 $ | 3,00–4,00 $ | 0,10 $ | 262K |
| Gemini 3.5 Flash | 1,50 $ | 9,00 $ | 0,15 $ | 1M |
| Grok 4.3 | 1,25 $ | 2,50 $ | 0,30 $ | 1M |
| DeepSeek V4-Flash | 0,14 $ | 0,28 $ | 0,0028 $ | 1M |
| DeepSeek V4-Pro | 0,435 $ (pysyvä alennus) | 0,87 $ (pysyvä alennus) | 0,0036 $ | 1M |
Tärkeimmät huomiot hinnoittelusta:
Testitulokset ovat hyödyllisiä vain asiayhteydessä. Olemme järjestäneet tulokset sen mukaan, mitä ne todella mittaavat – yleisälykkyyttä, koodauskykyä ja agenttisuorituskykyä – yhden, usein harhaanjohtavan yhdistelmäpistemäärän sijaan.
Tämä kategoria mittaa raakaa tietoa, matematiikkaa ja tieteellistä päättelyä.
| Testi | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6 % | — | 90,1 % | 92,4 % | ||
| AIME / USAMO 2026 (Matematiikka) | 96,7 % | 95,2 % | ||||
| HLE (työkalujen kanssa) | 57,9 % | — | 37,7 % | — | — | — |
Claude Opus 4.8 on avannut pienen mutta merkittävän kaulan GPT-5.5:een yleisälykkyydessä. Tätä tukee massiivinen 27,4 pisteen loikka matematiikan suorituskyvyssä edeltäjäänsä verrattuna . Qwen3.7-Max erottuu parhaana kiinalaisena mallina ja haastaa kärkeä tohtoritason luonnontieteellisessä päättelyssä (GPQA Diamond) .
Kehittäjille oleellisimmat testit.
| Testi | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 80,2 % | 88,7 % | 88,6 % | 72,5 % |
| SWE-bench Pro | ~58 % | 58,6 % | 58,6 % | 69,2 % | |
| LiveCodeBench v6 | 93,5 % | 89,6 % |
Koodaussuorituskyky luo selvän jaon. Claude Opus 4.8 ja GPT-5.5 ovat tasoissa aivan kärjessä yleisessä viankorjauksessa (SWE-bench Verified), mutta Claude ottaa yli 10 pisteen johtoaseman huomattavasti vaikeammassa Pro-setissä . Puhtaan koodaustehokkuuden ja hinnan suhteessa DeepSeek V4-Pro on lyömätön. Se tarjoaa GPT-5.4-luokan koodaussuorituskykyä 30-kertaisella hintaedulla .
Mallin kyky toimia itsenäisesti oikeassa ympäristössä.
| Testi | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7 % | 76,2 % | |||
| τ²-Bench (Ohjeiden noudattaminen) | — | — | — | — | 98 % |
GPT-5.5 pitää kruununsa vahvimpana mallina avoimiin, terminaalipohjaisiin agenttitöihin, mutta Claude Opus 4.8:n ylivoimainen suorituskyky tosielämän tehtävissä (GDPval-AA Elo) viittaa luotettavampaan, liiketoimintavalmiimpaan agenttikumpaniin . Grok 4.3 tarjoaa houkuttelevan budjettivaihtoehdon suurivolyymisiin ohjeita noudattaviin tehtäviin .
Ensimmäistä kertaa kiinalaiset mallit eivät kilpaile vain hinnalla, vaan myös kyvykkyydellä. Qwen3.7-Max johtaa kaikkia malleja SWE-bench Pro -agenttikoodaustestissä tuloksella 60,6 % . Kimi K2.6 on GPT-5.5:n tasolla samassa testissä ja johtaa kaikkia muita malleja Humanity's Last Exam (HLE) -testissä työkalujen kanssa tuloksella 54,0 % . Tämä haastaa amerikkalaisen rintaman ydinpäättelytehtävissä samalla, kun hinnat ovat dramaattisesti alhaisemmat.
Suora, täydellinen vertailu kaikkien seitsemän mallin kesken on tällä hetkellä mahdotonta, koska toimittajat raportoivat testituloksia valikoivasti . Useat keskeiset tekijät heikentävät puhtaasti numeropohjaista valintaa:
Tarpeidesi tulisi sanella valintasi:
Kaikissa kriittisissä käyttöönotoissa testaa mallia omalla työkuormallasi. Toimittajien ilmoittamat testitulokset tarjoavat hyödyllisen lähtökohdan, eivät lopullista totuutta.
| — |
| 92,6 % |
| — |
| — |
| — |
| — |
| 60,6 % |
| — |
| — |
| — |
| 74,6 % |
| 69,7 % |
| — |