| 80.6 |
| 80.2 |
| SWE-Bench Pro (Vaativampi versio) | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual (Monikielinen koodaus) | 78.3 | — | 76.7 |
| Terminal-Bench 2.0-Terminus (Pääteympäristö) | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) (Kilpailullinen koodaus) | — | 93.5 | 89.6 |
| Codeforces Rating (Ohjelmointikilpailut) | — | 3206 | — |
| SciCode (Tieteellinen koodaus) | 53.5 | — | — |
| NL2Repo (Luonnollinen kieli koodiksi) | 47.2 | — | — |
| MCP-Mark (Agenttiyhteensopivuus) | 60.8 | — | — |
| Benchmark | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| AA Intelligence Index v4.0 (Yleisälykkyys) | 56.6 (#5) | 52.0 | — |
| GPQA Diamond (Gradu-tason tiede) | 92.4 | — | — |
| HLE (Humanity's Last Exam) (Ihmiskunnan viimeinen koe) | 41.4 | 37.7 | 54.0 (työkalujen kera) |
| HMMT 2026 (Math) (Lukiomatematiikka) | 97.1% | 95.2% | |
| AIME 2026 (Amerikan matematiikkakilpailu) | — | — | 96.4% |
| IMOAnswerBench (Matematiikkaolympialaiset) | 90.0 | 89.8 | — |
| Apex Math Reasoning (Vaativin matematiikka) | 44.5 | — | — |
| SimpleQA Verified (Faktatieto) | — | 57.9% | — |
| Chinese SimpleQA (Kiinalainen faktatieto) | — | 84.4 | 75.9 |
| DeepSearchQA (F1) (Tiedonhaku ja synteesi) | — | — | 92.5 |
Mallien kustannukset eroavat dramaattisesti. Hinnat ovat virallisilta API-alustoilta. Huomioi erityisesti DeepSeekin pysyvä, massiivinen alennus, joka muutti markkinaa.
| Hintaosa | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Syöte (Cache-miss) | $2.50 | $1.74 | $0.95 |
| Tuotos (Output) | $7.50 | $3.48 | |
| Cache-osuma (Syöte) | $0.25 (-90%) | $0.0145 | $0.16 (-83%) |
| Konteksti-ikkuna | 1 000 000 tokenia | 1 000 000 tokenia | |
| Maksimi tuotos-tokenit | 65 536 | 384 000 | — |
| Avoimen lähdekoodin painot | Ei (vain API) | Kyllä (Hugging Face) | Kyllä |
Huomautus DeepSeekin hinnoittelusta: DeepSeek muutti 75 % lanseerausalennuksensa pysyväksi toukokuun 2026 lopussa. Hinta on nyt pysyvästi $1.74/$3.48 syöte/tuotos, ja siitä saa edelleen päivittäisen volyymiperusteisen alennuksen joillain alustoilla. . Taulukon hinnat ovat pysyvät listahinnat. Monet palveluntarjoajat, kuten OpenRouter, tarjoavat malleja pienellä katteella.
Kolme mallia ovat hämmästyttävän lähellä toisiaan SWE-Bench Verified -testissä (80.2–80.6 pistettä). Ero tulee vastaan, kun katsotaan tarkemmin:
Toukokuussa 2026 julkaistu Yhdysvaltain NIST-viraston CAISI-arviointi paljasti, että DeepSeek V4 Pron itsensä ilmoittamat benchmark-tulokset antavat sen kyvyistä todellista ruusuisemman kuvan. NIST:n omissa ei-julkisissa testeissä malli suoriutui pikemminkin kuin elokuun 2025 GPT-5, eikä kuin maaliskuun 2026 Claude Opus 4.6, kuten DeepSeek antoi ymmärtää. Tämä koskee vain DeepSeekiä — Qwen3.7-Maxia ja Kimi K2.6:ta ei arvioitu samassa raportissa. Tämä havainto korostaa riippumattomien, kolmannen osapuolen testien kriittistä merkitystä.
| 92.7% |
| $4.00 |
| 262 144 tokenia |