| 80.6 |
| 80.2 |
| SWE-Bench Pro (vanskeligere) | 60.6 | 55.4 | 58.6 |
| SWE-Bench Flerspråklig | 78.3 | — | 76.7 |
| Terminal-Bench 2.0 | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Codeforces Rating | — | 3206 | — |
| MCP-Mark (generelle agenter) | 60.8 | — | — |
Nøkkelobservasjoner:
Her tester vi modellenes evne til å løse komplekse matteproblemer, vitenskapelige spørsmål og svært krevende eksamener.
| Benchmark / Metrikk | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| Kunstig Analyse Intell. Indeks v4.0 | 56.6 (#5) | 52.0 | — |
| GPQA Diamond (vitenskap) | 92.4 | — | — |
| HLE (Menneskehetens siste eksamen) | 41.4 | 37.7 | 54.0 (med verktøy) |
| HMMT 2026 (mattekonkurranse) | 97.1 % | 95.2 % | |
| AIME 2026 (matteolympiade) | — | — | 96.4 % |
| DeepSearchQA (F1-score for nettsøk) | — | — | 92.5 |
Nøkkelobservasjoner:
Her er den kalde kontantstrømmen. Prisene er oppgitt i amerikanske dollar per 1 million tokens og er basert på offisielle API-priser. Husk at én token grovt sett tilsvarer 3/4 av et ord.
| Priselement | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Input-pris (cache-miss) | $2.50 | $1.74 | $0.95 |
| Output-pris | $7.50 | $3.48 | |
| Cache-treff (input) | $0.25 (-90 %) | $0.0145 (-99 %) | $0.16 (-83 %) |
| Kontekstvindu | 1M tokens | 1M tokens | |
| Maks output per forespørsel | 65 536 | 384 000 | 262 144 |
| Åpne vekter (kan kjøre selv) | Nei (kun API) | Ja | Ja |
Merknad om DeepSeek-prisene: DeepSeek kjørte en massiv lanseringskampanje med 75 % rabatt frem til 31. mai 2026. I skrivende stund (juni 2026) er det uklart om disse kampanjeprisene blir permanente eller går tilbake til listepris. Vi har valgt å bruke standard listepris uten rabatt for en rettferdig sammenligning. Med rabatten ville prisene vært $0.435 for input og $0.87 for output – fullstendig knusende for konkurrentene .
Priskrigen oppsummert:
DeepSeek V4 Pro er ekstremt mye rimeligere enn Qwen. Selv uten kampanje er den over dobbelt så billig på output. Qwen3.7-Max er den klart dyreste modellen i denne sammenligningen, men Alibaba tilbyr rabatter for store volumer og batch-kjøring.
Før du konkluderer, er det én svært viktig ting du må vite: En uavhengig evaluering utført av det amerikanske standardiseringsbyrået NIST (CAISI) i mai 2026 fant et betydelig avvik i DeepSeeks egenrapportering .
Rapporten konkluderer med at DeepSeek V4 Pros selvrapporterte tester overvurderer modellens faktiske kapasitet. Ifølge NISTs interne og ikke-offentlige tester, yter DeepSeek V4 mer på nivå med GPT-5 fra august 2025, og ikke på nivå med Claude Opus 4.6 og GPT-5.4 fra mars 2026, slik DeepSeek selv hevder .
Denne problemstillingen gjelder kun DeepSeek i denne rapporten. Verken Qwen3.7-Max eller Kimi K2.6 ble testet av NIST på samme måte.
Velg Qwen3.7-Max hvis:
Velg DeepSeek V4 Pro Max hvis:
Velg Kimi K2.6 hvis:
Alle tre er ekstremt kraftige, men de har ulike spesialfelt og prispunkter som gjør dem egnet til forskjellige formål.
| 92.7 % |
| $4.00 |
| 262K tokens |