Konkurransen blant Kinas fremste AI-modeller har aldri vært hardere. Vi har dykket dypt inn i de offentlig tilgjengelige benchmark-resultatene og prislistene for Alibabas Qwen3.7-Max, DeepSeeks V4 Pro Max og Moonshot AIs Kimi K2.6 Thinking. Her får du den komplette oversikten, slik at du kan ta et kvalifisert valg.
Dette er grenen der modellene viser muskler i praktisk programvareutvikling og komplekse arbeidsflyter.
Nøkkelobservasjoner:
Her tester vi modellenes evne til å løse komplekse matteproblemer, vitenskapelige spørsmål og svært krevende eksamener.
| Benchmark / Metrikk | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| Kunstig Analyse Intell. Indeks v4.0 | 56.6 (#5) | 52.0 | — |
| GPQA Diamond (vitenskap) | 92.4 | — | — |
| HLE (Menneskehetens siste eksamen) | 41.4 | 37.7 |
Nøkkelobservasjoner:
Her er den kalde kontantstrømmen. Prisene er oppgitt i amerikanske dollar per 1 million tokens og er basert på offisielle API-priser. Husk at én token grovt sett tilsvarer 3/4 av et ord.
| Priselement | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Input-pris (cache-miss) | $2.50 | $1.74 | $0.95 |
| Output-pris | $7.50 |
Merknad om DeepSeek-prisene: DeepSeek kjørte en massiv lanseringskampanje med 75 % rabatt frem til 31. mai 2026. I skrivende stund (juni 2026) er det uklart om disse kampanjeprisene blir permanente eller går tilbake til listepris. Vi har valgt å bruke standard listepris uten rabatt for en rettferdig sammenligning. Med rabatten ville prisene vært $0.435 for input og $0.87 for output – fullstendig knusende for konkurrentene
.
Priskrigen oppsummert:
DeepSeek V4 Pro er ekstremt mye rimeligere enn Qwen. Selv uten kampanje er den over dobbelt så billig på output. Qwen3.7-Max er den klart dyreste modellen i denne sammenligningen, men Alibaba tilbyr rabatter for store volumer og batch-kjøring.
Før du konkluderer, er det én svært viktig ting du må vite: En uavhengig evaluering utført av det amerikanske standardiseringsbyrået NIST (CAISI) i mai 2026 fant et betydelig avvik i DeepSeeks egenrapportering .
Rapporten konkluderer med at DeepSeek V4 Pros selvrapporterte tester overvurderer modellens faktiske kapasitet. Ifølge NISTs interne og ikke-offentlige tester, yter DeepSeek V4 mer på nivå med GPT-5 fra august 2025, og ikke på nivå med Claude Opus 4.6 og GPT-5.4 fra mars 2026, slik DeepSeek selv hevder .
Denne problemstillingen gjelder kun DeepSeek i denne rapporten. Verken Qwen3.7-Max eller Kimi K2.6 ble testet av NIST på samme måte.
Velg Qwen3.7-Max hvis:
Velg DeepSeek V4 Pro Max hvis:
Velg Kimi K2.6 hvis:
Alle tre er ekstremt kraftige, men de har ulike spesialfelt og prispunkter som gjør dem egnet til forskjellige formål.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
På ren kodekraft er DeepSeek V4 Pro uslåelig, spesielt på LiveCodeBench og Codeforces.
På ren kodekraft er DeepSeek V4 Pro uslåelig, spesielt på LiveCodeBench og Codeforces. Qwen3.7 Max leverer toppresultater i avansert matematikk og agentbaserte terminaltester.
Kimi K2.6 briljerer når den får bruke verktøy, spesielt på krevende SWE Bench Pro og dyptgående nettsøk.
| 54.0 (med verktøy) |
| HMMT 2026 (mattekonkurranse) | 97.1 % | 95.2 % | 92.7 % |
| AIME 2026 (matteolympiade) | — | — | 96.4 % |
| DeepSearchQA (F1-score for nettsøk) | — | — | 92.5 |
| $3.48 |
| $4.00 |
| Cache-treff (input) | $0.25 (-90 %) | $0.0145 (-99 %) | $0.16 (-83 %) |
| Kontekstvindu | 1M tokens | 1M tokens | 262K tokens |
| Maks output per forespørsel | 65 536 | 384 000 | 262 144 |
| Åpne vekter (kan kjøre selv) | Nei (kun API) | Ja | Ja |