Alibabas Qwen 3.7 Max, das im Mai 2026 auf den Markt kam, ist ein Flaggschiff mit 2,8 Billionen Parametern und einer Mixture-of-Experts (MoE)-Architektur. Es schnitt in Benchmarks offenbar gleich gut oder besser ab als Anthropics Fable 5 – zu etwa einem Sechstel der Kosten . Für hohe Volumen bietet Alibabas Qwen3.6 Flash für nur 0,19 $ pro Million Input-Tokens .
Zhipu AI's GLM-5.2, veröffentlicht am 13. Juni 2026, nutzt eine MoE-Architektur mit 744 Milliarden Parametern (40 Milliarden aktiv) und einem Kontextfenster von 1 Million Tokens. Es wurde auf dem Artificial Analysis Intelligence Index zum besten Open-Weight-Modell gekürt . Mit einem Preis von 1,40 $ pro Million Input-Tokens und 4,40 $ pro Million Output-Tokens unterbietet es US-Spitzenmodelle um etwa das 5- bis 6-fache .
Moonshot AI's Kimi K3, das am 16. Juli 2026 vorgestellt wurde, ist das größte jemals angekündigte Open-Weight-KI-System: 2,8 Billionen Gesamtparameter, ein Kontextfenster von 1 Million Tokens und natives visuelles Verständnis . Moonshot versprach die vollständigen Gewichte bis zum 27. Juli 2026 . Der API-Preis liegt bei 3 $ pro Million Input-Tokens und 15 $ pro Million Output-Tokens, was es zum teuersten chinesischen Modell macht – aber immer noch unter vergleichbaren US-Angeboten .
Die Kostendifferenz zwischen chinesischen und US-Spitzenmodellen ist extrem:
| Modell | Input-Preis (pro 1 Mio. Tokens) | Output-Preis (pro 1 Mio. Tokens) |
|---|---|---|
| DeepSeek V4-Flash | 0,14 $ | 0,28 $ |
| Alibaba Qwen3.6 Flash | 0,19 $ | 1,13 $ |
| Zhipu GLM-5.2 | 1,40 $ | 4,40 $ |
| Alibaba Qwen3.7 Max | 1,25 $ | 3,75 $ |
| Moonshot Kimi K3 | 3,00 $ | 15,00 $ |
| Anthropic Claude Fable 5 (geschätzt) | ~15,00 $ | ~50,00 $ |
| OpenAI GPT-5.5 (geschätzt) | ~5,00 $ | ~15,00 $ |
Quellen: Zitieren vorherige Tabelle und
Die Zahlen sprechen für sich: DeepSeek's V4-Flash kostet schätzungsweise 3 Cent pro Benchmark-Test, verglichen mit 1,86 $ für GPT-5.5 und 3,33 $ für Claude Fable 5 . Der Risikokapitalgeber Marc Andreessen stellte fest, dass GLM-5.2 „das erste chinesische KI-Modell ist, das mit den öffentlichen KI-Modellen der großen amerikanischen Labore mithält und sie oft sogar ohne Kompromisse übertrifft“ – zu einem Bruchteil des Preises .
Die zweite Stoßrichtung von Chinas Strategie ist die Open-Weight-Veröffentlichung. Modelle wie GLM-5.2 (MIT-Lizenz), Kimi K3 (versprochene modifizierte MIT-Lizenz) und die Qwen-Serie sind frei herunterladbar, was bedeutet, dass jeder sie ohne Kosten pro Token ausführen, anpassen oder verfeinern kann . Diese Strategie, Modelle „zu verschenken“, höhlt den Mittelmarkt aus, in dem US-Firmen früher Spitzenpreise verlangten .
Ein entscheidender Wendepunkt kam im Juni 2026, als die Trump-Administration Anthropic aufforderte, den Betrieb seiner beiden fortschrittlichsten KI-Systeme (Fable und Mythos) aus Gründen der nationalen Sicherheit einzustellen . Innerhalb von zwei Wochen präsentierte Z.ai ein Modell, das den Angeboten von Anthropic stark ähnelte – günstiger und ohne US-Beschränkungen . Chinesische Unternehmen sahen eine Gelegenheit und beeilten sich, die Lücke zu füllen .
Die US-Reaktion ist fragmentiert. Anthropic kam der Aufforderung der Regierung nach. Google hat Berichten zufolge mit der neuesten Version seines Gemini-Modells zu kämpfen, während chinesische Modelle die Lücke schließen . Es wurde keine koordinierte US-Gegenmaßnahme angekündigt; Analysten stellen fest, dass Exportkontrollen für Chips chinesische Firmen nicht daran gehindert haben, durch architektonische Effizienz (z. B. MoE, hybride Aufmerksamkeit) anstatt durch rohe Rechenleistung wettbewerbsfähige Leistung zu erzielen .
In der Zwischenzeit testen und übernehmen US-Unternehmen zunehmend chinesische Modelle aus Kostengründen, was den Heimvorteil amerikanischer KI-Labore weiter untergräbt .