| Modell | Input (pro 1 Mio. Tokens) | Output (pro 1 Mio. Tokens) | Änderung |
|---|---|---|---|
| GPT-5.6 Luna (Budget-Tarif) | 0,20 $ | 1,20 $ | 80 % Rabatt von 1 $ / 6 $ |
| GPT-5.6 Terra (Allround-Tarif) | 2,00 $ | 12,00 $ | 20 % Rabatt von 2,50 $ / 15 $ |
| GPT-5.6 Sol (Spitzen-Tarif) | 5,00 $ | 30,00 $ | Unverändert, aber mit einem schnelleren Fast-Mode |
Lunas kombinierter Preis (Input + Output) sinkt auf 1,40 $ pro Million Tokens – das macht es zu einem der günstigsten Frontier-Modelle auf dem Markt . Sols Fast-Mode liefert bis zu 2,5-mal schnellere Verarbeitung zum doppelten Standard-Preis, ohne Einbußen bei der Intelligenz .
Der bemerkenswerteste Aspekt dieser Preissenkung ist die technische Geschichte dahinter. Am 29. Juli enthüllte OpenAI, dass GPT-5.6 Sol autonom seine eigenen GPU-Kernel im Produktionsbetrieb umgeschrieben und optimiert hat – den Code, der die Modelle tatsächlich auf der Hardware ausführt .
Mithilfe der Codex-Umgebung verband sich GPT-5.6 Sol mit internen Infrastruktur-Systemen, entwarf und testete hunderte Architektur-Experimente, startete und überwachte Deployments und iterierte auf den Ergebnissen . Das Modell lernte dabei die Syntax von Triton und Gluon, den Programmiersprachen, die im OpenAI-Kernel-Stack verwendet werden .
Die messbaren Ergebnisse, von OpenAI veröffentlicht :
Diese Verbesserungen waren Teil einer umfassenderen Stack-Optimierung. Weitere Optimierungen umfassen Lastverteilungs-Mechanismen, die Anfragen dynamisch nach Geografie, Beschleuniger-Typ und Cache-Verfügbarkeit verteilen, sowie Prompt-Caching mit einer ~30-minütigen TTL (Time-to-Live), das gecachte Eingaben 90 % günstiger macht .
OpenAIs aggressive Preissenkung – so schnell nach dem Launch – spiegelt eine Wettbewerbslandschaft wider, die sich innerhalb weniger Wochen dramatisch verändert hat.
Moonshot AIs Kimi K3, veröffentlicht am 17. Juli, ist ein 2,8-Billionen-Parameter-Modell aus Peking, das auf Frontend-Coding-Benchmarks GPT-5.6 Sol und Anthropics Fable 5 schlug . Auf dem Arena-Frontend-Code-Leaderboard erreichte Kimi K3 1.679 Punkte und übertraf damit beide US-Modelle . Ein unabhängiger Benchmark des Startrise AI Labs vom 30. Juli stellte fest, dass Kimi K3 mit Anthropics Claude Opus 5 gleichzog – aber zu einem Bruchteil der Kosten: Der vollständige Test kostete 7,17 $, verglichen mit 21,17 $ für Opus 5 .
Microsoft erwog Berichten zufolge, Kimi K3 in Copilot zu integrieren, was Ersparnisse von bis zu 600 Millionen US-Dollar (60 % pro Token) bringen könnte .
Anthropic veröffentlichte Claude Opus 5 am 24. Juli zu 5 $ pro Million Input-Tokens – der halbe Preis von Fable 5 – und übertrifft diesen in mehreren Benchmarks . Das erhöhte den Druck genau in dem Preissegment, in dem GPT-5.6 Sol konkurriert.
Google und Microsoft brachten im Juli mehrere kosteneffektive Modelle auf den Markt, die den Wettbewerb im Mittel- und Budgetsegment weiter anheizten .
All dies hat OpenAI in die Position gebracht, Luna als „Verlustbringer“ für volumenstarke, preissensible Workloads zu positionieren, während Sol als Premium-Differenzierungsmerkmal bestehen bleibt .
Die Preissenkungen kommen nicht im luftleeren Raum. Unternehmen verlangen – analog zum Cloud-Computing – harte Budgetkontrollen für KI-Ausgaben.
Am 22. Juli 2026 führte OpenAI durchsetzbare monatliche Höchstausgabenlimits für seine API-Plattform ein . Anders als die Juni-Soft-Caps für ChatGPT Enterprise (die nur Beobachtungsfunktionen waren), führt die neue Funktion dazu, dass Live-API-Requests mit einem HTTP-429-Fehler abgelehnt werden, sobald das konfigurierte monatliche Budget ausgeschöpft ist . Admins können Limits auf Organisations- oder Projektebene festlegen; die Obergrenze wird zu Beginn jedes Abrechnungszyklus zurückgesetzt .
Dies war eine direkte Reaktion auf ein weit verbreitetes Problem. Mehrere Quellen berichten, dass Amazon und andere Großunternehmen interne und kundenseitige Obergrenzen für KI-Ausgaben einführen, da Unternehmen den ROI ihrer KI-Investitionen zunehmend prüfen . Der Beschaffungsprozess hat sich geändert: Reuters berichtet, dass kostenbewusste Unternehmen KI jetzt „wie Cloud“ behandeln – mit eigenem Budget, festgelegten Obergrenzen und Genehmigungsvorbehalten durch den CIO für großflächige Deployments .
Für Entwickler und Unternehmen, die die OpenAI-API nutzen, sind die unmittelbaren Auswirkungen positiv:
Die grundlegende Erkenntnis: Der KI-Preiskampf ist real, er beschleunigt sich und wird – ebenso wie der Wettbewerbsdruck – von Fortschritten in der Ingenieureffizienz angetrieben. Unternehmen sollten in der gesamten Branche mit weiteren Preisrückgängen rechnen, da sich diese Selbstoptimierungstechniken weiterentwickeln und Open-Weight-Modelle die Leistungslücke weiter schließen.