| Kriterium | GPT-5.5 | Claude Opus 4.7 | Einordnung |
|---|---|---|---|
| Positionierung | Für Code, Online-Recherche, Informationsanalyse, Dokumente, Tabellen und Tool-Wechsel beschrieben. | Als Anthropic-Modell für komplexes Schlussfolgern und agentenbasiertes Coding beschrieben. | Beide sind Spitzenmodelle für produktive Arbeit, aber mit unterschiedlichen Stärken. |
| Terminal-Bench 2.0 | 82,7 %. | 69,4 %. | Starkes Signal für GPT-5.5 bei Terminal-Agenten; der Vergleich hat aber einen Harness-Hinweis. |
| SWE-Bench Pro | 58,6 %. | 64,3 %. | Bei realen GitHub-Issue-Lösungen spricht der veröffentlichte Wert für Claude Opus 4.7. |
| GPQA Diamond | 93,6 %. | 94,2 %. | Der Abstand ist klein; RDWorld markiert den Bereich als nahezu gesättigt. |
| HLE ohne Tools | 41,4 %. | 46,9 %. | Ohne externe Werkzeuge liegt Claude Opus 4.7 in dieser Tabelle vorn. |
| BrowseComp | 84,4 %. | 79,3 %. | GPT-5.5 liegt höher, allerdings mit Kontaminationshinweis in der Tabelle. |
| UI-first-Erzeugung | Appwrite kritisiert eine Tendenz zu wiederholten Kartenrastern, wenn der Prompt nicht sehr konkret ist. | Appwrite sieht klarere Hierarchie, dichtere Typografie und weniger repetitive Kartenraster. | Für Landingpages, Dashboards und App-Screens zuerst Claude testen. |
| Standard-API-Preis | 5 US-Dollar pro 1 Mio. Input-Tokens, 30 US-Dollar pro 1 Mio. Output-Tokens, 1 Mio. Tokens Kontextfenster angekündigt. | Ab 5 US-Dollar pro 1 Mio. Input-Tokens und 25 US-Dollar pro 1 Mio. Output-Tokens. | Input ähnlich, Output bei Claude niedriger. |
Bei Coding-Benchmarks hängt das Ergebnis stark davon ab, was genau gemessen wird. Terminal-Bench 2.0 spricht derzeit klar für GPT-5.5: RDWorld führt 82,7 % für GPT-5.5 und 69,4 % für Claude Opus 4.7 auf. VentureBeat ordnete den Vorsprung ebenfalls ausdrücklich im Kontext von Terminal-Bench 2.0 ein, also eines Benchmarks für Aufgaben, bei denen ein Modell im Terminal navigieren und Aufgaben erledigen muss.
Das ist relevant für Workflows, in denen ein Modell Shell-Befehle ausführt, Tests startet, Dateien inspiziert und mehrere Tools nacheinander bedient. Wer also Build-Skripte, CI-Fehler, CLI-gestützte Datenpipelines oder agentische Entwickler-Workflows automatisieren will, sollte GPT-5.5 früh in die Tests aufnehmen.
Bei realen Codebases dreht sich das Bild jedoch teilweise. In SWE-Bench Pro wurden 64,3 % für Claude Opus 4.7 und 58,6 % für GPT-5.5 berichtet. Yahoo Tech beschreibt SWE-Bench Pro als Benchmark, der reale GitHub-Issue-Lösungen bewertet. Für Teams, die vor allem Bugs in bestehenden Repositories beheben, Tests grün bekommen oder Pull-Request-nahe Aufgaben automatisieren wollen, ist Claude Opus 4.7 deshalb kein Außenseiter, sondern ein sehr ernsthafter Kandidat.
Wichtig ist die Einschränkung: Diese Zahlen sind kein endgültiges Gerichtsurteil. Yahoo Tech berichtet, OpenAI habe beim Claude-Wert in SWE-Bench Pro auf mögliche Memorization bei einem Teil der Aufgaben verwiesen; RDWorld versieht SWE-Bench Pro ebenfalls mit einem entsprechenden Hinweis. Für eine Beschaffung oder eine Produktentscheidung ersetzt kein Benchmark den eigenen Test mit demselben Repository, denselben Prompts und denselben Abnahmekriterien.
Für Produktteams ist Coding nicht nur Logik und Tests. Oft geht es um den ersten Entwurf einer Landingpage, eines SaaS-Dashboards oder eines App-Screens. Genau dort reicht ein Terminal-Benchmark nicht aus.
Appwrite bewertet Claude Opus 4.7 bei UI-first-Arbeiten stärker als GPT-5.5. Die Begründung: Claude erzeugt demnach Layouts mit klarerer visueller Hierarchie, dichterer Typografie und weniger reflexhaften Kartenrastern. Bei GPT-5.5 beobachtet Appwrite dagegen, dass das Modell ohne sehr konkrete Vorgaben häufiger zu repetitiven Card-Grid-Strukturen zurückkehrt.
Das ist keine harte Messreihe wie ein Coding-Benchmark, sondern eine qualitative Drittbewertung von UI-Ergebnissen. Trotzdem ist das Signal praktisch nützlich: Wenn der erste Entwurf bereits Informationsarchitektur, Komponentenwahl und visuellen Rhythmus liefern soll, ist Claude Opus 4.7 der naheliegende erste Versuch. Wer GPT-5.5 nutzt, sollte Layout, Typografie, Breakpoints, Komponentenstruktur und visuelle Varianten im Prompt besonders genau beschreiben.
Bei allgemeinen Reasoning-Benchmarks ist die Lage weniger eindeutig. In GPQA Diamond führt RDWorld 93,6 % für GPT-5.5 und 94,2 % für Claude Opus 4.7 auf; dieselbe Tabelle markiert den Bereich als gesättigt. Ein Zehntel- oder Prozentpunktvergleich ist dort also nur begrenzt aussagekräftig.
Bei HLE ohne Tools steht Claude Opus 4.7 mit 46,9 % vor GPT-5.5 mit 41,4 %. Das spricht in dieser Tabelle für Claude bei schwierigen Aufgaben ohne externe Werkzeuge. Beim BrowseComp-Wert liegt dagegen GPT-5.5 mit 84,4 % vor Claude Opus 4.7 mit 79,3 %. Allerdings versieht RDWorld genau diesen BrowseComp-Eintrag mit einem Kontaminationshinweis, weshalb man daraus keine absolute Überlegenheit bei Web-Recherche ableiten sollte.
Für API-Nutzung zählt nicht nur die Antwortqualität, sondern auch die Token-Rechnung. OpenAI kündigt GPT-5.5 für die Responses- und Chat-Completions-APIs zu 5 US-Dollar pro 1 Mio. Input-Tokens und 30 US-Dollar pro 1 Mio. Output-Tokens an; das Kontextfenster wird mit 1 Mio. Tokens angegeben. Batch und Flex sollen zum halben Standardpreis verfügbar sein, Priority-Verarbeitung zum 2,5-Fachen des Standardpreises.
Anthropic nennt für Claude Opus 4.7 Preise ab 5 US-Dollar pro 1 Mio. Input-Tokens und 25 US-Dollar pro 1 Mio. Output-Tokens. Außerdem verweist Anthropic auf bis zu 90 % Kostensenkung durch Prompt Caching und 50 % durch Batch-Verarbeitung.
Der einfache Vergleich lautet: Input kostet bei beiden gleich viel, Output ist bei Claude Opus 4.7 im Standardpreis 5 US-Dollar pro 1 Mio. Tokens günstiger. Das kann bei langen Code-Generierungen, Refactoring-Erklärungen, Dokumentation oder Berichtsentwürfen spürbar werden. Die tatsächliche Rechnung hängt aber davon ab, wie lang die Antworten ausfallen, wie oft neu versucht wird und ob Batch-Verarbeitung oder Caching im eigenen Workflow wirklich nutzbar sind.
OpenAI hat GPT-5.5 in Codex und ChatGPT verfügbar gemacht und für API-Entwickler die Bereitstellung in den Responses- und Chat-Completions-APIs angekündigt. Wer bereits ChatGPT-, Codex- oder OpenAI-API-Workflows betreibt, kann GPT-5.5 daher meist mit weniger organisatorischem Aufwand evaluieren.
Claude Opus 4.7 lässt sich laut Anthropic über die Claude API mit claude-opus-4-7 nutzen. Gleichzeitig weist Anthropic in den Release Notes darauf hin, dass Opus 4.7 gegenüber Opus 4.6 API breaking changes enthält. Bestehende Claude-Integrationen sollten vor einem Upgrade also Migration, Tests und mögliche Anpassungen einplanen.
Auch die Produktumgebung kann das Ergebnis beeinflussen. Anthropic berichtete in einem Postmortem zu Claude-Code-Qualitätsmeldungen, dass eine System-Prompt-Änderung in einer Evaluation bei Opus 4.6 und Opus 4.7 jeweils einen Rückgang von 3 % zeigte und im Release vom 20. April zurückgenommen wurde. Das unterstreicht: Dasselbe Modell kann sich je nach Produkt-Wrapper, System-Prompt und Toolchain anders anfühlen.
| Priorität im Team | Zuerst testen | Warum |
|---|---|---|
| Terminal-Befehle, Automatisierung, Tool-Agenten | GPT-5.5 | Terminal-Bench 2.0: 82,7 % für GPT-5.5 gegenüber 69,4 % für Claude Opus 4.7, mit Harness-Hinweis. |
| Reale Repository-Issues, Bugfixes, Tests bestehen | Claude Opus 4.7 | SWE-Bench Pro: 64,3 % für Claude Opus 4.7 gegenüber 58,6 % für GPT-5.5. |
| Landingpages, Dashboards, App-Screen-Entwürfe | Claude Opus 4.7 | Appwrite bewertet Claude bei UI-first-Arbeiten stärker. |
| Lange Code- oder Dokumentausgaben | Claude Opus 4.7 | Der Standardpreis für Output-Tokens liegt bei 25 US-Dollar statt 30 US-Dollar pro 1 Mio. Tokens. |
| ChatGPT- oder Codex-zentrierte Abläufe | GPT-5.5 | OpenAI meldet GPT-5.5 in Codex und ChatGPT. |
| Upgrade einer bestehenden Claude-API-Integration | Claude Opus 4.7, aber Migration prüfen | Anthropic nennt claude-opus-4-7, weist aber auf API breaking changes gegenüber Opus 4.6 hin. |
GPT-5.5 schlägt Claude Opus 4.7 nicht pauschal, und Claude Opus 4.7 schlägt GPT-5.5 nicht pauschal. Die öffentlich belegten Stärken liegen an unterschiedlichen Stellen: GPT-5.5 überzeugt besonders bei Terminal-Bench 2.0 und damit bei terminalnahen Agenten-Aufgaben; Claude Opus 4.7 zeigt stärkere Signale bei SWE-Bench Pro, UI-first-Erzeugung und dem Standardpreis für Output-Tokens.
Die pragmatische Entscheidung lautet deshalb: nicht entweder-oder, sondern routen. Für Terminal-Automatisierung und OpenAI-nahe Workflows zuerst GPT-5.5 testen; für echte GitHub-Issues, UI-Prototypen und outputlastige Aufgaben zuerst Claude Opus 4.7 heranziehen.