| Kriterium | Claude Opus 4.7 | Claude Opus 4.6 | Claude Sonnet 4.6 |
|---|---|---|---|
| Rolle | Neueres Opus-Modell; Anthropic hebt Coding, Agents, Vision, Multi-Step Tasks sowie mehr Gründlichkeit und Konsistenz hervor. | Vorherige Opus-Version; eingeführt mit Verbesserungen bei Coding, Planung, Long-Running Agents, großen Codebases, Code Review und Debugging. | Breites Sonnet-Upgrade für Coding, Computer Use, Long-Context Reasoning, Agent Planning, Knowledge Work und Design. |
| Wann priorisieren? | Schwierige Coding-Agenten, komplexe Software-Engineering-Aufgaben, lange Workflows, Vision-Anteile oder Aufgaben mit hohem Fehlerrisiko. | ||
| Kontextfenster | 1 Mio. Tokens laut Model Overview. | Anthropic nannte für Opus 4.6 ein Kontextfenster von 1 Mio. Tokens in Beta. | 1 Mio. Tokens laut Model Overview. |
| Maximale Ausgabe | 128.000 Tokens. | In den bereitgestellten offiziellen Quellen fehlt eine vergleichbare Angabe im selben Format. | 64.000 Tokens. |
| API-Preis laut Model Overview | 5 US-Dollar je 1 Mio. Input-Tokens und 25 US-Dollar je 1 Mio. Output-Tokens. | In den bereitgestellten offiziellen Quellen fehlt eine vergleichbare Angabe im selben Format. | 3 US-Dollar je 1 Mio. Input-Tokens und 15 US-Dollar je 1 Mio. Output-Tokens. |
| Latenz laut Docs | moderate. | In den bereitgestellten offiziellen Quellen fehlt eine vergleichbare Angabe im selben Format. | fast. |
| Thinking-Modi laut Docs | Adaptive Thinking. | Die System Card zu Opus 4.6 enthält einen Abschnitt zu Extended und Adaptive Thinking Modes. | Adaptive Thinking und Extended Thinking. |
fast Latenz gelistet. Der wichtigste Unterschied ist nicht eine andere Produktklasse, sondern der Qualitätsfokus der neueren Opus-Version. Anthropic beschreibt Opus 4.7 als stärker bei Coding, Agents, Vision und Multi-Step Tasks und betont mehr Gründlichkeit und Konsistenz bei wichtigen Arbeiten.
Das baut auf dem auf, was Opus 4.6 bereits liefern sollte. Bei Opus 4.6 hob Anthropic Verbesserungen bei Coding, vorsichtigerer Planung, Long-Running Agents, großen Codebases, Code Review und Debugging hervor. Wenn Opus 4.6 also bei kurzen, stabilen Prompts schon gut funktioniert, ist Opus 4.7 vor allem dort interessant, wo Fehler typischerweise entstehen: lange Tool-Call-Ketten, mehrere Korrekturrunden, große Repositories, strenge Formatvorgaben oder Aufgaben, die Reasoning und Vision kombinieren.
Was Sie vermeiden sollten: eine blinde Migration. Die offiziellen Angaben sprechen für Verbesserungen in wichtigen Aufgabenklassen, beweisen aber nicht, dass jeder Prompt, jedes JSON-Format und jede Pipeline in Ihrer Production automatisch besser wird. Sinnvoller ist ein direkter Test: Opus 4.6 und Opus 4.7 mit denselben Fällen laufen lassen und Erfolgsrate, Nacharbeitsrunden, Tool-Call-Fehler, Tokenkosten und Latenz vergleichen.
Die Model Overview von Anthropic stellt Opus 4.7 als leistungsfähiges Modell für Complex Reasoning und Agentic Coding dar. Sonnet 4.6 wird dort als Modell mit einer besonders guten Kombination aus Geschwindigkeit und Intelligenz beschrieben. Für den Betrieb ist diese Unterscheidung oft wichtiger als die pauschale Frage, welches Modell „schlauer“ ist.
Wenn Ihr Produkt viele parallele Requests verarbeitet, kurze Antwortzeiten braucht und empfindlich auf Tokenkosten reagiert, ist Sonnet 4.6 meist die bessere Standardroute. Laut Anthropic-Dokumentation ist Sonnet 4.6 fast und kostet 3 US-Dollar je 1 Mio. Input-Tokens sowie 15 US-Dollar je 1 Mio. Output-Tokens. Anthropic nennt Sonnet 4.6 außerdem als Default-Modell auf claude.ai und in Claude Cowork für Free- und Pro-Nutzer.
Opus 4.7 passt besser zu weniger, aber wertvolleren Requests: schwierige Coding-Agenten, mehrstufige Softwarearbeit, längeres Reasoning oder Aufgaben, bei denen Konsistenz besonders wichtig ist. Die Model Overview listet Opus 4.7 mit moderate Latenz und Preisen von 5 US-Dollar je 1 Mio. Input-Tokens sowie 25 US-Dollar je 1 Mio. Output-Tokens.
Opus 4.7 und Sonnet 4.6 werden beide mit einem Kontextfenster von 1 Mio. Tokens geführt. Beim langen Input liegt der Unterschied zwischen diesen beiden Modellen also nicht im reinen Kontextlimit.
Deutlicher ist die Differenz bei der maximalen Ausgabe: Opus 4.7 kommt laut Model Overview auf 128.000 Tokens, Sonnet 4.6 auf 64.000 Tokens. Das kann sich lohnen, wenn ein Workflow lange technische Berichte, umfangreiche Implementierungspläne, größere Refactorings oder stark strukturierte Dokumente erzeugen soll. Für kurze und mittlere Antworten zählen in der Praxis aber oft Kosten, Latenz und Verlässlichkeit stärker als das theoretische Output-Maximum.
Ein Detail, das bei Migrationen leicht übersehen wird: die Thinking-Modi. In der Model Overview steht Opus 4.7 mit Adaptive Thinking, Sonnet 4.6 dagegen mit Adaptive Thinking und Extended Thinking. Die System Card zu Opus 4.6 enthält ebenfalls einen Abschnitt zu Extended und Adaptive Thinking Modes.
Wenn Ihre Pipeline Prompts, Tokenbudgets, Logging oder Monitoring rund um Extended Thinking aufgebaut hat, sollten Sie nicht einfach alle Routen auf Opus 4.7 umstellen. Das ist kein Argument gegen Opus 4.7 – aber ein klares Argument für Kompatibilitätstests vor dem Rollout.
Eine robuste Produktionsarchitektur teilt die Modelle eher nach Aufgabenklassen auf, statt ein einziges Modell für alles zu erzwingen:
fast Latenz in den Docs. So bleibt Sonnet 4.6 für den volumenstarken Alltag zuständig, während Opus 4.7 dort eingesetzt wird, wo zusätzliche Qualität wirtschaftlich mehr wert ist als die höheren Tokenkosten.
Bevor Sie das Default-Modell ändern, sollten Sie dieselben Testfälle über alle relevanten Kandidaten laufen lassen:
Wenn Sie heute eine pragmatische Entscheidung brauchen: Sonnet 4.6 ist der bessere Default für breite Production, Opus 4.7 ist das Eskalationsmodell für schwierige Aufgaben, und Opus 4.6 sollte als Baseline bleiben, solange Ihr bestehendes System darauf stabil läuft. Sonnet 4.6 ist laut Docs günstiger und schneller, während Anthropic Opus 4.7 besonders für Coding, Agents, Vision und Multi-Step Tasks hervorhebt und ihm ein größeres Output-Limit als Sonnet 4.6 zuweist.
Der eigentliche Hebel ist also nicht die Suche nach einem absoluten Sieger, sondern ein gutes Routing mit sauberen Evals. Die Anthropic-Dokumentation sagt, was Sie erwarten dürfen; Ihre eigenen Produktionsdaten zeigen, welches Modell in Ihrem System wirklich am besten funktioniert.
| Wenn ein bestehendes System stabil läuft und Sie eine Baseline für Regressionstests brauchen. |
| Breiter Produktivbetrieb mit vielen Requests, bei dem Geschwindigkeit und Kosten wichtiger sind als maximale Modellstärke. |