Claude Sonnet 5.5 Release September 2026 - Alle Infos Lexikon
Was Claude Sonnet 5.5 ist
Claude Sonnet 5.5 ist Anthropics neue Mittelklasse — die schnellere, günstigere Ergänzung zu Opus 5.5. Veröffentlicht am 28. September 2026, nur knapp eine Woche nach Opus 5.5 (22. September). Das Muster ist bei Anthropic inzwischen Routine: zuerst das teure Spitzenmodell, kurz darauf die Arbeitspferd-Stufe darunter, die den größten Teil des täglichen Volumens tragen soll. Sonnet 5.5 ist also nicht das klügste Modell im Haus, sondern das, das Qualität und bezahlbares Volumen zusammenbringt — genau die Rolle, für die die Sonnet-Linie seit jeher steht.
Model-ID ist claude-sonnet-5-5 (Claude API, Google Cloud, Microsoft Foundry, AWS; auf Bedrock anthropic.claude-sonnet-5-5, über OpenRouter und Vercel als anthropic/claude-sonnet-5.5). In Claude Code läuft es unter dem Alias sonnet. Der Wissensstand reicht bis Juni 2026, das Kontextfenster fasst 1 Mio. Token, die Ausgabe bis 128K (im Batch mit Beta-Header bis 300K). Ein Detail für Caching-Workflows: Das Cache-Minimum sinkt von 1.024 auf 512 Token.
Kurzfassung
Sonnet 5.5 schlägt im unabhängigen Intelligence Index die GPT-6-Astra-Klasse und liegt nur knapp hinter Opus 5.5 — zum gleichen Listenpreis wie Sonnet 5. Der Haken steht im Kleingedruckten: Die Rekord-Benchmarks gelten nur im teuersten „max”-Effort. Die Standard-Einstellungen von API und Claude Code liefern deutlich weniger.
Eignungsprofil im Vergleich
- Coding 5 / 5 · Feld-Spitze
- Reasoning 4.5 / 5 · Claude Opus 5.5 u. a.
- Text 4.5 / 5 · Claude Opus 5.5
- Vision 4 / 4.5 · Claude Opus 5.5
- Speed 4 / 4 · Feld-Spitze
- Kosten-Eff. 4 / 4.5 · GPT-6.1 Sol
Eignung 0–5 · redaktionelle Einordnung, kein Benchmark · gestrichelt = Feld-Bestwert je Achse
Die Achsen (Coding, Reasoning, Text, Vision, Speed, Kosten-Effizienz) sind eine redaktionelle Einordnung, kein Benchmark. Sie zeigen das Sonnet-5.5-Muster: starke Coding- und Reasoning-Werte dicht an der Opus-Spitze, dazu ein spürbarer Vorsprung bei Tempo und Kosten-Effizienz gegenüber Opus 5.5. Kein Modell, das eine einzelne Achse dominiert — eines, das auf keiner absackt. Die harten Zahlen stehen in den Benchmark-Balken darunter.
Benchmarks: knapp hinter Opus 5.5, klar vor Sonnet 5
Bei den Zahlen lohnt die Trennung nach Herkunft. Ein Teil stammt aus Anthropics eigener Testreihe zum Launch, ein Teil aus herstellerunabhängigen Messungen von Artificial Analysis.
Aus Anthropics eigener Testreihe (jeweils im „max”-Effort):
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | |---|---|---|---| | Terminal-Bench 4.0 | 70,6 % | 10,3 % | 66,4 % | | FrontierCode 1.1 (xhigh) | 52,1 % | 42,4 % | 54,4 % | | CursorBench 4.0 | 55,5 % | 34,1 % | 57,8 % | | GDPval-AA v2.1 (Elo) | 1844 | 1449 | 1846 | | AA-Briefcase v1.1 (Elo) | 1811 | 1359 | 1822 | | Humanity’s Last Exam (Tools) | 64,5 % | 54,9 % | 67,7 % | | OSWorld 2.1 | 80,1 % | 57,0 % | 81,8 % | | Chartography (ohne Tools) | 61,6 % | 15,6 % | 64,4 % |
Zwei Dinge fallen auf. Erstens der Abstand zum Vorgänger: Gegenüber Sonnet 5 ist der Sprung in jeder Zeile deutlich, bei Terminal-Bench und Chartography sogar dramatisch. Zweitens die Nähe zu Opus 5.5: Das große Modell führt in sieben von acht Benchmarks, aber meist nur knapp. Nur bei Terminal-Bench 4.0 dreht Sonnet 5.5 den Spieß um und liegt mit 70,6 % vor Opus 5.5. Wichtig: Das sind Anbieter-Zahlen, kein neutraler Vergleich.
Der herstellerunabhängige Artificial Analysis Intelligence Index bestätigt die Einordnung aus zweiter Richtung:
Artificial Analysis Intelligence Index, Stand Sep 2026 · höher = besser
Werte: Artificial Analysis · artificialanalysis.ai
Sonnet 5.5 kommt auf 56 Punkte — hinter Opus 5.5 (58, aktuell Platz 1 im Index), aber vor GPT-6 Astra (53) und GPT-6.1 Sol (52). Für ein Mittelklasse-Modell ist das bemerkenswert: Sonnet 5.5 schlägt im Index das teure OpenAI-Spitzenmodell Astra. Die allgemeine Intelligenz ist also kein Kompromiss — der Kompromiss steckt woanders, nämlich im Effort.
Der eigentliche Kern: Alles hängt am Effort
Hier liegt der Punkt, den die Headline-Zahlen verschweigen. Sonnet 5.5 hat fünf Reasoning-Stufen — low, medium, high, xhigh, max — und die Leistung skaliert extrem mit der Stufe. Die beeindruckenden 70,6 % bei Terminal-Bench gelten nur im teuersten „max”-Modus. Dieselbe Aufgabe sieht je nach Effort völlig anders aus:
| Effort | Terminal-Bench 4.0 | Kosten pro Versuch | Rolle | |---|---|---|---| | max | 70,6 % | 12,54 $ | Headline-Zahl | | xhigh | 61,5 % | 5,30 $ | — | | high | 43,0 % | 1,94 $ | API-Default | | medium | 28,8 % | 0,83 $ | Claude-Code-Default | | low | 20,0 % | 0,76 $ | — |
Lies die beiden markierten Zeilen zweimal. Wer Sonnet 5.5 über die API mit Default-Einstellung aufruft, bekommt high — und damit 43,0 % statt der beworbenen 70,6 %. Wer es in Claude Code nutzt, bekommt medium — also 28,8 %. Der Rekordwert aus der Pressemitteilung kostet pro Versuch das 15-Fache des Default und ist in der normalen Nutzung schlicht nicht aktiv.
Worauf du achten musst
Die Benchmark-Zahl, die du irgendwo liest, ist ohne die zugehörige Effort-Stufe wertlos. Bevor du Sonnet 5.5 gegen ein anderes Modell vergleichst oder ein Budget planst: Prüfe, in welchem Effort gemessen wurde — und in welchem dein eigener Code tatsächlich läuft. Für teure, schwere Aufgaben kann es sich lohnen, den Effort bewusst hochzudrehen; für Masse ist der Default meist die richtige, günstigere Wahl.
Dazu kommt: Thinking ist standardmäßig an und lässt sich nur noch über {"type":"between_tools"} reduzieren, und das auch nur bis high. Ab xhigh denkt das Modell immer. Die früheren festen Thinking-Budgets gibt es nicht mehr.
Preis und Kosten pro Aufgabe
Sonnet 5.5 kostet 2 $ pro Mio. Input- und 10 $ pro Mio. Output-Token — exakt der Listenpreis von Sonnet 5. Cache Read liegt bei 0,20 $, Cache Write (5 Min.) bei 2,50 $, Batch halbiert auf 1 $/5 $. Einen Aufschlag im 1-Mio.-Fenster gibt es nicht. Im Blended-Preis liegt Sonnet 5.5 damit gleichauf mit GPT-6.1 Sol und klar unter den Spitzenmodellen:
Ø aus Input- und Output-Listenpreis · niedriger = besser
Werte: Anbieter-Preislisten, Stand Sep 2026 ·
Der Token-Preis ist aber nur die halbe Rechnung. Anthropic nennt für Sonnet 5.5 bis zu 30 % geringere Kosten pro Aufgabe als bei Sonnet 5 — bei gleichem Listenpreis, weil das Modell dasselbe Ergebnis mit weniger Token erreicht (die Spanne reicht je nach Workload von 12 bis 75 %). Dazu arbeitet es über 30 % schneller als Sonnet 5.
Der spannende Vergleich ist der mit dem direkten Preis-Rivalen GPT-6.1 Sol: gleicher Blended-Preis, aber unterschiedliche Profile. Sonnet 5.5 liegt im Intelligence Index vorn (56 vs. 52) und ist mit rund 142 Token/s mehr als doppelt so schnell wie Sol 6.1 (~67). Die Kehrseite zeigt sich bei den herstellerunabhängigen Task-Kosten: Im „max”-Modus kostet eine Index-Aufgabe bei Sonnet 5.5 rund 7,60 $, bei GPT-6.1 Sol nur 0,72 $. Für lange, hochvolumige Agenten-Läufe, in denen die Task-Kosten den Ausschlag geben, bleibt Sol 6.1 damit die günstigere Wahl — Sonnet 5.5 gewinnt dort, wo Tempo und allgemeine Intelligenz zählen. Auch hier gilt: Die Task-Kosten hängen direkt am gewählten Effort.
Positionierung
Die Positionierungs-Karte ordnet Sonnet 5.5 gegen Opus 5.5 und das Frontier-Feld ein — x-Achse Geschwindigkeit und Kosten-Effizienz, y-Achse Fähigkeit und Reasoning:
Redaktionelle Einordnung, kein Benchmark · Ausschnitt, Achsen gezoomt
Die Achsen sind eine redaktionelle Einordnung, kein Benchmark. Das Muster ist trotzdem klar: Sonnet 5.5 sitzt rechts oben — hohe Fähigkeit bei hoher Kosten-Effizienz — und damit genau in der Zone, in der ein Arbeitspferd stehen soll. Opus 5.5 liegt knapp darüber bei der Fähigkeit, aber deutlich weiter links beim Preis; die teuren Frontier-Modelle Astra und Fable 5.1 kosten mehr, ohne im Index entsprechend vorzulegen.
Breaking Changes gegenüber Sonnet 5
Sonnet 5.5 ist kein reiner Drop-in-Ersatz. Fünf API-Änderungen führen zu 400-Fehlern, wenn bestehender Sonnet-5-Code unverändert bleibt:
- Thinking abschalten geht nicht mehr.
{"type":"disabled"}ist durch{"type":"between_tools"}ersetzt (und das greift nicht beixhigh/max). Die festen Thinking-Budgets entfallen. - Keine erzwungene Tool-Wahl.
tool_choicemitanyodertoolwird durchautoplusstrict: trueersetzt. - Sampling-Parameter.
temperature,top_podertop_kmit Nicht-Default-Werten zusammen mit Assistant-Prefill lösen einen 400 aus. - Computer Use läuft nur noch mit dem Toolset
computer_toolset_20260801. - Advisor-Tool nur noch mit Opus 5/5.5, Sonnet 5.5, Fable 5/5.1 und Mythos 5/5.1 — nicht mehr mit Sonnet 5 oder Opus 4.8.
Noch ein Stolperstein für Multi-Modell-Setups: Thinking-Blöcke sind an Konversation und Account gebunden und lassen sich nicht zwischen Modellen portieren.
Safety: erstes Sonnet mit Cyber-Fallbacks
Sonnet 5.5 ist das erste Sonnet mit serverseitigen Cyber-Fallbacks. Riskantere Security-Anfragen werden intern auf Sonnet 5 umgeleitet, statt sie dem stärkeren Modell zu überlassen. Dazu kommen neue Refusal-Kategorien (cyber, bio, frontier_llm, reasoning_extraction) und ein Schutz gegen Distillation. Die Fallback-Rate liegt mit rund 1,5 % niedrig — bei Opus 5.5 sind es etwa 10 %, Sonnet 5.5 greift also seltener zum Rückfall.
Drei bekannte Einschränkungen gehören dazu: Auf Bedrock fehlen Structured Outputs. Bei langen Agenten-Tasks pausiert das Modell teils für Rückfragen, statt durchzulaufen. Und ein Teil der Knowledge-Work-Benchmarks lief laut Anthropic auf einem fehlerhaften Pre-Release-Deployment — diese Werte sind mit Vorsicht zu lesen.
Wann Sonnet 5.5, wann Opus 5.5, wann GPT-6.1 Sol
Die Auswahl folgt selten der Frage „welches Modell ist das beste”, sondern „welches passt zu Aufgabe und Budget”:
- Claude Sonnet 5.5 ist der neue Default für den breiten Alltag: Coding-Agenten, RAG mit langem Kontext, Tool-Use-Ketten und hochvolumige Pipelines, bei denen du nahe an der Opus-Qualität willst, ohne jeden Lauf mit Opus-Preisen zu zahlen. Dreh den Effort bei schweren Aufgaben bewusst hoch, lass ihn für Masse auf dem Default.
- Claude Opus 5.5 ist die Wahl, wenn maximale Qualität über viele Schritte zählt — es führt den Intelligence Index an und ist bei schweren, fehlerintoleranten Läufen (Architektur, komplexe Analyse) den Aufpreis wert. Der Abstand zu Sonnet 5.5 ist in den meisten Benchmarks aber klein.
- GPT-6.1 Sol ist der direkte Preis-Rivale mit gleichem Blended-Preis. Es gewinnt dort, wo in langen Agenten-Läufen die Kosten pro Aufgabe den Ausschlag geben (rund 0,72 $ statt 7,60 $ pro Index-Task). Sonnet 5.5 kontert mit höherem Index-Wert und mehr als doppeltem Tempo. Details im Lexikon-Eintrag zu GPT-6.1 Sol.
Und weil sich dieser Markt schnell dreht — zwischen Opus 5.5 und Sonnet 5.5 lag eine Woche — gehört die Modell-Wahl an eine zentrale, konfigurierbare Stelle im eigenen System, nicht hart verdrahtet in einzelne Aufrufe.
Verfügbarkeit, Preis und Spezifikationen
- Release: 28. September 2026 (Anthropic), knapp eine Woche nach Opus 5.5.
- Zugang: Claude API, Google Cloud, Microsoft Foundry, AWS Bedrock (
anthropic.claude-sonnet-5-5), OpenRouter/Vercel (anthropic/claude-sonnet-5.5), GitHub Copilot (Pro, Pro+, Max, Business, Enterprise — schrittweise). In Claude Code als Aliassonnet. - Preis: 2 $ Input / 10 $ Output pro Mio. Token, Cache Read 0,20 $, Cache Write (5 Min.) 2,50 $, Batch 1 $/5 $. Kein Aufschlag im 1-Mio.-Fenster.
- Kontext: 1 Mio. Token Input, bis 128K Ausgabe (Batch mit Beta-Header bis 300K). Cache-Minimum 512 Token.
- Reasoning-Effort: low, medium (Claude-Code-Default), high (API-Default), xhigh, max. Thinking standardmäßig an.
- Wissensstand: Juni 2026.
FAQ
FAQ
- In den meisten Benchmarks führt Opus 5.5 knapp — es liegt im Artificial Analysis Intelligence Index mit 58 Punkten vor Sonnet 5.5 (56) und gewinnt sieben von acht der Anthropic-Benchmarks. Sonnet 5.5 schlägt Opus 5.5 nur bei Terminal-Bench 4.0 (70,6 % vs. 66,4 %) und ist dabei deutlich günstiger und schneller.
- Weil die Rekordzahlen nur im teuersten 'max'-Effort gelten. Die API nutzt per Default 'high', Claude Code nutzt 'medium'. Bei Terminal-Bench bedeutet das 43,0 % (high) bzw. 28,8 % (medium) statt der 70,6 % aus 'max'. Für die Spitzenwerte musst du den Effort bewusst hochdrehen — das kostet pro Versuch bis zum 15-Fachen.
- 2 $ pro Mio. Input- und 10 $ pro Mio. Output-Token — der gleiche Listenpreis wie Sonnet 5. Anthropic nennt bis zu 30 % geringere Kosten pro Aufgabe, weil das Modell mit weniger Token zum Ziel kommt. Cache Read kostet 0,20 $, Batch halbiert die Preise.
- Beide haben denselben Blended-Token-Preis. Sonnet 5.5 hat den höheren Intelligence-Index (56 vs. 52) und ist mit rund 142 Token/s mehr als doppelt so schnell wie Sol 6.1 (67). GPT-6.1 Sol gewinnt bei den Task-Kosten in langen Agenten-Läufen (rund 0,72 $ statt 7,60 $ pro Index-Task).
- Nicht ganz. Fünf Änderungen lösen 400-Fehler aus: Thinking lässt sich nicht mehr via 'disabled' abschalten, erzwungene Tool-Wahl entfällt, bestimmte Sampling-Parameter mit Assistant-Prefill werden abgelehnt, Computer Use braucht das neue Toolset, und das Advisor-Tool unterstützt Sonnet 5 nicht mehr.