Claude Fable 5.1 und Mythos 5.1: schneller, halber Token-Verbrauch

Redaktion · · 5 Min. Lesezeit

Anthropic hat am 1. September 2026 Claude Fable 5.1 veröffentlicht, zusammen mit dem zugangsbeschränkten Geschwistermodell Claude Mythos 5.1. Der API-Identifier claude-fable-5-1 ist am selben Tag live gegangen. Laut Hersteller erreicht das Modell die Coding-Stärke des ursprünglichen Fable, arbeitet aber schneller, verbraucht rund die Hälfte der Tokens und formuliert klarer. Der Basispreis bleibt gleich — der eigentliche Kosten-Hebel liegt bei den Cache-Reads, die 75 % günstiger werden.

Was vorher galt

Fable ist Anthropics auf Coding und lange agentische Läufe ausgelegte Top-Linie. Mit Fable 5 lag der Preis bei 10 $ pro Mio. Input-Token und 50 $ pro Mio. Output-Token — konkurrenzfähig für ein Frontier-Modell, aber teuer, sobald Agenten-Workflows große Kontexte immer wieder neu durch das Modell schicken. Genau da setzt Prompt-Caching an: Wiederkehrende Kontext-Blöcke werden zwischengespeichert, sodass sie beim erneuten Aufruf günstiger als frischer Input berechnet werden. Der Cache-Read-Preis war damit ein realer Kostentreiber für alles, was denselben Kontext mehrfach nutzt.

Parallel stand Fable zuletzt weniger wegen der Technik in den Schlagzeilen als wegen der Zugangspolitik — Stichwort Export-Beschränkungen rund um Fable 5 und Mythos 5.

Was jetzt gilt

1. Halber Token-Verbrauch bei gleicher Coding-Stärke. Anthropic gibt an, dass Fable 5.1 die Coding-Leistung des ursprünglichen Fable hält, dafür aber rund die Hälfte der Tokens braucht. Das ist eine Hersteller-Angabe, kein unabhängiger Benchmark — aber wenn sie in der Praxis trägt, senkt allein der geringere Verbrauch die Realkosten pro Aufgabe spürbar, unabhängig vom Preis pro Token.

2. Basispreis bleibt, Cache-Reads werden 75 % günstiger. Der Preis pro Input- und Output-Token ist gegenüber Fable 5 unverändert (10 $ / 50 $ pro Mio.). Was fällt, sind die Cache-Reads: von zuvor auf jetzt 0,25 $ pro Mio. Token, ein Minus von 75 %. Wichtig für die Kalkulation: Diese Ersparnis greift nur bei zwischengespeichertem Kontext, nicht beim regulären Input.

3. „Fable for everyone” — weniger restriktiv. Anthropic rahmt den Release als breitere Verfügbarkeit. TechCrunch bezeichnet die Version als weniger restriktiv als die Vorgänger. Das zugangsbeschränkte Mythos 5.1 bleibt davon getrennt — es ist das enger kontrollierte Schwestermodell.

Einordnung

Der eigentliche Kosteneffekt kommt aus der Kombination von zwei Hebeln, die man auseinanderhalten muss. Der Basispreis pro Token ist gleich geblieben — wer Fable 5.1 einfach wie Fable 5 nutzt, ohne Caching und ohne den geringeren Verbrauch, zahlt nominal dasselbe pro Token. Die Ersparnis entsteht erst durch (a) den rund halbierten Token-Verbrauch und (b) die 75 % günstigeren Cache-Reads. Beides schlägt vor allem bei agentischen Workflows durch, die denselben großen Kontext über viele Schritte wiederverwenden.

Für die Kalkulation heißt das konkret: Die „75 % günstiger”-Zahl bezieht sich ausschließlich auf Cache-Reads — nicht auf den Gesamtpreis eines Aufrufs. Wer das in einem Kostenmodell als pauschale Preissenkung verbucht, rechnet sich reicher, als es ist. Realistisch ist die Gesamt-Ersparnis stark davon abhängig, wie hoch der Cache-Read-Anteil und wie groß der wiederverwendete Kontext im jeweiligen Workflow ist.

Für Agentur-Kunden ist die Richtung trotzdem klar positiv: Coding-lastige und agentische Anwendungen werden mit Fable 5.1 günstiger zu betreiben — vorausgesetzt, das Setup nutzt Prompt-Caching konsequent. Ohne Caching bleibt der Vorteil auf den geringeren Verbrauch beschränkt.

Was du jetzt tun kannst

Wenn du Fable produktiv einsetzt: Prüfe, ob dein Setup Prompt-Caching aktiv nutzt. Der 75-%-Vorteil auf Cache-Reads verpufft, wenn wiederkehrende Kontexte nicht gecacht werden. Miss den Cache-Read-Anteil deiner Workloads, bevor du eine Ersparnis versprichst.

Wenn du Kosten kalkulierst: Trenne im Modell drei Positionen — Input, Output und Cache-Reads. Wende die 75-%-Senkung nur auf die Cache-Read-Position an, nicht auf den Gesamtpreis. Rechne den halbierten Token-Verbrauch separat als eigenen Effekt ein.

Wenn du Modelle vergleichst: Nimm die Hersteller-Aussage „gleiche Coding-Stärke, halber Verbrauch” als These, nicht als Fakt. Fahre einen eigenen Vergleichslauf gegen Fable 5 auf deinen realen Aufgaben, bevor du migrierst.

Alle Beiträge im Überblick:ClaudeLLM-Pricing