DeepSeek V4.1-Flash: Günstigstes Coding-Modell fällt bei Langläufer-Agentik ab

Redaktion · · 5 Min. Lesezeit

DeepSeek hat heute, am 10. September 2026, mit V4.1-Flash das kleinste Modell seiner neuen V4.1-Architekturfamilie veröffentlicht — mit nativer multimodaler Bildverarbeitung. Die Zahlen, die DeepSeek dazu selbst veröffentlicht, sind für die Größenklasse ungewöhnlich: Bei kurzen Coding-Aufgaben liegt V4.1-Flash nach eigener Messung vor allen genannten Vergleichsmodellen, bei langlaufenden agentischen Aufgaben fällt es dagegen deutlich zurück. Unabhängige Tests gibt es dafür noch keine — alles, was folgt, sind DeepSeeks eigene Angaben.

Was vorher galt

DeepSeeks V4-Reihe (V4, V4 Pro, V4 Flash) hatte sich bereits als Preisbrecher etabliert — zuletzt mit der dauerhaften 75-%-Preissenkung bei V4 Pro im Mai 2026. Das Muster war dabei immer dasselbe: günstige, offene MoE-Modelle mit guter Coding-Leistung, aber ohne belastbaren Anspruch auf lange, autonome Agenten-Einsätze. Diese Domäne — Aufgaben, die über Stunden selbstständig laufen, Zwischenstände bewerten und Kurs korrigieren — blieb bislang klar bei den teuren westlichen Frontier-Modellen: Claude Opus 5, Claude Fable 5.1 und GPT-6 Astra kosten das 15- bis 40-Fache je Output-Token, lieferten dafür aber auch bei Langläufer-Tasks die verlässlicheren Ergebnisse.

Was jetzt gilt

1. V4.1-Flash ist bei kurzen Coding-Aufgaben nach eigener Messung die neue Nummer eins. Mit 74,2 Punkten liegt es knapp, aber sichtbar vor Muse Spark 1.3 und GPT-5.6 Sol — und das bei einem Bruchteil von deren Preis:

| Modell | Score (Coding, unter 1h) | |---|---| | DeepSeek V4.1-Flash | 74,2 | | Muse Spark 1.3 (xhigh) | 73 | | GPT-5.6 Sol | 72 | | Muse Spark 1.3 (max) | 72 |

2. Bei Langläufer-Agentik dreht sich das Bild komplett. Sobald Aufgaben über eine Stunde autonom laufen, bricht V4.1-Flash gegenüber den großen westlichen Modellen deutlich ein:

| Modell | Score (Agentik, über 1h) | |---|---| | Claude Fable 5.1 | 58 | | GPT-6 Astra | 56 | | Claude Opus 5 | 55 | | DeepSeek V4.1-Flash | 30 |

Der Abstand ist kein Ausreißer, sondern strukturell: „Flash”-Varianten sind auf schnelle, in sich abgeschlossene Reasoning-Schritte optimiert, nicht auf stundenlange Handlungsketten mit vielen Zwischenentscheidungen. DeepSeek selbst positioniert V4.1-Flash entsprechend nicht als Ersatz für die eigenen größeren Modelle bei Agenten-Workloads.

3. Der Preisabstand ist der eigentliche Paukenschlag. V4.1-Flash kostet 0,30 $ Input und 1,20 $ Output je Million Token — das ist rund ein Viertel des Preises von Muse Spark 1.3 und ein Zwanzigstel dessen, was Claude Fable 5.1 oder GPT-6 Astra pro Output-Token verlangen. In Kombination mit Platz 1 bei kurzen Coding-Aufgaben ergibt das eine Preis-Leistungs-Position, die kein Vergleichsmodell in diesem Datensatz erreicht.

| Modell | Input $/Mio. | Output $/Mio. | |---|---|---| | DeepSeek V4.1-Flash | 0,30 | 1,20 | | Muse Spark 1.3 | 1,25 | 4,25 | | Claude Opus 5 | 5,00 | 25,00 | | Claude Fable 5.1 | 10,00 | 50,00 | | GPT-6 Astra | 10,00 | 50,00 |

Einordnung

Alle Zahlen oben stammen aus DeepSeeks eigener Testreihe — es gibt bislang keine unabhängige Reproduktion, weder für die Coding- noch für die Agentik-Werte. Das Muster ist aus früheren DeepSeek-Releases bekannt: starke Eigenmessungen zum Launch, unabhängige Einordnung folgt typischerweise zwei bis vier Wochen später und fällt meist etwas nüchterner aus als die Erstankündigung.

Trotzdem ist der Befund nicht bedeutungslos. Dass ein „Flash”-Modell — also die bewusst abgespeckte, günstige Variante einer Architekturfamilie — bei kurzen, klar umrissenen Coding-Aufgaben mit Frontier-Modellen mithält, bestätigt einen Trend, der sich seit V4 Pro abzeichnet: Der Preisdruck aus China trifft inzwischen nicht mehr nur einfache Klassifizierungs- oder Zusammenfassungsaufgaben, sondern echtes Coding-Reasoning. Der klare Einbruch bei Langläufer-Agentik zeigt gleichzeitig, wo die Grenze aktuell verläuft: Autonomie über Stunden hinweg bleibt (noch) eine Domäne, in der der Preis pro Token nicht die ganze Rechnung ist — Verlässlichkeit über viele Zwischenschritte kostet offenbar tatsächlich mehr Rechenaufwand.

Für eine Agentur heißt das: Die Modellwahl ist keine Marken-, sondern eine Task-Entscheidung. Wer kurze, gut abgegrenzte Coding-Jobs in großer Zahl automatisiert, hat mit V4.1-Flash potenziell ein sehr günstiges Werkzeug. Wer mehrstündige autonome Agenten-Läufe braucht, bleibt vorerst bei den teureren Modellen — bis unabhängige Tests etwas anderes zeigen.

Was du jetzt tun kannst

Wenn du kurze, klar abgegrenzte Coding-Tasks automatisierst: Teste DeepSeek V4.1-Flash gegen dein aktuelles Modell und rechne die Kostenersparnis gegen die Qualität deiner Stichprobe — bei diesem Preisabstand lohnt sich schon eine kleine Testmenge.

Wenn du mehrstündige, autonome Agenten-Workflows planst: Bleib vorerst bei Claude Opus 5, Claude Fable 5.1 oder GPT-6 Astra. Der Agentik-Score von V4.1-Flash spricht klar gegen einen Wechsel für diese Aufgabenklasse.

Wenn du Kunden zur Modellwahl berätst: Trenne die Empfehlung nach Aufgabentyp statt nach Anbieter-Präferenz. Genau diese Zweiteilung — günstig und stark bei kurzen Aufgaben, schwach bei Langläufern — ist bei Flash-Varianten inzwischen ein wiederkehrendes Muster, nicht nur bei DeepSeek.

Alle Beiträge im Überblick:DeepSeek