GPT-6.1 Sol: schneller, schlauer, zuverlässiger — mein erster Eindruck

Martin Rau · · 5 Min. Lesezeit

OpenAI hat GPT-6.1 Sol am 29. September auf dem DevDay vorgestellt — als Ablösung für GPT-6 Sol, das gerade mal sieben Tage vorher erschienen war. Ich habe das neue Modell direkt nach dem Release in boostN eingebunden und die ersten realen Tasks darüber laufen lassen. Kurzfassung vorweg: Es arbeitet zuverlässig und gut. Alles andere prüfe ich gerade noch.

Wie ich eingestiegen bin

Mein Vorgehen war bewusst schmucklos: Sol 6.1 in boostN eingebunden und dieselbe Art von Aufgaben durchlaufen lassen, die ich sonst auch verteile. Kein Sonder-Prompting, keine angepassten Einstellungen. Ich wollte erst einmal sehen, ob das Modell im Alltag hält, was der Release verspricht — bevor ich es gegen die Konkurrenz stelle.

Das tut es: Die ersten Tasks liefen zuverlässig und mit guten Ergebnissen durch. Für ein Modell, das seinen eigenen Vorgänger nach einer Woche ersetzt, ist das ein ordentlicher erster Eindruck. Ob es die stärkeren Claude-Modelle bei den harten Fällen wirklich einholt, ist damit aber noch nicht gesagt — genau das teste ich jetzt.

Wo das Modell steht

Bevor ich ins Detail gehe, die grobe Landkarte. Die folgende Karte ordnet GPT-6.1 Sol gegen die relevante Vergleichsgruppe ein — Fähigkeit gegen Kosten-Effizienz. Beide Achsen sind eine redaktionelle Einordnung, kein Benchmark:

Positionierung: GPT-6.1 Sol im Modellfeld
Frontier Geschwindigkeit / Kosten-Effizienz → Fähigkeit / Reasoning ↑ 1 1 Claude Fable 5.1 2 2 GPT-6 Astra 3 3 Claude Opus 5.5 4 4 GPT-6.1 Sol 5 5 Claude Sonnet 5.5 6 6 Claude Opus 4.8

Redaktionelle Einordnung, kein Benchmark · Ausschnitt, Achsen gezoomt

Sol 6.1 landet weit rechts: Es ist eines der kosten-effizientesten Modelle im Feld, ohne bei der Fähigkeit stark abzufallen. Genau das ist die Geschichte dieses Releases — und genau da lohnt der genauere Blick.

Intelligenz: knapp hinter Astra, hinter der Claude-Spitze

Beim Artificial-Analysis-Intelligence-Index, dem Gesamtmaß über viele Aufgaben, liegt Sol 6.1 knapp hinter dem eigenen großen Bruder Astra und deutlich hinter der aktuellen Claude-Spitze:

Intelligence Index — Sol 6.1 im Vergleich

Artificial Analysis Intelligence Index, Stand Sep 2026 · höher = besser

58 ClaudeOpus 5.5 Anthropic 56 ClaudeSonnet 5.5 Anthropic 53 GPT-6Astra OpenAI 52 GPT-6.1Sol OpenAI

Werte: Artificial Analysis · artificialanalysis.ai

52 Punkte gegen 53 bei Astra, 56 bei Sonnet 5.5 und 58 bei Opus 5.5. Das ist ein Fortschritt gegenüber GPT-6 Sol (plus vier Punkte), aber es reicht nicht an die Claude-Reihe heran. Die Presse hat es nüchtern zusammengefasst: Sol 6.1 bleibt beim Top-Benchmark hinter Anthropics gesamter Claude-Linie.

Preis: das eigentliche Argument

Beim Preis dreht sich das Bild. Sol 6.1 kostet 2 US-Dollar pro Million Input-Token und 10 US-Dollar pro Million Output-Token — auf Sonnet-5.5-Niveau und ein Fünftel dessen, was Astra oder Fable 5.1 verlangen:

Preis pro Mio. Token (blended, Listenpreis)

Ø aus Input- und Output-Listenpreis · niedriger = besser

$6.00 GPT-6.1Sol OpenAI $6.00 ClaudeSonnet 5.5 Anthropic $12.00 ClaudeOpus 5.5 Anthropic $15.00 ClaudeOpus 4.8 Anthropic $30.00 GPT-6Astra OpenAI $30.00 ClaudeFable 5.1 Anthropic

Werte: Anbieter-Preislisten, Stand Sep 2026 ·

Der Cache-Read fällt sogar auf 0,10 Dollar, halb so viel wie beim Vorgänger. Für einen Frontier-nahen Anbieter ist das ein aggressiver Preis.

Was mich überzeugt

Der eigentliche Hebel ist das Preis-Leistungs-Verhältnis, nicht die reine Intelligenz. Drei Punkte stechen heraus:

Coding auf Astra-Niveau, zum Bruchteil der Kosten. Bei DeepSWE liegt Sol 6.1 mit 75,2 Prozent sogar knapp vor Astra (74,1 Prozent) — bei rund einem Fünftel der Kosten pro Task (0,65 statt 4,43 Dollar). Auf OSWorld liegt es 2,1 Punkte hinter Astra, kostet dort aber nur etwa ein Siebtel pro Aufgabe. Für agentisches Coding ist das eine sehr gute Ausgangslage.

Kosten pro Task, nicht pro Token. Die Zahl, die im Betrieb zählt, ist der Preis pro erledigter Aufgabe. Im AA-Task-Mix kostet Sol 6.1 rund 0,72 Dollar gegen 3,26 bei Astra — und liegt damit etwa 88 Prozent unter Opus 5.5. Wenn ein Modell eine Aufgabe zuverlässig und billig löst, ist der etwas niedrigere Gesamtindex im Alltag oft zweitrangig.

Weniger Halluzinationen als der Vorgänger. Die Fehlerrate bei niedrigem Effort ist von 11,4 auf 7,7 Prozent gefallen. Das deckt sich mit meinem frühen Eindruck: Die ersten Tasks kamen ohne die kleinen Erfindungen zurück, die man sonst nachkontrollieren muss.

Wo ich skeptisch bin

Genauso ehrlich die Kehrseite:

  • Der Gesamtindex liegt hinter Claude. Für die wirklich schweren, mehrschichtigen Aufgaben ist Opus 5.5 mit 58 Punkten weiter die andere Liga. Preis-Leistung ist stark, absolute Spitzenleistung nicht.
  • Das Tempo ist unterdurchschnittlich. Rund 67 Token pro Sekunde — Sonnet 5.5 liefert mehr als das Doppelte. Bei interaktiver Arbeit merkt man das. Eine schnellere „Ultrafast”-Option in Codex ist angekündigt, kostet aber das Sechsfache.
  • Der 272K-Aufschlag. Ab 272.000 Token pro Anfrage verdoppelt sich der Input-Preis, der Output steigt um die Hälfte — und zwar für die ganze Anfrage. Bei sehr langen Kontexten schmilzt der Preisvorteil.
  • Safety-Regressionen gegenüber Astra. „Unwanted persistence” liegt bei 23,5 Prozent (Astra: 17,4), die Coding-Täuschungsrate bei 1,50 Prozent (Astra: 0,51). Beides ist besser als bei GPT-6 Sol, aber ein Rückschritt gegenüber Astra — für autonome Läufe ohne enge Aufsicht ein Punkt, den ich im Auge behalte.

Wofür ich es einsetzen würde

Das ist eine vorläufige Einschätzung — die belastbaren Vergleiche laufen noch. Mit diesem Vorbehalt:

Für hochvolumige, klar umrissene Coding- und Agenten-Tasks, bei denen die Kosten pro Aufgabe zählen, ist Sol 6.1 nach dem ersten Eindruck ein starker Kandidat. Genau da spielt es seinen Preis-Leistungs-Vorteil aus.

Für die schweren Fälle — verzwickte Architektur, lange Ketten mit vielen Zwischenentscheidungen, alles, wo ein Fehler teuer wird — bleibe ich vorerst bei Opus 5.5. Und wo Tempo bei ordentlicher Qualität gefragt ist, ist Sonnet 5.5 mit seinem doppelten Durchsatz weiter mein Reflex. Sol 6.1 setze ich dort ein, wo Menge und Kosten den Ausschlag geben, nicht die letzte Reasoning-Tiefe.

Zwischenfazit

Nach den ersten Tasks ist mein Eindruck klar positiv, aber unvollständig. Sol 6.1 arbeitet zuverlässig, ist überraschend günstig und beim Coding auf Augenhöhe mit dem deutlich teureren Astra. Ob es bei den harten Aufgaben an die Claude-Modelle heranreicht, weiß ich erst nach den gezielten Tests — die reiche ich nach.

Alle Beiträge im Überblick:GPT