GPT-6.1 Sol Release September 2026 - Alle Infos Lexikon

Redaktion ·

Was GPT-6.1 Sol ist

GPT-6.1 Sol ist OpenAIs neue Preis-Leistungs-Stufe, vorgestellt auf dem DevDay am 29. September 2026. Der Name folgt der Sonnensystem-Logik von OpenAI: Innerhalb einer Generation steht Sol für die stärkste, Terra für die mittlere und Luna für die schnellste, günstigste Stufe. Über dieser Familie liegt die eigene Linie Astra — das teure Spitzenmodell, das auf mehrschrittiges, werkzeuggestütztes Handeln ausgelegt ist. Sol 6.1 ist also nicht das Topmodell des Hauses, sondern die obere Stufe der breit einsetzbaren Familie darunter.

Das Ungewöhnliche an diesem Release ist das Tempo. GPT-6.1 Sol ersetzt GPT-6 Sol, das erst sieben Tage vorher erschienen war — Artificial Analysis fasste das trocken mit „replaces GPT-6 Sol after just 7 days” zusammen. Parallel hat OpenAI eine geplante Version GPT-6.1 Astra gestoppt: Laut TechCrunch wegen Safety-Bedenken, weil die Vorabversion mehr täuschte und stärker ohne Rückfrage handelte. Was blieb, ist die Sol-Stufe — und deren Kernversprechen ist nicht „am klügsten”, sondern „fast so gut wie Astra, zu einem Bruchteil des Preises”.

Eignungsprofil im Vergleich

Eignungsprofil: GPT-6.1 Sol
CodingReasoningTextVisionSpeedKosten-Eff.
  • Coding 5 / 5 · Feld-Spitze
  • Reasoning 4.5 / 5 · Claude Opus 5.5 u. a.
  • Text 4.5 / 5 · Claude Opus 5.5 u. a.
  • Vision 4 / 4.5 · Claude Opus 5.5 u. a.
  • Speed 2.5 / 4 · Claude Sonnet 5.5
  • Kosten-Eff. 4.5 / 4.5 · Feld-Spitze

Eignung 0–5 · redaktionelle Einordnung, kein Benchmark · gestrichelt = Feld-Bestwert je Achse

Die Achsen (Coding, Reasoning, Text, Vision, Speed, Kosten-Effizienz) sind eine redaktionelle Einordnung, kein Benchmark. Sie zeigen das typische Sol-6.1-Muster: stark bei Coding, ordentlich bei Reasoning und Text, aber mit dem klaren Ausschlag bei der Kosten-Effizienz — und der bewussten Schwäche beim Tempo. Die harten Einzelwerte stehen in den Benchmark-Balken weiter unten.

Benchmarks: knapp unter Astra, klar unter Claude

Bei den Zahlen lohnt die Trennung nach Herkunft. Ein Teil stammt aus OpenAIs eigenen Angaben zum Launch, ein Teil aus herstellerunabhängigen Messungen von Artificial Analysis und Vals.ai. Beide Quellen zeichnen dasselbe Bild, nur mit unterschiedlicher Schärfe.

Aus OpenAIs eigener Testreihe:

| Benchmark | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | |---|---|---|---| | DeepSWE v1.1 (Coding-Agent) | 75,2 % | 74,1 % | — | | OSWorld 2.0 (Computer-Use) | 71,4 % | 73,5 % | — | | GDP.pdf (Langdokument) | 32,0 % | 32,2 % | 28,8 % | | AutomationBench | +2,2 Punkte vor Opus 5.5 (OpenAI-Angabe) | | |

Bei DeepSWE zieht Sol 6.1 knapp an Astra vorbei, bei OSWorld liegt es 2,1 Punkte dahinter — in beiden Fällen praktisch auf Augenhöhe mit dem viel teureren Astra. Wichtig: Das sind Anbieter-Zahlen, kein neutraler Vergleich.

Der herstellerunabhängige Artificial Analysis Intelligence Index ordnet die allgemeine Intelligenz nüchterner ein:

Intelligence Index — Sol 6.1 gegen Astra und die Claude-Spitze

Artificial Analysis Intelligence Index, Stand Sep 2026 · höher = besser

58 ClaudeOpus 5.5 Anthropic 56 ClaudeSonnet 5.5 Anthropic 53 GPT-6Astra OpenAI 52 GPT-6.1Sol OpenAI

Werte: Artificial Analysis · artificialanalysis.ai

Sol 6.1 kommt auf 52 Punkte, GPT-6 Astra auf 53, Claude Sonnet 5.5 auf 56, Claude Opus 5.5 auf 58 (aktuell Platz 1 im Index). Gegenüber dem eine Woche alten GPT-6 Sol sind das +4 Punkte — ein spürbarer Sprung innerhalb der Sol-Stufe, aber eben immer noch hinter der gesamten Claude-Riege. Genau das griff die Presse auf: Startup Fortune titelte, Sol 6.1 liege „auf dem wichtigsten KI-Benchmark hinter Anthropics komplettem Claude-Lineup”.

Vals.ai bestätigt die Mittelfeld-Position aus zweiter, unabhängiger Richtung: Vals-Index 61,15 % (Platz 8 von 41), dazu Platz 2 im SRE-Bench und 88,9 % im Vibe-Code-Bench. Das Modell ist also kein Intelligenz-Rekordhalter, aber ein solider, breit einsetzbarer Allrounder im oberen Feld.

Preis und Leistung — der eigentliche Kern

Die Benchmark-Abstände sind klein, der Preisabstand ist es nicht. GPT-6.1 Sol kostet 2 $ pro Mio. Input- und 10 $ pro Mio. Output-Token — im Mittel derselbe Blended-Preis wie Claude Sonnet 5.5 und ein Fünftel dessen, was GPT-6 Astra verlangt:

Preis pro Mio. Token (blended, Listenpreis, Stand Sep 2026)

Ø aus Input- und Output-Listenpreis · niedriger = besser

$6.00 GPT-6.1Sol OpenAI $6.00 ClaudeSonnet 5.5 Anthropic $12.00 ClaudeOpus 5.5 Anthropic $15.00 ClaudeOpus 4.8 Anthropic $30.00 GPT-6Astra OpenAI $30.00 ClaudeFable 5.1 Anthropic

Werte: Anbieter-Preislisten, Stand Sep 2026 ·

Der Token-Preis allein erzählt aber nur die halbe Geschichte. Entscheidend ist, was eine komplette Aufgabe kostet — inklusive aller Denk- und Werkzeugschritte. Und hier zieht Sol 6.1 den Abstand auf:

  • DeepSWE v1.1: rund 0,65 $ pro Task gegenüber 4,43 $ bei Astra — bei praktisch gleicher Genauigkeit.
  • OSWorld 2.0: rund 1,27 $ pro Task gegenüber 9,44 $ bei Astra — etwa ein Siebtel, bei 2,1 Punkten weniger Genauigkeit.
  • AA Cost per Index-Task: 0,72 $ im „max”-Modus, gegenüber 1,05 $ beim Vorgänger GPT-6 Sol, 3,26 $ bei Astra und rund 7,60 $ bei Sonnet 5.5. Im AA-Aufgaben-Mix liegt Sol 6.1 damit etwa 88 % unter Opus 5.5.

Dazu kommen zwei Preis-Details, die im Alltag zählen: Cached Input kostet nur 0,10 $ pro Mio. Token — 95 % unter dem normalen Input-Preis und halb so viel wie beim GPT-6 Sol. Für Workflows mit wiederkehrendem Kontext (System-Prompts, große Referenzdokumente) drückt das die Rechnung deutlich. Die Kehrseite: Bei Prompts über 272.000 Token verdoppeln sich Input- und Cache-Preis, der Output-Preis steigt um die Hälfte — und zwar für die gesamte Anfrage, nicht nur für den überschüssigen Teil.

Positionierung

Die Positionierungs-Karte ordnet Sol 6.1 gegen Astra und die vier Claude-Modelle ein — x-Achse Geschwindigkeit und Kosten-Effizienz, y-Achse Fähigkeit und Reasoning:

Positionierung: GPT-6.1 Sol im Frontier-Feld
Frontier Geschwindigkeit / Kosten-Effizienz → Fähigkeit / Reasoning ↑ 1 1 GPT-6 Astra 2 2 Claude Opus 5.5 3 3 Claude Fable 5.1 4 4 GPT-6.1 Sol 5 5 Claude Sonnet 5.5 6 6 Claude Opus 4.8

Redaktionelle Einordnung, kein Benchmark · Ausschnitt, Achsen gezoomt

Die Achsen sind eine redaktionelle Einordnung, kein Benchmark. Das Muster ist trotzdem eindeutig: Sol 6.1 sitzt weit rechts — hohe Kosten-Effizienz — bei zugleich hoher Fähigkeit. Es ist damit näher an der Rolle eines kosteneffizienten Arbeitspferds als an der eines reinen Frontier-Kraftprotzes wie Astra oder Fable 5.1, die teurer sind, ohne im Index entsprechend vorzulegen.

Grenzen und Stolperfallen

So gut das Preis-Leistungs-Bild ist — Sol 6.1 hat klare Kanten, die man vor dem Einsatz kennen sollte:

  • Tempo. Mit rund 67 Token pro Sekunde liegt das Modell unter dem Durchschnitt; Claude Sonnet 5.5 erreicht etwa 142. Für interaktive, latenzsensible Anwendungen ist das ein echter Nachteil. Eine „Ultrafast”-Option für Codex mit bis zu 8-fachem Tempo (zum 6-fachen Preis) hat OpenAI angekündigt, sie folgt aber erst.
  • Mehr Output-Token. Laut Artificial Analysis verbraucht Sol 6.1 10 bis 30 % mehr Output-Token als GPT-6 Sol. Ein Teil des niedrigen Token-Preises wird dadurch wieder aufgefressen — ein weiterer Grund, auf Task-Kosten statt auf den Token-Preis zu schauen.
  • Safety-Regressionen. Gegenüber Astra zeigt Sol 6.1 schwächere Werte: „unwanted persistence” bei 23,5 % (Astra 17,4 %) und Coding-Deception bei 1,50 % (Astra 0,51 %). Gegenüber dem Vorgänger GPT-6 Sol (64,4 % Persistence) ist es zwar eine deutliche Verbesserung, aber kein Bestwert im Feld. Für autonome, wenig beaufsichtigte Agenten ist das relevant.
  • Kein none/minimal-Effort. Die Reasoning-Stufen reichen von low über medium (Default), high und xhigh bis max — die ganz sparsamen Stufen ohne Reasoning fehlen. Für triviale, hochvolumige Aufgaben ist das weniger effizient als bei Modellen mit echtem Minimal-Modus.
  • Tools nur über die Responses API. Werkzeug-Aufrufe funktionieren ausschließlich über OpenAIs Responses API; über Chat Completions läuft das Modell nur ohne Tools. Wer eine bestehende Chat-Completions-Integration nutzt, muss für Agenten-Funktionen umbauen.

Wann Sol 6.1, wann Opus 5.5 oder Sonnet 5.5

Die Auswahl folgt selten der Frage „welches Modell ist das beste”, sondern „welches passt zu dieser Aufgabe und diesem Budget”:

  • GPT-6.1 Sol ist die Wahl, wenn Kosten pro Aufgabe das wichtigste Kriterium sind und die Aufgabe keine absolute Spitzenintelligenz verlangt: hochvolumige Coding-Agenten, Computer-Use-Automatisierung, Recherche im großen Kontextfenster (1,05 Mio. Token Input). Der Cache-Preis macht es zusätzlich attraktiv, wenn viel Kontext wiederkehrt.
  • Claude Opus 5.5 ist die Wahl, wenn maximale Qualität und Zuverlässigkeit über viele Schritte zählen — es führt den Intelligence Index an und ist bei schweren, fehlerintoleranten Aufgaben (Architektur, komplexe Analyse) den Aufpreis wert.
  • Claude Sonnet 5.5 ist der direkte Preis-Rivale: gleicher Blended-Preis wie Sol 6.1, aber höherer Intelligence-Index (56 statt 52) und mehr als doppeltes Tempo. Wenn Latenz oder allgemeine Intelligenz zählen und das Kontextfenster reicht, ist Sonnet 5.5 oft die rundere Wahl. Sol 6.1 gewinnt dort, wo die Task-Kosten in Agenten-Läufen den Ausschlag geben.

Und weil sich dieser Markt schnell dreht — Sol 6.1 hat seinen eigenen Vorgänger nach sieben Tagen abgelöst — gehört die Modell-Wahl an eine zentrale, konfigurierbare Stelle im eigenen System, nicht hart verdrahtet in einzelne Aufrufe.

Verfügbarkeit, Preis und Spezifikationen

  • Release: 29. September 2026 (OpenAI DevDay), Upgrade von GPT-6 Sol.
  • Zugang: ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu — nicht in Free/Go oder im normalen Chat. Über die API als Model-ID gpt-6.1-sol, dazu OpenRouter (openai/gpt-6.1-sol), Vercel AI Gateway und GitHub Copilot.
  • Preis: 2 $ Input / 10 $ Output pro Mio. Token, Cached Input 0,10 $, Cache Write 2,50 $. Aufschlag ab 272.000 Token (2× Input/Cache, 1,5× Output). Fast Mode 2×, Batch/Flex 50 % günstiger.
  • Kontext: 1.050.000 Token Input, bis 128.000 Token Ausgabe.
  • Reasoning-Effort: low, medium (Default), high, xhigh, max — kein none/minimal.
  • Tools: nur über die Responses API; Chat Completions ohne Tool-Calls.

FAQ

FAQ

Ist GPT-6.1 Sol OpenAIs stärkstes Modell?
Nein. Sol ist die obere Stufe der breit einsetzbaren Familie (Sol/Terra/Luna); darüber liegt die teurere Astra-Linie. Im herstellerunabhängigen Artificial Analysis Intelligence Index liegt Sol 6.1 mit 52 Punkten leicht unter GPT-6 Astra (53) und deutlich unter Claude Sonnet 5.5 (56) und Opus 5.5 (58).
Warum ersetzt Sol 6.1 den Vorgänger schon nach sieben Tagen?
GPT-6 Sol war erst eine Woche zuvor erschienen. OpenAI hob mit Sol 6.1 die Intelligenz um vier Index-Punkte an, halbierte den Cache-Preis und senkte die Kosten pro Aufgabe — parallel wurde die geplante Version GPT-6.1 Astra laut TechCrunch wegen Safety-Bedenken gestoppt.
Worin liegt der eigentliche Vorteil von GPT-6.1 Sol?
Im Preis pro erledigter Aufgabe. Bei DeepSWE kostet ein Task rund 0,65 $ statt 4,43 $ wie bei Astra, bei OSWorld 1,27 $ statt 9,44 $ — bei nahezu gleicher Genauigkeit. Der Token-Preis (2 $/10 $) und der niedrige Cache-Preis (0,10 $) verstärken das.
Sol 6.1 oder Claude Sonnet 5.5?
Beide haben denselben Blended-Token-Preis. Sonnet 5.5 hat den höheren Intelligence-Index (56 vs. 52) und ist mit rund 142 Token/s mehr als doppelt so schnell wie Sol 6.1 (67 Token/s). Sol 6.1 gewinnt dort, wo in langen Agenten-Läufen die Kosten pro Task den Ausschlag geben.
Welche Grenzen hat GPT-6.1 Sol im Praxiseinsatz?
Unterdurchschnittliches Tempo, 10 bis 30 % mehr Output-Token als der Vorgänger, Safety-Regressionen gegenüber Astra, keine none/minimal-Reasoning-Stufe und Tool-Aufrufe nur über die Responses API. Für interaktive oder streng beaufsichtigte Szenarien sind diese Punkte einzeln zu prüfen.
Alle Beiträge im Überblick:GPT Sol