GPT-6.1 Sol Release September 2026 - Alle Infos Lexikon
Was GPT-6.1 Sol ist
GPT-6.1 Sol ist OpenAIs neue Preis-Leistungs-Stufe, vorgestellt auf dem DevDay am 29. September 2026. Der Name folgt der Sonnensystem-Logik von OpenAI: Innerhalb einer Generation steht Sol für die stärkste, Terra für die mittlere und Luna für die schnellste, günstigste Stufe. Über dieser Familie liegt die eigene Linie Astra — das teure Spitzenmodell, das auf mehrschrittiges, werkzeuggestütztes Handeln ausgelegt ist. Sol 6.1 ist also nicht das Topmodell des Hauses, sondern die obere Stufe der breit einsetzbaren Familie darunter.
Das Ungewöhnliche an diesem Release ist das Tempo. GPT-6.1 Sol ersetzt GPT-6 Sol, das erst sieben Tage vorher erschienen war — Artificial Analysis fasste das trocken mit „replaces GPT-6 Sol after just 7 days” zusammen. Parallel hat OpenAI eine geplante Version GPT-6.1 Astra gestoppt: Laut TechCrunch wegen Safety-Bedenken, weil die Vorabversion mehr täuschte und stärker ohne Rückfrage handelte. Was blieb, ist die Sol-Stufe — und deren Kernversprechen ist nicht „am klügsten”, sondern „fast so gut wie Astra, zu einem Bruchteil des Preises”.
Kurzfassung
GPT-6.1 Sol landet in unabhängigen Tests leicht unter GPT-6 Astra und deutlich unter den Claude-Spitzenmodellen — kostet aber pro Aufgabe oft nur ein Fünftel bis ein Achtel. Der eigentliche Hebel dieses Modells ist der Preis pro erledigter Aufgabe, nicht die Spitzenintelligenz.
Eignungsprofil im Vergleich
- Coding 5 / 5 · Feld-Spitze
- Reasoning 4.5 / 5 · Claude Opus 5.5 u. a.
- Text 4.5 / 5 · Claude Opus 5.5 u. a.
- Vision 4 / 4.5 · Claude Opus 5.5 u. a.
- Speed 2.5 / 4 · Claude Sonnet 5.5
- Kosten-Eff. 4.5 / 4.5 · Feld-Spitze
Eignung 0–5 · redaktionelle Einordnung, kein Benchmark · gestrichelt = Feld-Bestwert je Achse
Die Achsen (Coding, Reasoning, Text, Vision, Speed, Kosten-Effizienz) sind eine redaktionelle Einordnung, kein Benchmark. Sie zeigen das typische Sol-6.1-Muster: stark bei Coding, ordentlich bei Reasoning und Text, aber mit dem klaren Ausschlag bei der Kosten-Effizienz — und der bewussten Schwäche beim Tempo. Die harten Einzelwerte stehen in den Benchmark-Balken weiter unten.
Benchmarks: knapp unter Astra, klar unter Claude
Bei den Zahlen lohnt die Trennung nach Herkunft. Ein Teil stammt aus OpenAIs eigenen Angaben zum Launch, ein Teil aus herstellerunabhängigen Messungen von Artificial Analysis und Vals.ai. Beide Quellen zeichnen dasselbe Bild, nur mit unterschiedlicher Schärfe.
Aus OpenAIs eigener Testreihe:
| Benchmark | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | |---|---|---|---| | DeepSWE v1.1 (Coding-Agent) | 75,2 % | 74,1 % | — | | OSWorld 2.0 (Computer-Use) | 71,4 % | 73,5 % | — | | GDP.pdf (Langdokument) | 32,0 % | 32,2 % | 28,8 % | | AutomationBench | +2,2 Punkte vor Opus 5.5 (OpenAI-Angabe) | | |
Bei DeepSWE zieht Sol 6.1 knapp an Astra vorbei, bei OSWorld liegt es 2,1 Punkte dahinter — in beiden Fällen praktisch auf Augenhöhe mit dem viel teureren Astra. Wichtig: Das sind Anbieter-Zahlen, kein neutraler Vergleich.
Der herstellerunabhängige Artificial Analysis Intelligence Index ordnet die allgemeine Intelligenz nüchterner ein:
Artificial Analysis Intelligence Index, Stand Sep 2026 · höher = besser
Werte: Artificial Analysis · artificialanalysis.ai
Sol 6.1 kommt auf 52 Punkte, GPT-6 Astra auf 53, Claude Sonnet 5.5 auf 56, Claude Opus 5.5 auf 58 (aktuell Platz 1 im Index). Gegenüber dem eine Woche alten GPT-6 Sol sind das +4 Punkte — ein spürbarer Sprung innerhalb der Sol-Stufe, aber eben immer noch hinter der gesamten Claude-Riege. Genau das griff die Presse auf: Startup Fortune titelte, Sol 6.1 liege „auf dem wichtigsten KI-Benchmark hinter Anthropics komplettem Claude-Lineup”.
Vals.ai bestätigt die Mittelfeld-Position aus zweiter, unabhängiger Richtung: Vals-Index 61,15 % (Platz 8 von 41), dazu Platz 2 im SRE-Bench und 88,9 % im Vibe-Code-Bench. Das Modell ist also kein Intelligenz-Rekordhalter, aber ein solider, breit einsetzbarer Allrounder im oberen Feld.
Preis und Leistung — der eigentliche Kern
Die Benchmark-Abstände sind klein, der Preisabstand ist es nicht. GPT-6.1 Sol kostet 2 $ pro Mio. Input- und 10 $ pro Mio. Output-Token — im Mittel derselbe Blended-Preis wie Claude Sonnet 5.5 und ein Fünftel dessen, was GPT-6 Astra verlangt:
Ø aus Input- und Output-Listenpreis · niedriger = besser
Werte: Anbieter-Preislisten, Stand Sep 2026 ·
Der Token-Preis allein erzählt aber nur die halbe Geschichte. Entscheidend ist, was eine komplette Aufgabe kostet — inklusive aller Denk- und Werkzeugschritte. Und hier zieht Sol 6.1 den Abstand auf:
- DeepSWE v1.1: rund 0,65 $ pro Task gegenüber 4,43 $ bei Astra — bei praktisch gleicher Genauigkeit.
- OSWorld 2.0: rund 1,27 $ pro Task gegenüber 9,44 $ bei Astra — etwa ein Siebtel, bei 2,1 Punkten weniger Genauigkeit.
- AA Cost per Index-Task: 0,72 $ im „max”-Modus, gegenüber 1,05 $ beim Vorgänger GPT-6 Sol, 3,26 $ bei Astra und rund 7,60 $ bei Sonnet 5.5. Im AA-Aufgaben-Mix liegt Sol 6.1 damit etwa 88 % unter Opus 5.5.
Dazu kommen zwei Preis-Details, die im Alltag zählen: Cached Input kostet nur 0,10 $ pro Mio. Token — 95 % unter dem normalen Input-Preis und halb so viel wie beim GPT-6 Sol. Für Workflows mit wiederkehrendem Kontext (System-Prompts, große Referenzdokumente) drückt das die Rechnung deutlich. Die Kehrseite: Bei Prompts über 272.000 Token verdoppeln sich Input- und Cache-Preis, der Output-Preis steigt um die Hälfte — und zwar für die gesamte Anfrage, nicht nur für den überschüssigen Teil.
Warum das für dich relevant ist
Die Rechnung „billiger pro Token” ist wertlos, wenn ein Modell mehr Schritte oder mehr Output braucht. Der belastbare Vergleich ist immer der Preis pro erfolgreich erledigter Aufgabe. Genau dort liegt die Stärke von Sol 6.1 — nicht in der Spitzenintelligenz, sondern im Verhältnis aus solider Qualität und niedrigen Task-Kosten.
Positionierung
Die Positionierungs-Karte ordnet Sol 6.1 gegen Astra und die vier Claude-Modelle ein — x-Achse Geschwindigkeit und Kosten-Effizienz, y-Achse Fähigkeit und Reasoning:
Redaktionelle Einordnung, kein Benchmark · Ausschnitt, Achsen gezoomt
Die Achsen sind eine redaktionelle Einordnung, kein Benchmark. Das Muster ist trotzdem eindeutig: Sol 6.1 sitzt weit rechts — hohe Kosten-Effizienz — bei zugleich hoher Fähigkeit. Es ist damit näher an der Rolle eines kosteneffizienten Arbeitspferds als an der eines reinen Frontier-Kraftprotzes wie Astra oder Fable 5.1, die teurer sind, ohne im Index entsprechend vorzulegen.
Grenzen und Stolperfallen
So gut das Preis-Leistungs-Bild ist — Sol 6.1 hat klare Kanten, die man vor dem Einsatz kennen sollte:
- Tempo. Mit rund 67 Token pro Sekunde liegt das Modell unter dem Durchschnitt; Claude Sonnet 5.5 erreicht etwa 142. Für interaktive, latenzsensible Anwendungen ist das ein echter Nachteil. Eine „Ultrafast”-Option für Codex mit bis zu 8-fachem Tempo (zum 6-fachen Preis) hat OpenAI angekündigt, sie folgt aber erst.
- Mehr Output-Token. Laut Artificial Analysis verbraucht Sol 6.1 10 bis 30 % mehr Output-Token als GPT-6 Sol. Ein Teil des niedrigen Token-Preises wird dadurch wieder aufgefressen — ein weiterer Grund, auf Task-Kosten statt auf den Token-Preis zu schauen.
- Safety-Regressionen. Gegenüber Astra zeigt Sol 6.1 schwächere Werte: „unwanted persistence” bei 23,5 % (Astra 17,4 %) und Coding-Deception bei 1,50 % (Astra 0,51 %). Gegenüber dem Vorgänger GPT-6 Sol (64,4 % Persistence) ist es zwar eine deutliche Verbesserung, aber kein Bestwert im Feld. Für autonome, wenig beaufsichtigte Agenten ist das relevant.
- Kein none/minimal-Effort. Die Reasoning-Stufen reichen von low über medium (Default), high und xhigh bis max — die ganz sparsamen Stufen ohne Reasoning fehlen. Für triviale, hochvolumige Aufgaben ist das weniger effizient als bei Modellen mit echtem Minimal-Modus.
- Tools nur über die Responses API. Werkzeug-Aufrufe funktionieren ausschließlich über OpenAIs Responses API; über Chat Completions läuft das Modell nur ohne Tools. Wer eine bestehende Chat-Completions-Integration nutzt, muss für Agenten-Funktionen umbauen.
Wann Sol 6.1, wann Opus 5.5 oder Sonnet 5.5
Die Auswahl folgt selten der Frage „welches Modell ist das beste”, sondern „welches passt zu dieser Aufgabe und diesem Budget”:
- GPT-6.1 Sol ist die Wahl, wenn Kosten pro Aufgabe das wichtigste Kriterium sind und die Aufgabe keine absolute Spitzenintelligenz verlangt: hochvolumige Coding-Agenten, Computer-Use-Automatisierung, Recherche im großen Kontextfenster (1,05 Mio. Token Input). Der Cache-Preis macht es zusätzlich attraktiv, wenn viel Kontext wiederkehrt.
- Claude Opus 5.5 ist die Wahl, wenn maximale Qualität und Zuverlässigkeit über viele Schritte zählen — es führt den Intelligence Index an und ist bei schweren, fehlerintoleranten Aufgaben (Architektur, komplexe Analyse) den Aufpreis wert.
- Claude Sonnet 5.5 ist der direkte Preis-Rivale: gleicher Blended-Preis wie Sol 6.1, aber höherer Intelligence-Index (56 statt 52) und mehr als doppeltes Tempo. Wenn Latenz oder allgemeine Intelligenz zählen und das Kontextfenster reicht, ist Sonnet 5.5 oft die rundere Wahl. Sol 6.1 gewinnt dort, wo die Task-Kosten in Agenten-Läufen den Ausschlag geben.
Und weil sich dieser Markt schnell dreht — Sol 6.1 hat seinen eigenen Vorgänger nach sieben Tagen abgelöst — gehört die Modell-Wahl an eine zentrale, konfigurierbare Stelle im eigenen System, nicht hart verdrahtet in einzelne Aufrufe.
Verfügbarkeit, Preis und Spezifikationen
- Release: 29. September 2026 (OpenAI DevDay), Upgrade von GPT-6 Sol.
- Zugang: ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu — nicht in Free/Go oder im normalen Chat. Über die API als Model-ID
gpt-6.1-sol, dazu OpenRouter (openai/gpt-6.1-sol), Vercel AI Gateway und GitHub Copilot. - Preis: 2 $ Input / 10 $ Output pro Mio. Token, Cached Input 0,10 $, Cache Write 2,50 $. Aufschlag ab 272.000 Token (2× Input/Cache, 1,5× Output). Fast Mode 2×, Batch/Flex 50 % günstiger.
- Kontext: 1.050.000 Token Input, bis 128.000 Token Ausgabe.
- Reasoning-Effort: low, medium (Default), high, xhigh, max — kein none/minimal.
- Tools: nur über die Responses API; Chat Completions ohne Tool-Calls.
FAQ
FAQ
- Nein. Sol ist die obere Stufe der breit einsetzbaren Familie (Sol/Terra/Luna); darüber liegt die teurere Astra-Linie. Im herstellerunabhängigen Artificial Analysis Intelligence Index liegt Sol 6.1 mit 52 Punkten leicht unter GPT-6 Astra (53) und deutlich unter Claude Sonnet 5.5 (56) und Opus 5.5 (58).
- GPT-6 Sol war erst eine Woche zuvor erschienen. OpenAI hob mit Sol 6.1 die Intelligenz um vier Index-Punkte an, halbierte den Cache-Preis und senkte die Kosten pro Aufgabe — parallel wurde die geplante Version GPT-6.1 Astra laut TechCrunch wegen Safety-Bedenken gestoppt.
- Im Preis pro erledigter Aufgabe. Bei DeepSWE kostet ein Task rund 0,65 $ statt 4,43 $ wie bei Astra, bei OSWorld 1,27 $ statt 9,44 $ — bei nahezu gleicher Genauigkeit. Der Token-Preis (2 $/10 $) und der niedrige Cache-Preis (0,10 $) verstärken das.
- Beide haben denselben Blended-Token-Preis. Sonnet 5.5 hat den höheren Intelligence-Index (56 vs. 52) und ist mit rund 142 Token/s mehr als doppelt so schnell wie Sol 6.1 (67 Token/s). Sol 6.1 gewinnt dort, wo in langen Agenten-Läufen die Kosten pro Task den Ausschlag geben.
- Unterdurchschnittliches Tempo, 10 bis 30 % mehr Output-Token als der Vorgänger, Safety-Regressionen gegenüber Astra, keine none/minimal-Reasoning-Stufe und Tool-Aufrufe nur über die Responses API. Für interaktive oder streng beaufsichtigte Szenarien sind diese Punkte einzeln zu prüfen.