Begriff
Gemini 3.6 Flash
Gemini 3.6 Flash (Juli 2026) ist Googles schnelle, kostenguenstige Flash-Stufe mit 1-Mio.-Tokens-Kontext — auf hohen Durchsatz und niedrige Kosten pro Anfrage ausgelegt.
Gemini 3.6 Flash — ausfuehrlicher erklaert
Gemini 3.6 Flash wurde am 21. Juli 2026 von Google als produktionsreifes Modell veroeffentlicht. Innerhalb der Gemini-Reihe ist Flash die schnelle, kostenguenstige Stufe: nicht das staerkste Modell (das ist Gemini Pro), sondern das, das auf hohen Durchsatz, niedrige Latenz und geringe Kosten pro Anfrage ausgelegt ist. Genutzt wird Flash typischerweise dort, wo grosse Mengen an Anfragen schnell und guenstig beantwortet werden muessen.
Wie die uebrige Gemini-Reihe ist das Modell nativ multimodal (Text, Bilder, Audio, Video) und behaelt das charakteristische Kontextfenster von rund 1 Million Tokens (genau 1.048.576) bei bis zu 65.536 Ausgabe-Tokens pro Antwort. Trotz der Positionierung als guenstige Stufe legte 3.6 Flash gegenueber dem Vorgaenger 3.5 Flash deutlich zu: SWE-Bench Pro 58,7 Prozent (statt 55,1), DeepSWE 49 Prozent (statt 37), MLE-Bench 63,9 Prozent (statt 49,7) und beim Langkontext-Test GDM-MRCR v2 ueber 1 Mio. Tokens 54,0 Prozent (statt 26,6). Beim Durchsatz erreichte das Modell rund 303 Tokens pro Sekunde — ein Vielfaches des Medians vergleichbarer Modelle. Preislich liegt es bei ungefaehr 0,75 US-Dollar pro Million Eingabe- und 3,75 US-Dollar pro Million Ausgabe-Tokens.
Der Zugang ist proprietaer: Gemini 3.6 Flash laeuft ueber die Gemini-API, Google AI Studio und Vertex AI. Die Gewichte sind nicht oeffentlich.
Beispiel / Praxisbezug
In der Praxis ist Flash die Standard-Wahl fuer Aufgaben mit hohem Volumen und knappem Budget: Klassifikation, Zusammenfassung, Extraktion, Chat-Antworten oder als schneller Vorschritt in einer Pipeline, die schwere Faelle an ein staerkeres Modell weiterreicht. Ein typischer Aufbau: Ein Dienst verarbeitet zehntausende eingehende Dokumente pro Tag, laesst Flash sie kategorisieren und zusammenfassen und eskaliert nur die unsicheren Faelle an ein Pro-Modell. Der hohe Durchsatz und die niedrigen Token-Kosten machen genau dieses Muster wirtschaftlich.
Abgrenzung
Innerhalb der Gemini-Reihe steht Flash zwischen den noch kleineren Flash-Lite-Varianten (guenstiger, schwaecher) und dem Pro-Flaggschiff (staerker, teurer, langsamer). Die Ziffer 3.6 markiert eine Zwischenstufe innerhalb der dritten Gemini-Generation; nachfolgende Versionen (etwa Gemini 3.7 Flash) loesen sie ab. Von den API-only-Gemini-Modellen unterscheiden sich Open-Weight-Modelle (etwa Llama, Qwen oder DeepSeek) grundsaetzlich: Deren Gewichte sind herunterladbar und lokal ausfuehrbar, waehrend Gemini ausschliesslich als gehosteter Dienst verfuegbar ist. Nicht zu verwechseln ist Gemini (das Modell) mit der frueheren Bezeichnung Bard beziehungsweise der Consumer-App gleichen Namens.