Begriff
Gemini 3.5 Flash
Gemini 3.5 Flash ist Googles hocheffizientes Multimodal-Modell vom Mai 2026 — bringt Pro-nahe Coding- und Reasoning-Qualität zu Flash-typischen Kosten und Geschwindigkeit.
Gemini 3.5 Flash — ausführlicher erklärt
Gemini 3.5 Flash ist Googles hocheffizientes Multimodal-Modell und erschien am 19. Mai 2026. Die Flash-Linie steht bei Google für die Balance aus Geschwindigkeit, Kosten und Qualität; mit Version 3.5 rückt sie deutlich näher an die Pro-Klasse heran und liefert laut Google Pro-nahe Coding- und Reasoning-Leistung bei Flash-typischer Latenz. Das Modell verarbeitet Text, Bilder, Video, Audio und PDF als Eingabe und erzeugt Text-Output; Tool-Calling und strukturierte JSON-Ausgaben werden unterstützt.
Eckdaten
- Release: 19. Mai 2026, Zugang proprietär über die Gemini-API, Google AI Studio und Vertex AI.
- Preis: 1,50 USD pro Mio. Input-Tokens, 9 USD pro Mio. Output-Tokens; Cache-Read 0,15 USD, Audio-Input 3 USD pro Mio.
- Kontextfenster: 1.048.576 Tokens (1 Mio.), maximal 65.536 Output-Tokens.
- Knowledge-Cutoff: 1. Januar 2025.
- Benchmarks: GPQA Diamond 92,4 Prozent, TAU-Bench 75,3 Prozent.
Beispiel / Praxisbezug
Flash 3.5 ist auf hohen Durchsatz und parallele Agenten-Ausführung optimiert — mit rund 189 Tokens pro Sekunde und einer P50-Latenz von etwa 0,79 Sekunden eignet es sich für Chat, Extraktion, Zusammenfassung und Coding-Assistenz im großen Volumen. Die Multimodalität macht es zusätzlich für Bild-, Video- und Dokument-Verarbeitung nutzbar, ohne für jede Modalität ein separates Modell einzusetzen.
Abgrenzung
Innerhalb der Gemini-3.5-Reihe liegt Flash zwischen der günstigeren, schmaleren Flash-Lite-Variante und der leistungsstärkeren Pro-Klasse. Wo maximale Reasoning-Tiefe zählt, bleibt Gemini Pro die Wahl; für latenz- und kostenkritische Massenaufgaben ist Flash der Standard. Direkte Wettbewerber in derselben Effizienzklasse sind Claude Haiku und die günstigeren GPT-Stufen.