Zurück zum Glossar

Begriff

Google Imagen

Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 erschien 2025 in den Stufen Fast, Generate und Ultra, ist ueber Gemini API und Vertex AI verfuegbar und bekannt fuer starke Typografie und Prompt-Treue.

Google Imagen — ausführlicher erklärt

Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 wurde 2025 auf der Google I/O vorgestellt und erzeugt aus einem Text-Prompt fotorealistische Bilder mit hoher Detailschaerfe. Als besondere Staerken gelten die praezise Textwiedergabe (Typografie) im Bild, hohe Prompt-Treue ueber viele Stile hinweg sowie mehrsprachige Prompt-Unterstuetzung und Ausgabe bis zu 2K-Aufloesung.

Imagen 4 kommt in drei Stufen: Fast (geschwindigkeitsoptimiert), Generate (Standard) und Ultra (maximale Prompt-Ausrichtung). Es handelt sich um ein geschlossenes, gehostetes Modell ohne offene Gewichte; der Zugriff laeuft ueber die Gemini API, Google AI Studio und Vertex AI und wird pro erzeugtem Bild abgerechnet. Google verlagert generative Bildaufgaben zunehmend auf seine Gemini-nativen Modelle (die Nano-Banana-Reihe).

Beispiel / Praxisbezug

Ein Marketing-Team nutzt Imagen 4 ueber Vertex AI, um Kampagnenmotive mit lesbarem eingebettetem Text — etwa Slogans oder Preisschilder — zu erzeugen, ein Bereich, in dem Bildmodelle traditionell schwaecheln. Fuer schnelle Iterationen kommt die Fast-Stufe, fuer finale Assets die Ultra-Stufe zum Einsatz.

Abgrenzung zu ähnlichen Begriffen

Imagen ist ein Bildmodell und faellt unter den Einsatzzweck Bild & Video; fuer Video setzt Google auf Veo. Anders als offene Familien wie FLUX oder Stable Diffusion ist Imagen ein geschlossenes API-Modell und laesst sich nicht self-hosten.

Alle Beiträge im Überblick:Bild & Video