Generative Modelle für Bild- und Videoerstellung aus Text- oder Bild-Prompts — von Text-to-Image über Inpainting bis Text-to-Video. Anbieterübergreifende Kategorie, z. B. FLUX.1, Stable Diffusion, Sora und Veo.
FLUX.2 ist die Text-zu-Bild-Modellfamilie von Black Forest Labs. Sie umfasst die proprietaeren Varianten Pro und Flex sowie das offene 32-Mrd.-Parameter-Modell Dev und die kompakte Klein-Reihe, die Bilderzeugung und Bildbearbeitung in einem Modell vereinen.
Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 erschien 2025 in den Stufen Fast, Generate und Ultra, ist ueber Gemini API und Vertex AI verfuegbar und bekannt fuer starke Typografie und Prompt-Treue.
GPT Image 2 ist OpenAIs natives Bildmodell (April 2026), das vor dem Zeichnen schließt, sehr zuverlässig Text rendert und in hoher Auflösung fotorealistische Bilder erzeugt.
Kling 3.0 ist das Video-Modell von Kuaishou, veröffentlicht am 5. Februar 2026. Es erzeugt bis zu 15 Sekunden lange, fotorealistische Clips mit nativem Ton in mehreren Sprachen und gilt als preis-leistungsstärkster Video-Generator.
Midjourney v8 ist die achte Generation des Bildgenerators von Midjourney (Alpha März 2026) mit rund fünffach schnellerer Erzeugung, nativer 2K-Auflösung und verbesserter Textwiedergabe.
Runway Gen-4.5 ist das Video-Modell von Runway, das aus Text oder Bild 5- und 10-Sekunden-Clips mit starker Prompt-Treue und cineastischer Bewegung erzeugt. Es entstand mit NVIDIA und nutzt eine Autoregressive-to-Diffusion-Technik.
Seedream 4.0 ist ByteDances multimodales Bildmodell (September 2025), das Text und mehrere Bilder als Eingabe verarbeitet, bis zu 4K rendert und über zehnmal schneller ist als Seedream 3.0.
Veo 3.1 ist Googles Video-Modell (DeepMind), das aus Text oder Bild 8-Sekunden-Clips mit nativ synchronisiertem Ton erzeugt. Seit dem Update im Januar 2026 liefert es echtes 4K (3840x2160) sowie vertikale Formate.
Redaktion·
Wir verwenden Cookies, um die Nutzung der Website zu verbessern. Datenschutz