Zurück zum Glossar

Begriff

Veo 3.1

Veo 3.1 ist Googles Video-Modell (DeepMind), das aus Text oder Bild 8-Sekunden-Clips mit nativ synchronisiertem Ton erzeugt. Seit dem Update im Januar 2026 liefert es echtes 4K (3840x2160) sowie vertikale Formate.

Veo 3.1 — ausführlicher erklärt

Veo 3.1 ist das Video-Generierungsmodell von Google DeepMind und wurde am 14. Oktober 2025 veröffentlicht. Es erzeugt aus Text-Prompts (Text-to-Video) oder aus einem Startbild (Image-to-Video) rund 8 Sekunden lange Clips und ist dabei über die Gemini-API sowie Googles kreative Werkzeuge verfügbar. Das herausragende Merkmal ist die native Audiogenerierung: Das Modell erzeugt Dialog, Soundeffekte und Umgebungsgeräusche direkt synchron zum Bild, statt Ton nachträglich hinzufügen zu müssen.

Mit dem Update vom 13. Januar 2026 kam echtes 4K (3840x2160 Pixel) hinzu, ebenso native vertikale Videos für Formate wie TikTok und verbesserte Konsistenz-Funktionen. Ausgabeauflösungen reichen von 720p über 1080p bis 4K. Veo 3.1 ist ein proprietäres (closed) Modell ohne offene Gewichte und gilt Stand September 2026 als führender Allrounder für KI-Video, weil es Bildqualität, Bewegungstreue und synchronen Ton in einem Modell vereint.

Beispiel / Praxisbezug

Ein Marketing-Team erstellt aus einem einzigen Produktfoto und einem beschreibenden Prompt einen vertikalen Werbeclip inklusive gesprochenem Slogan und passender Hintergrundmusik. Weil Veo 3.1 den Ton nativ mitgeneriert und in 4K ausgibt, entfällt separate Vertonung und Nachschärfung für Social-Media-Kanäle.

Abgrenzung zu ähnlichen Begriffen

Veo 3.1 konkurriert direkt mit Kling 3.0 und Runway Gen-4.5. Der klarste Unterschied ist die native, lippen- und szenensynchrone Tonspur, die Wettbewerber so nicht durchgängig bieten. Als Einsatzzweck fällt Veo unter Bild- und Videomodelle; anders als reine Bildgeneratoren erzeugt es bewegte Sequenzen inklusive Kamerabewegung und Physik.

Alle Beiträge im Überblick:Bild & Video