Begriff
ElevenLabs v3
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
ElevenLabs v3 — ausfuehrlicher erklaert
ElevenLabs v3 ist die dritte Generation des Text-to-Speech-Modells des Anbieters ElevenLabs, angekuendigt am 3. Juni 2025 zunaechst als Alpha und inzwischen allgemein verfuegbar. Das Modell zielt auf konversationellen Realismus: Es bildet Rhythmus und emotionale Tiefe menschlicher Sprache nach, wechselt den Tonfall mitten im Satz und bewegt sich fliessend zwischen mehreren Sprechern.
Kern der Neuerung sind Audio-Tags, die direkt in den Text geschrieben werden, etwa [whispers], [excited], [laughs] oder [sighs], sowie Klang-Hinweise. Damit lassen sich Betonung, Tempo und nonverbale Reaktionen gezielt steuern. Ein Dialog-Modus verarbeitet natuerliche Unterbrechungen und Tonwechsel ueber mehrere Stimmen hinweg. Das Modell unterstuetzt ueber 70 Sprachen und ist als proprietaeres, geschlossenes Produkt ueber Website und API verfuegbar; offene Gewichte gibt es nicht.
Beispiel / Praxisbezug
Fuer die Vertonung eines Hoerspiels oder eines Werbespots mit mehreren Rollen laesst sich ein Skript mit Audio-Tags anreichern, sodass eine Figur fluestert, eine andere lacht und der Tonfall je Szene passt, ohne dass mehrere Sprachaufnahmen kombiniert werden muessen.
Abgrenzung zu aehnlichen Begriffen
Anders als offene Modelle wie Chatterbox oder Fish Audio S2 ist ElevenLabs v3 nicht selbst hostbar und bindet Nutzung an die Plattform des Anbieters. Als Speech-und-Voice-Modell erzeugt es Sprache aus Text (TTS) und grenzt sich damit von Spracherkennung (Speech-to-Text) ab; sein Alleinstellungsmerkmal ist der Fokus auf expressive, emotional gesteuerte Ausgabe.