AssemblyAI Universal-2
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
Sprach-KI in beide Richtungen — Spracherkennung/Transkription (STT) und Sprachsynthese (TTS), anbieterübergreifender Einsatzzweck, z. B. Whisper, Kokoro, ElevenLabs.
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
Chatterbox ist ein quelloffenes Text-to-Speech-Modell von Resemble AI unter MIT-Lizenz. In Blindtests bevorzugten Hoerer es mehrheitlich gegenueber ElevenLabs; es bietet Emotionssteuerung, Voice-Cloning und niedrige Latenz.
Nova-3 ist Deepgrams Echtzeit-Speech-to-Text-Modell (Release Februar 2025) mit sehr niedriger Streaming-Latenz von rund 200 bis 300 Millisekunden, Keyterm-Prompting und Unterstuetzung fuer ueber 30 Sprachen.
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
Canary ist NVIDIAs offene ASR- und Speech-Translation-Modellfamilie (CC-BY-4.0), die auf dem Open-ASR-Leaderboard bei englischer Genauigkeit vor OpenAI Whisper liegt und 25 europaeische Sprachen abdeckt.
Whisper ist OpenAIs offenes Speech-to-Text-Modell von 2022 — ein mehrsprachiger Encoder-Decoder-Transformer, der Audio in Text umwandelt und in mehreren Größen unter MIT-Lizenz verfügbar ist.