Zurück zum Glossar

Begriff

AssemblyAI Universal-2

Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.

AssemblyAI Universal-2 — ausführlicher erklärt

Universal-2 ist das kommerzielle Speech-to-Text-Modell (ASR) des US-Anbieters AssemblyAI und der Nachfolger von Universal-1. Es ist ein geschlossenes Modell, das ausschliesslich ueber die Cloud-API von AssemblyAI genutzt wird; die Gewichte sind nicht oeffentlich. Das Modell deckt rund 99 Sprachen ab und erreicht laut Anbieter eine mittlere Wortfehlerrate (WER) von etwa 6 Prozent ueber viele Datensaetze hinweg. Gegenueber Universal-1 senkt es die WER relativ um rund 3 Prozent und uebertrifft das naechstbeste externe Modell um etwa 15 Prozent relativ.

Der Fokus von Universal-2 liegt nicht nur auf der reinen Worterkennung, sondern auf produktionsreifer Ausgabe: Die Architektur enthaelt eine rein neuronale Text-Formatierungskomponente (Universal-2-TF). Dadurch verbessert das Modell laut AssemblyAI die Erkennung von Eigennamen um rund 24 Prozent, Formatierung und Gross-/Kleinschreibung um rund 15 Prozent und die Genauigkeit der Zeitstempel deutlich. Diese Kombination positioniert Universal-2 als Genauigkeits-Leader unter den kommerziellen Transkriptionsdiensten.

Beispiel / Praxisbezug

Ein typischer Einsatz ist die automatische Transkription von Podcasts, Meetings oder Support-Anrufen: Audio wird an die API gesendet, und Universal-2 liefert einen bereits formatierten Text mit korrekter Zeichensetzung, Gross-/Kleinschreibung und praezisen Zeitstempeln zurueck. Gerade bei Fachbegriffen, Produkt- und Personennamen reduziert die verbesserte Eigennamen-Erkennung den manuellen Nachbearbeitungsaufwand.

Abgrenzung zu ähnlichen Begriffen

Universal-2 steht als geschlossenes, genauigkeitsoptimiertes Batch-Modell zwischen streaming-orientierten Diensten wie Deepgram Nova-3 (Latenz-Leader fuer Echtzeit) und offenen Modellen wie NVIDIA Canary oder OpenAI Whisper, die man selbst hosten kann. Waehrend offene Modelle Kontrolle und lokalen Betrieb erlauben, setzt Universal-2 auf maximale Ausgabequalitaet und fertige Formatierung als Managed Service.

Alle Beiträge im Überblick:Speech & Voice