Begriff
NVIDIA Canary
Canary ist NVIDIAs offene ASR- und Speech-Translation-Modellfamilie (CC-BY-4.0), die auf dem Open-ASR-Leaderboard bei englischer Genauigkeit vor OpenAI Whisper liegt und 25 europaeische Sprachen abdeckt.
NVIDIA Canary — ausführlicher erklärt
Canary ist eine offene Modellfamilie von NVIDIA fuer automatische Spracherkennung (ASR) und Speech-to-Text-Uebersetzung (AST). Anders als geschlossene Cloud-Dienste stehen die Gewichte oeffentlich unter der permissiven CC-BY-4.0-Lizenz auf Hugging Face bereit und duerfen kommerziell wie nicht-kommerziell genutzt werden. Die Modelle basieren auf einem FastConformer-Encoder mit Transformer-Decoder und laufen im NeMo-Framework. Die im August 2025 veroeffentlichte Variante Canary-1B-v2 hat rund 978 Millionen Parameter und unterstuetzt 25 europaeische Sprachen.
Bemerkenswert ist die Genauigkeit im Verhaeltnis zum Trainingsaufwand: Canary uebertrifft Whisper, OWSM und Seamless-M4T auf Englisch, Franzoesisch, Spanisch und Deutsch, obwohl es mit einer Groessenordnung weniger Daten trainiert wurde. Auf dem Open-ASR-Leaderboard fuehrt die Familie bei englischer Genauigkeit vor OpenAI Whisper (large-v3). Damit ist Canary ein starker offener Gegenentwurf, der lokalen Betrieb und volle Kontrolle ermoeglicht.
Beispiel / Praxisbezug
Ein Unternehmen mit Datenschutzanforderungen kann Canary lokal oder in der eigenen Cloud betreiben, statt Audio an einen externen Dienst zu senden. So lassen sich etwa interne Meetings oder mehrsprachige Aufnahmen on-premise transkribieren und zwischen den 25 unterstuetzten Sprachen uebersetzen, ohne laufende API-Kosten pro Minute.
Abgrenzung zu ähnlichen Begriffen
Canary steht als Open-Weight-Familie im Gegensatz zu den geschlossenen Diensten AssemblyAI Universal-2 (Genauigkeits-Leader, Managed Service) und Deepgram Nova-3 (Realtime-Streaming-Leader). Gegenueber OpenAI Whisper ist Canary bei englischer Genauigkeit staerker, deckt jedoch mit 25 Sprachen weniger Sprachen ab als Whispers rund 99. Die begleitende Parakeet-Familie zielt auf noch kleinere, schnellere Modelle.