Begriff
Kokoro
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
Kokoro — ausführlicher erklärt
Kokoro (Kokoro-82M) ist ein Text-to-Speech-Modell (TTS), dessen Version 1.0 am 27. Januar 2025 unter der permissiven Apache-2.0-Lizenz erschien. Es fällt vor allem durch seine geringe Größe auf: Mit nur 82 Millionen Parametern ist es ein Bruchteil vieler konkurrierender Sprachsynthese-Modelle, liefert aber vergleichbare Qualität — bei deutlich höherer Geschwindigkeit und niedrigeren Kosten. Die Gewichte belegen rund 1 GB VRAM, wodurch Kokoro auch auf bescheidener Hardware oder sogar im Browser läuft.
Die v1.0 bringt 54 Stimmen über 8 Sprachen mit. Trainiert wurde das Modell bewusst nur auf freigegebenen, nicht-urheberrechtlich geschützten Audiodaten mit IPA-Phonem-Labels — was die permissive Lizenzierung erst möglich macht. Kokoro ist damit die TTS-Gegenrichtung zu Speech-to-Text-Modellen wie Whisper: Statt Audio in Text zu überführen, erzeugt es aus Text hörbare Sprache.
Beispiel / Praxisbezug
Kokoro eignet sich für Voiceovers, Screenreader, Sprachausgaben in Apps oder das Vertonen von Artikeln und Podcasts — lokal und ohne API-Kosten. Weil es klein und Apache-lizenziert ist, lässt es sich in eigene Produkte einbetten, ohne an einen Cloud-Anbieter gebunden zu sein.
Abgrenzung zu ähnlichen Begriffen
Kokoro erzeugt Sprache (TTS), Whisper transkribiert sie (STT) — beide gehören zum Einsatzzweck Speech & Voice. Gegenüber kommerziellen Diensten wie ElevenLabs punktet Kokoro mit offenen Gewichten und Self-Hosting, während jene bei Stimmvielfalt und Voice-Cloning breiter aufgestellt sind.