Begriff
Fish Audio S2
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
Fish Audio S2 — ausfuehrlicher erklaert
Fish Audio S2 ist das Text-to-Speech-Modell der zweiten Generation von Fish Audio und Teil der Fish-Speech-Familie. Sowohl Inferenz-Code als auch Modellgewichte sind quelloffen und auf GitHub sowie Hugging Face verfuegbar, sodass sich S2 auf eigener Infrastruktur betreiben und feinabstimmen laesst. Das Modell wurde auf ueber 10 Millionen Stunden Audio in rund 80 Sprachen trainiert.
Eine Besonderheit ist die feingranulare Steuerung ueber Inline-Tags: Anweisungen in natuerlicher Sprache werden direkt in den Text eingebettet und wirken bis auf Wortebene, etwa fuer Emotion und Betonung. S2 bietet native Mehrsprecher-Unterstuetzung und sehr niedrige Latenz. Auf der Speech-Arena-Rangliste von Artificial Analysis fuehrte Fish Audio S2 Pro das Feld der Open-Weight-Modelle an und verringerte den Abstand zu proprietaeren Modellen.
Beispiel / Praxisbezug
Fuer ein mehrsprachiges Erklaervideo laesst sich mit Fish Audio S2 pro Textstelle per Inline-Tag festlegen, welches Wort betont oder mit welcher Emotion ein Satz gesprochen wird, waehrend der Betrieb komplett selbst gehostet und kostenfrei erfolgt.
Abgrenzung zu aehnlichen Begriffen
Wie Chatterbox ist Fish Audio S2 ein Open-Weight-Speech-Modell und damit selbst hostbar, im Gegensatz zum geschlossenen ElevenLabs v3. Als TTS-Modell erzeugt es Sprache aus Text; sein Schwerpunkt liegt auf feingranularer Tag-Steuerung auf Wortebene und breiter Sprachabdeckung.