

Fish Audio
#7 in Sprachsynthese (TTS)Fish Audio · 3× · zuletzt 04. Aug. 2026
Fish Audio ist eine Plattform für KI-gestützte Sprachsynthese (Text-to-Speech) und Voice-Cloning, entwickelt vom Team hinter dem Open-Source-Projekt "Fish Speech". Das aktuelle Flaggschiffmodell S2 (Pro) nutzt eine Dual-Autoregressive-Architektur (4B-Parameter Slow-AR plus 400M-Parameter Fast-AR) und wurde auf über 10 Millionen Stunden Audiodaten in mehr als 80 Sprachen trainiert. Es unterstützt feingranulare Emotions- und Prosodiesteuerung über Freitext-Tags, Mehrsprecher-Dialoge und Voice-Cloning aus kurzen Referenzaufnahmen (10–30 Sekunden). Die Modellgewichte sind unter einer eigenen "Fish Audio Research License" frei für Forschung/nicht-kommerzielle Nutzung, kommerzielle Nutzung erfordert eine separate Lizenz; der API-Zugang ist kostenpflichtig nach Verbrauch.
Features
| Echtzeit-Streaming | Ja, Audio wird während der Generierung gestreamt (SGLang-basierte Streaming-Inference-Engine) |
| Latenz | Time-to-first-audio ca. 100ms; Real-Time-Factor 0,195 auf einer NVIDIA H200 GPU (S2 Pro) |
| Lizenz | Fish Audio Research License: Forschung/nicht-kommerzielle Nutzung frei; kommerzielle Nutzung erfordert separate Lizenz von Fish Audio |
| Plattform | Web-App (fish.audio), REST-API, Python-SDK, self-hostbar (GitHub/Hugging Face), iOS- und Android-Companion-App |
| Preis | API: $15 pro 1 Mio. UTF-8-Bytes (Modell s2-pro); Abo-Pläne: Free $0, Plus $5,50–15/Monat, Pro $37,50–100/Monat, Max bis $749/Monat |
| Release-Datum | OpenAudio S1 gelauncht im Juni 2025 (Rebrand zu Fish Audio); S2 Pro Open-Source-Release im März 2026 |
| Sprachen | Über 80 Sprachen (S2 Pro); Marketing-Seiten nennen z.T. 30+ bzw. 40+ Sprachen für einzelne Produkt-Fronten |
| Voice-Cloning | Voice-Cloning aus 10–30 Sekunden Referenzaudio, erfasst Klangfarbe, Sprechstil und emotionale Tendenzen ohne Fine-Tuning |