Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
fish-audio

Fish Audio · 3× · zuletzt 04. Aug. 2026

26
Momentum

Fish Audio ist eine Plattform für KI-gestützte Sprachsynthese (Text-to-Speech) und Voice-Cloning, entwickelt vom Team hinter dem Open-Source-Projekt "Fish Speech". Das aktuelle Flaggschiffmodell S2 (Pro) nutzt eine Dual-Autoregressive-Architektur (4B-Parameter Slow-AR plus 400M-Parameter Fast-AR) und wurde auf über 10 Millionen Stunden Audiodaten in mehr als 80 Sprachen trainiert. Es unterstützt feingranulare Emotions- und Prosodiesteuerung über Freitext-Tags, Mehrsprecher-Dialoge und Voice-Cloning aus kurzen Referenzaufnahmen (10–30 Sekunden). Die Modellgewichte sind unter einer eigenen "Fish Audio Research License" frei für Forschung/nicht-kommerzielle Nutzung, kommerzielle Nutzung erfordert eine separate Lizenz; der API-Zugang ist kostenpflichtig nach Verbrauch.

Momentum-Verlauf
20.05.18.08.

Features

Echtzeit-StreamingJa, Audio wird während der Generierung gestreamt (SGLang-basierte Streaming-Inference-Engine)
LatenzTime-to-first-audio ca. 100ms; Real-Time-Factor 0,195 auf einer NVIDIA H200 GPU (S2 Pro)
LizenzFish Audio Research License: Forschung/nicht-kommerzielle Nutzung frei; kommerzielle Nutzung erfordert separate Lizenz von Fish Audio
PlattformWeb-App (fish.audio), REST-API, Python-SDK, self-hostbar (GitHub/Hugging Face), iOS- und Android-Companion-App
PreisAPI: $15 pro 1 Mio. UTF-8-Bytes (Modell s2-pro); Abo-Pläne: Free $0, Plus $5,50–15/Monat, Pro $37,50–100/Monat, Max bis $749/Monat
Release-DatumOpenAudio S1 gelauncht im Juni 2025 (Rebrand zu Fish Audio); S2 Pro Open-Source-Release im März 2026
SprachenÜber 80 Sprachen (S2 Pro); Marketing-Seiten nennen z.T. 30+ bzw. 40+ Sprachen für einzelne Produkt-Fronten
Voice-CloningVoice-Cloning aus 10–30 Sekunden Referenzaudio, erfasst Klangfarbe, Sprechstil und emotionale Tendenzen ohne Fine-Tuning

Weitere Produkte in dieser Kategorie: Sprachsynthese (TTS)

Belege (3)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.