

WordVoice TTS
#10 in Sprachsynthese (TTS)Huggingapps · 2× · zuletzt 25. Juli 2026
WordVoice TTS ist ein kompaktes Text-to-Speech-System (0,5 Milliarden Parameter), das auf CosyVoice3 basiert und von HuggingApps über einen Hugging-Face-Space sowie das Modell "XXH333/WordVoice-base-0.5B" veröffentlicht wurde. Das Modell erlaubt entweder vollautomatische Sprachgenerierung ("Autopilot") oder eine explizite Wort-für-Wort-Steuerung von Dauer, Lautstärke, Tonhöhe und Tonfall. Es unterstützt sowohl geklonte als auch voreingestellte Stimmen. Die zugrunde liegende Forschungsarbeit "WordVoice" (arXiv 2607.06461) beschreibt ein Framework für explizite, wortgenaue Kontrolle bei LLM-basierten TTS-Systemen, trainiert u.a. auf einem 4.700-Stunden-Bilingual-Datensatz.
Features
| Plattform | Hugging Face Space (huggingface.co/spaces/hugging...) und Modell XXH333/WordVoice-base-0.5B |
| Release-Datum | 23. Juli 2026 (Ankündigung auf X durch HuggingApps) |
| Voice-Cloning | Unterstützt geklonte und voreingestellte Stimmen |