
Wortfehlerrate
Die Wortfehlerrate misst, wie viele Fehler ein Spracherkennungssystem macht: Sie vergleicht den erkannten Text mit dem, was tatsächlich gesagt wurde, und gibt das Ergebnis als Prozentwert an. Je niedriger die Wortfehlerrate, desto genauer die Erkennung.
Wenn ein Programm gesprochene Sprache in Text umwandelt, macht es dabei Fehler. Es kann Wörter falsch erkennen, weglassen oder erfinden, die gar nicht gesagt wurden. Die Wortfehlerrate — auf Englisch Word Error Rate, kurz WER — ist die Kennzahl, mit der man misst, wie viele dieser Fehler passieren. Sie setzt die Anzahl der falschen Wörter ins Verhältnis zur Gesamtzahl der Wörter im Original und gibt das Ergebnis als Prozentwert an. Eine Wortfehlerrate von 0 % bedeutet: jedes Wort wurde korrekt erkannt. Je höher der Wert, desto mehr ist schiefgelaufen.
Woran die Wortfehlerrate gemessen wird
Ohne eine einheitliche Messgröße könnte jeder Hersteller behaupten, sein System sei das beste — ohne Belege. Die Wortfehlerrate schafft Vergleichbarkeit. Man kann damit zwei Systeme auf denselben Audiodateien testen und direkt ablesen, welches genauer ist.
Für viele Anwendungen gelten grobe Richtwerte: Unter 5 % gilt in der Forschung als sehr gut. Menschen untereinander erreichen beim Nachschreiben gesprochener Sprache ungefähr 4 %. Moderne Systeme liegen bei klarer Audioqualität und Standardsprache in diesem Bereich — bei Hintergrundlärm, starkem Akzent oder Fachsprache kann der Wert schnell auf 20 % oder mehr steigen.
Wichtig ist dabei: Die Wortfehlerrate behandelt alle Fehler gleich. Ein falsch erkanntes Füllwort wie « äh » zählt genauso wie ein falsch erkannter Name im Arztbericht. Das ist ein bekannter Schwachpunkt der Kennzahl — sie sagt nichts darüber aus, ob ein Fehler harmlos oder folgenreich war.
Drei Fehlertypen hinter der Zahl
Die Wortfehlerrate fasst drei verschiedene Arten von Fehlern zusammen. Erstens Substitutionen: Das System erkennt ein Wort, aber das falsche — aus « Bären » wird etwa « Beeren ». Zweitens Löschungen: Ein Wort, das gesprochen wurde, taucht im erkannten Text gar nicht auf. Drittens Einfügungen: Das System fügt ein Wort hinzu, das nie gesagt wurde. Alle drei Typen zählen als Fehler, werden addiert und durch die Gesamtzahl der Wörter im Referenztext geteilt.
Das Referenztext-Prinzip ist dabei entscheidend. Man braucht immer eine Vorlage — einen sorgfältig abgetippten, fehlerfreien Text dessen, was gesprochen wurde. Diesen nennt man Transkript. Das System vergleicht seine Ausgabe Wort für Wort mit diesem Transkript und zählt die Abweichungen. Ohne einen solchen Referenztext lässt sich die Wortfehlerrate nicht berechnen.
Ein kleines Rechenbeispiel: Jemand sagt fünf Wörter. Das System erkennt eines falsch und lässt eines aus. Das ergibt zwei Fehler bei fünf Wörtern — eine Wortfehlerrate von 40 %. Wäre nur ein Fehler passiert, läge der Wert bei 20 %. So lässt sich die Qualität direkt ablesen.
Wortfehlerrate in Produkten und Schlagzeilen
Die Wortfehlerrate begegnet einem überall dort, wo Sprache automatisch erkannt wird. Sprachassistenten wie Siri oder Google Assistant, automatische Untertitel auf YouTube oder in Videokonferenzen, Diktierfunktionen im Smartphone — all das sind Systeme zur Spracherkennung, und all diese Systeme werden unter anderem mit der Wortfehlerrate bewertet.
In Tech-Meldungen taucht die Kennzahl auf, wenn Unternehmen neue Sprachmodelle vorstellen. Eine typische Schlagzeile lautet dann: « Neues Modell erreicht WER von 3,5 % auf dem LibriSpeech-Datensatz » — wobei LibriSpeech eine verbreitete Sammlung von Audiodateien ist, auf der Systeme standardmäßig verglichen werden. Solche Benchmarks, also standardisierte Tests, ermöglichen den Vergleich über Jahre hinweg.
In Bereichen, wo Fehler besonders teuer sind — etwa in der medizinischen Dokumentation oder bei der automatischen Untertitelung von Nachrichtensendungen — reicht die Wortfehlerrate allein oft nicht aus. Dort zieht man zusätzliche Kriterien heran, zum Beispiel wie häufig ausgerechnet Schlüsselbegriffe falsch erkannt werden. Die Wortfehlerrate bleibt aber der erste und meistgenutzte Anhaltspunkt, wenn es darum geht, Spracherkennungssysteme zu vergleichen.