Spracherkennung mit Akzent: So testest du dein Setup

Du erfährst, was Studien über Akzente und Fehler bei der Spracherkennung zeigen, warum Durchschnittswerte wenig über deine Stimme sagen und wie du dein Setup testest.

Veröffentlicht am 2. Oktober 20267 Min. Lesezeit

Du diktierst eine kurze englische Nachricht an einen Kollegen. Wörter, die du deutlich gesagt hast, kommen als andere Wörter zurück, der Name eines Kunden wird zu etwas ganz anderem, und das Korrigieren des Transkripts dauert länger als geplant. Das passiert vielen Menschen, die Englisch als Zweitsprache sprechen, und auch Menschen mit einem regionalen Akzent oder Dialekt in ihrer Erstsprache.

Hier erfährst du, was veröffentlichte Studien über Akzente und Fehler bei der Spracherkennung sagen und was diese Zahlen über deine eigene Stimme nicht verraten können. Außerdem bekommst du einen kurzen Test für dein eigenes Setup und siehst, wo Yappee ins Spiel kommt.

Was Studien über Akzente und Fehler bei der Spracherkennung zeigen

OpenAI dokumentiert das für sein eigenes Spracherkennungsmodell. In der Model Card zu Whisper, der offiziellen Beschreibung des Modells, steht, dass das Modell nicht in allen Sprachen gleich gut arbeitet und dass die Ergebnisse auch zwischen Akzenten und Dialekten derselben Sprache schwanken. OpenAI rät nachdrücklich, das Modell genau in dem Umfeld zu testen, in dem es eingesetzt werden soll. Zwei Studien zeigen, wie groß solche Unterschiede sein können.

Eine Studie von 2020 mit Schwarzen und weißen Sprechern aus den USA

In einer 2020 in PNAS veröffentlichten Studie haben Forscher aus Stanford die Spracherkennung von Amazon, Apple, Google, IBM und Microsoft getestet. Grundlage waren 19,8 Stunden vergleichbar zusammengestellter Interviewaufnahmen von 73 Schwarzen und 42 weißen Sprechern. Über die fünf Systeme gemittelt betrug die Wortfehlerrate 0,35 für Schwarze Sprecher und 0,19 für weiße Sprecher. Die Wortfehlerrate, auf Englisch Word Error Rate, zählt die Wörter, die ein System falsch erkennt, auslässt oder zusätzlich einfügt, und teilt diese Zahl durch die Anzahl der Wörter in einem korrekten Transkript. Das entspricht grob 35 beziehungsweise 19 Fehlern pro 100 Wörter.

Die Studie hat Schwarze und weiße Sprecher aus den USA verglichen. Menschen, die Englisch als Zweitsprache sprechen, hat sie nicht untersucht. Die 35 Prozent sind also keine Fehlerquote für Englisch mit Akzent im Allgemeinen. Die beiden Gruppen stammten außerdem aus verschiedenen Regionen, was die Autoren als Einschränkung nennen. Die Forscher haben die Systeme im Frühjahr 2019 getestet. Die Unternehmen könnten sie seitdem aktualisiert haben, deshalb beschreiben die Ergebnisse nicht die heutigen Versionen.

Eine Studie von 2025 mit Nicht-Muttersprachlern

Ein Preprint vom März 2025 hat fünf Systeme in den damals verfügbaren Versionen getestet: AssemblyAI Universal-2, Deepgram Nova-2, RevAI V2, Speechmatics Ursa 2 und Whisper large-v3. Die Sprecher hatten Arabisch, Chinesisch, Hindi, Koreanisch, Spanisch oder Vietnamesisch als Erstsprache, jeweils vier pro Gruppe. Die Studie gibt die Match Error Rate an. Sie zählt dieselben Fehler wie die Wortfehlerrate, teilt aber durch eine größere Gesamtzahl, in der auch die hinzugefügten Wörter stecken.

Bei 2.400 kurzen vorgelesenen Sätzen kamen Whisper und AssemblyAI im Schnitt auf 5,4 und 5,6 Prozent, ohne signifikanten Unterschied zwischen den beiden. Über alle fünf Systeme gemittelt schwankte die Rate stark je nach Erstsprache. Bei vier Kontrollsprechern mit US-amerikanischem Englisch lag sie unter 1 Prozent, bei der Gruppe mit Vietnamesisch als Erstsprache bei etwa 14 Prozent.

Freies Sprechen ergab ein weniger klares Bild. Für diesen Teil gab es nur 22 kurze Erzählungen mit zusammen etwa 26 Minuten Audio. Die statistischen Auswertungen kamen zu keinem einheitlichen Ergebnis bei der Frage, ob sich die Systeme klar unterscheiden. Außerdem gingen die Systeme unterschiedlich mit Füllwörtern, Wiederholungen und Selbstkorrekturen um. Die Studie ist ein Preprint, also kein begutachteter Artikel in einer Fachzeitschrift, und ihre Stichproben waren klein.

Was diese Zahlen für dein eigenes Diktieren bedeuten

Die 35 Prozent von 2020 und die rund 5 Prozent von 2025 zeigen nicht, dass die Spracherkennung siebenmal besser geworden ist. Die Studien verwenden unterschiedliche Messgrößen, Systeme und Sprecher, stammen aus verschiedenen Jahren und untersuchen verschiedene Arten des Sprechens.

Durchschnittswerte verdecken außerdem Unterschiede zwischen Sprechern, wie die Spanne je nach Erstsprache in der Studie von 2025 zeigt. Beim freien Sprechen sah das Bild noch einmal anders aus, und die meisten Nachrichten für die Arbeit sprichst du frei.

Zusammengenommen zeigt die Forschung, dass die Ergebnisse vom System, vom Akzent oder Dialekt und von der Art des Sprechens abhängen. Ein Urteil darüber, wie gut du sprichst, ist das nicht. Entscheidend ist, wie dein Werkzeug mit deiner Stimme und deinen Nachrichten zurechtkommt. Das deckt sich mit dem Rat aus der Model Card von Whisper, im tatsächlichen Umfeld zu testen. Werkzeug und Setup hast du in der Hand, und keiner der folgenden Schritte verlangt, dass du deinen Akzent änderst.

Zuerst Spracheinstellung und Mikrofon prüfen

Apple nennt in seiner Hilfe bei Problemen mit der Diktierfunktion auf dem Mac diese Punkte:

  • Wähl die richtige Sprache und Region.
  • Achte darauf, dass nichts das Mikrofon verdeckt, auch keine Kleidung und nicht dein Körper.
  • Nimm deine übliche Position am Mac ein und sprich deutlich, weder zu leise noch zu laut.
  • Vermeide Hintergrundgeräusche und probier in einem lauten oder stark hallenden Raum ein Headset mit Mikrofon.

Fang mit der Spracheinstellung an. Erwartet das Werkzeug eine andere Sprache oder regionale Variante als die, die du sprichst, können selbst deutlich gesprochene Wörter falsch herauskommen.

Apple hat diese Tipps für die Diktierfunktion auf dem Mac geschrieben, und dass sie Akzentunterschiede verringern, ist nicht durch Messungen belegt. Geprüft sind sie trotzdem schnell, und die meisten gelten für jedes Werkzeug zum Diktieren. Sprich dabei mit deiner normalen Stimme. Weder Apples Anleitung noch die oben genannten Studien sprechen dafür, langsam Wort für Wort zu sprechen, übertrieben deutlich auszusprechen oder einen anderen Akzent nachzuahmen.

Zwei oder drei Setups mit deinen eigenen Nachrichten testen

Ein kleiner Test mit deinen eigenen Nachrichten zeigt, was bei deiner Stimme und deiner Arbeit schiefgeht. Pass die Schritte an die Art von Nachrichten an, die du verschickst.

  1. Schreib zwei oder drei kurze Nachrichten auf, die du wirklich verschicken würdest. Jede sollte einen Namen, eine Zahl, ein Datum und ein Verneinungswort wie „nicht“ oder „kein“ enthalten.
  2. Diktiere jede Nachricht in zwei oder drei Setups. Vergleiche zum Beispiel das Mikrofon deines Laptops am Schreibtisch mit einem Headset in einem ruhigen Raum. Du kannst auch vergleichen, ob du in zusammenhängenden Wortgruppen sprichst oder alle paar Wörter eine Pause machst. Oder du vergleichst Englisch mit deiner stärksten Sprache und anschließender Übersetzung.
  3. Vergleiche jedes Ergebnis mit dem, was du gemeint hast. Zähl die Fehler, die den Sinn verändern, etwa einen falschen Namen, eine falsche Zahl, ein falsches Datum oder ein fehlendes „nicht“. Kleine Unterschiede in der Formulierung kannst du ignorieren.
  4. Behalte das Setup mit den wenigsten schweren Fehlern. Notier dir die Wörter, die jedes Mal falsch herauskommen. Wenn dein Werkzeug ein Wörterbuch hat, trag sie dort ein.

Hier ist eine erfundene Testnachricht:

Hallo Anika, das Angebot für Oyelaran über 2.450 Euro geht am Donnerstag, 8. Oktober, raus. Bitte nimm die Einrichtungsgebühr nicht mit auf.

Sie enthält den Namen einer Person aus dem Team, einen weniger geläufigen Kundennamen, einen Betrag, einen Wochentag mit Datum und ein „nicht“. Ein falsches Wort an einer dieser Stellen würde ändern, was Anika als Nächstes tut.

In deiner stärksten Sprache diktieren

Wenn du in einer anderen Sprache am flüssigsten denkst und sprichst, kannst du in dieser Sprache diktieren und den fertigen Text auf Englisch schreiben lassen. Nimm das als weiteres Setup in deinen Test auf. Ein belegter Gewinn an Genauigkeit ist das nicht, und erst deine eigenen Ergebnisse zeigen, ob es für dich besser funktioniert.

Mit Yappee kannst du auf dem iPhone oder Mac in einer der über 50 unterstützten Sprachen aufnehmen, etwa auf Deutsch, Portugiesisch oder Polnisch, und den Text auf Englisch oder in einer anderen unterstützten Sprache schreiben lassen. Den englischen Text fügst du dann in deine E-Mail oder deinen Chat ein.

Die Übersetzung ist ein zusätzlicher Schritt, bei dem sich Bedeutung, Namen oder Ton verschieben können. Vergleiche den englischen Text mit dem, was du gemeint hast, vor allem Namen, Zahlen und Datumsangaben. Das klappt am besten, wenn du die Zielsprache gut genug liest, um ein Problem zu bemerken.

Namen ins Wörterbuch eintragen und Füllwörter mit „Aufräumen“ entfernen

Wenn die Wörter, die in deinem Test immer wieder falsch herauskamen, Namen oder Begriffe aus deiner Arbeit sind, gehören sie in dein Wörterbuch. Mit Yappee kannst du Namen und Fachbegriffe eintragen, etwa den Nachnamen eines Kunden oder einen Produktnamen, damit Yappee weiß, wie du sie geschrieben haben willst. Das hilft bei wiederkehrenden Wörtern, gleicht aber beim Rest dessen, was du sagst, keinen Akzentunterschied aus.

Die Studie von 2025 hat gezeigt, dass Systeme beim freien Sprechen unterschiedlich mit Füllwörtern und Selbstkorrekturen umgehen. Wenn du deine eigenen Worte ohne sie haben willst, wähl das Format „Aufräumen“. Es entfernt Füllwörter, Versprecher und kleine Fehler und behält deine Formulierung bei. „Aufräumen“ liefert kein wortgetreues Transkript und findet nicht jedes falsch verstandene Wort. Hat die Spracherkennung einen Namen in ein anderes Wort verwandelt, musst du das trotzdem selbst bemerken.

Beurteile Yappee wie jedes andere Werkzeug, indem du denselben Test mit deinen eigenen Nachrichten machst.

Vor dem Absenden Namen, Zahlen, Datumsangaben und Verneinungen prüfen

Ein niedriger Durchschnittswert in einer Studie sagt wenig über deine nächste Nachricht, und deine Nachrichten sind keine kurzen Sätze, die jemand im Labor vorliest.

Prüf diese Details, bevor du eine diktierte Nachricht abschickst:

  • Namen von Personen, Kunden und Produkten
  • Zahlen und Beträge
  • Datumsangaben und Wochentage
  • Verneinungen, denn ein fehlendes „nicht“ verkehrt einen Satz ins Gegenteil

Genau diese Fehler machen echten Ärger, wenn sie durchrutschen. Stell die richtige Sprache ein, kümmere dich um Mikrofon und Raum und teste ein paar Setups mit deinen eigenen Nachrichten. Behalte das mit den wenigsten schweren Fehlern und prüf die wichtigen Details, bevor jemand anderes sie liest.

Mach mehr aus deiner Stimme

Mach aus gesprochenen Gedanken Texte, die du direkt nutzen kannst. Für iPhone und Mac.

Für iPhone und Mac.

24. September 20267 Min. Lesezeit

Texte diktieren: So braucht dein Entwurf weniger Nacharbeit

Du erfährst, was eine Studie zum Tempo beim Diktieren zeigt, wie du deinen Entwurf klar aufbaust, was du vor dem Absenden prüfst und wann die Diktierfunktion auf dem Mac oder Yappee passt.