← /BLOG#001·PRODUKTIVITÄT

Automatische Textbereinigung nach dem Diktieren: Was beim 'Polieren' der Sprache wirklich passiert

Diktier-Apps versprechen poliertes Deutsch aus rohem Sprechen. Wie diese Nachbearbeitung technisch funktioniert und wo sie tatsächlich läuft.

Wer frei drauflos spricht, produziert selten druckreifen Text. "Ähm, also, die Rechnung, die müsste, glaube ich, schon raus sein" ist eine völlig normale Art zu sprechen, aber niemand will das so in eine E-Mail kopieren. Fast jede moderne Diktier-App wirbt deshalb mit automatischer Textbereinigung, oft als "AI-powered text polishing" oder ähnlich beworben. Was dabei technisch passiert und, wichtiger noch, wo diese Bereinigung tatsächlich stattfindet, wird selten erklärt.

Was beim Nachbearbeiten technisch passiert

Die reine Spracherkennung, die sogenannte Transkription, wandelt Audiosignale in Rohtext um. Dieser Rohtext enthält typischerweise Füllwörter, abgebrochene Sätze, falsche Zeichensetzung und je nach Sprechweise auch Wiederholungen. Ein zweiter Verarbeitungsschritt, das Post-Processing, übernimmt danach die eigentliche Politur: Füllwörter werden entfernt, Sätze grammatikalisch korrigiert, Kommata gesetzt, Groß- und Kleinschreibung angepasst. Bei Sprich übernimmt diesen zweiten Schritt ein eigens für Deutsch trainiertes Qwen-Modell, das über das MLX-Framework läuft und mit LoRA-Finetuning gezielt auf Transkriptionskorrektur spezialisiert wurde, nicht auf allgemeines Schreiben, sondern konkret auf das Muster gesprochene Sprache zu geschriebenem Deutsch.

Der Unterschied zwischen einem generischen Sprachmodell und einem für diese Aufgabe trainierten Modell zeigt sich bei typisch deutschen Stolperstellen: langen Komposita, die beim Sprechen oft als mehrere Wörter ankommen, Kommaregeln bei Nebensätzen, oder der Unterscheidung zwischen wörtlicher Rede und indirekter Rede. Ein Modell, das speziell auf diese Muster trainiert wurde, erkennt sie zuverlässiger als ein Mehrzweckmodell, das nebenbei auch Deutsch kann.

Ein Beispiel macht den Unterschied konkret. Roh transkribiert klingt ein typisches Diktat oft so: "also die Auftragsbestätigung äh die müsste eigentlich schon beim Kunden sein oder Moment ich schau nochmal nach." Nach der Nachbearbeitung wird daraus: "Die Auftragsbestätigung müsste eigentlich schon beim Kunden sein. Ich schaue noch einmal nach." Das Modell entfernt nicht nur Füllwörter, sondern erkennt auch, wo ein neuer Satz beginnt, obwohl im gesprochenen Fluss keine klare Pause markiert wurde.

Der Unterschied zwischen Cloud-Politur und lokaler Nachbearbeitung

Bei den meisten bekannten Diktier-Apps läuft dieser zweite Schritt über eine Cloud-API. Das bedeutet: Selbst wenn die reine Spracherkennung theoretisch lokal stattfinden könnte, wird der bereits transkribierte Text zur Nachbearbeitung an einen Server geschickt, verarbeitet und zurückgeschickt. Für den Nutzer ist das unsichtbar, es fühlt sich an wie ein einziger, nahtloser Vorgang. Rechtlich ist es aber ein zweiter Übertragungsmoment, bei dem der komplette Inhalt des Diktats, oft inklusive Namen, Zahlen und Fachbegriffen, ein zweites Mal das Gerät verlässt.

Bei Sprich läuft die gesamte Kette, Transkription und Nachbearbeitung, auf dem Gerät. Das Post-Processing-Modell wird bei Beginn einer Diktier-Sitzung geladen und nach Abschluss wieder aus dem Speicher entfernt, es liegt also nicht dauerhaft im Hintergrund, sondern nur während der aktiven Nutzung. Um die Wartezeit zu verkürzen, wird der System-Prompt, der dem Modell erklärt, wie es korrigieren soll, beim App-Start einmal vorberechnet und zwischengespeichert, sodass beim eigentlichen Diktieren nur der gesprochene Text selbst neu verarbeitet werden muss.

Für Nutzer, die lieber ganz auf die zweite Verarbeitungsstufe verzichten wollen, lässt sich die Nachbearbeitung in den Einstellungen deaktivieren. Dann erscheint der reine Transkriptionstext ohne Politur, was für einfache Notizen ausreichen kann, bei komplexeren Diktaten aber mehr manuelle Nacharbeit bedeutet. Diese Wahlmöglichkeit ändert nichts an der grundsätzlichen Architektur: Ob mit oder ohne Nachbearbeitung, beide Schritte finden ausschließlich auf dem Gerät statt.

Eigene Regeln mit dem persönlichen Wörterbuch

Automatische Korrektur stößt an ihre Grenzen, sobald es um individuelle Begriffe geht: Eigennamen, Kanzleibezeichnungen, Produktnamen oder branchenspezifische Abkürzungen, die ein allgemeines Sprachmodell nicht kennen kann. Dafür gibt es in Sprich ein persönliches Wörterbuch, in dem sich eigene Korrekturregeln hinterlegen lassen. Wer etwa regelmäßig den Namen einer Kanzlei diktiert, den das Modell sonst falsch schreiben würde, trägt die korrekte Schreibweise einmal ein, und ab diesem Zeitpunkt wird sie bei jedem Diktat automatisch angewendet.

Auch dieses Wörterbuch bleibt vollständig lokal gespeichert und verschlüsselt, es wird nirgendwo hochgeladen oder mit einem Cloud-Dienst synchronisiert. Einträge lassen sich jederzeit bearbeiten oder löschen, über eine einfache Oberfläche mit Hover-Buttons direkt in der Liste. Nils, Steuerberater aus Frankfurt, nutzt das Wörterbuch inzwischen für die Namen seiner zehn größten Mandanten sowie für gängige Abkürzungen wie "EÜR" oder "USt-VA", die ein allgemeines Modell sonst regelmäßig falsch transkribiert. Nach eigener Aussage hat sich die Zahl der manuellen Korrekturen dadurch spürbar reduziert.

Ein Bereich, in dem noch nicht jedes Detail perfekt funktioniert, sind gesprochene Formatierbefehle wie "neuer Absatz" oder Sonderzeichen wie das Paragraphenzeichen. Diese Fälle werden kontinuierlich verbessert, aber ein ehrlicher Hinweis gehört dazu: Wer sehr spezifische Diktierbefehle für juristische Gliederungen benötigt, sollte das im Alltag testen, bevor er sich vollständig darauf verlässt.

Interessant ist dabei, wie Sprich neue Wörterbuch-Vorschläge erkennt. Wird ein eingefügter Text kurz nach dem Diktieren manuell noch einmal korrigiert, etwa weil ein Name falsch geschrieben wurde, erkennt die App diese Änderung automatisch und schlägt vor, dafür eine dauerhafte Wörterbuch-Regel anzulegen. Wer den Vorschlag annimmt, muss den Namen kein zweites Mal korrigieren, das Modell wendet die Regel ab diesem Zeitpunkt eigenständig an. Dieser Lernmechanismus bleibt genau wie das Wörterbuch selbst vollständig lokal und wird nie an einen Server übermittelt.

Fazit

"Automatisch bereinigt" klingt nach einem einzigen, magischen Schritt, ist aber technisch eine zweistufige Verarbeitung, bei der die zweite Stufe bei den meisten Wettbewerbern über die Cloud läuft. Wer wissen möchte, wie sich diese Architektur auf die Gesamtgeschwindigkeit auswirkt, findet im Artikel über lokale KI-Sprachverarbeitung auf Apple Silicon die technischen Hintergründe dazu. Bei Sprich bleibt der komplette Vorgang, roher Text und polierte Fassung, auf dem eigenen Gerät, ergänzt um ein persönliches Wörterbuch, das mit jedem Diktat genauer wird.

Wer das ausprobieren möchte, kann bei Sprich kostenlos starten. 2.000 Wörter pro Woche sind gratis, keine Kreditkarte erforderlich.

Sprich kostenlos testen — 2.000 Wörter pro Woche gratis, keine Kreditkarte nötig.

Kostenlos herunterladen →