Voice Studio

Ein schlechtes Transkript am iPhone korrigieren

Die meisten Transkripte sind nicht insgesamt falsch, sondern an ein paar vorhersehbaren Stellen: ein Name, ein Fachbegriff, eine Passage, in der jemand zu schnell gesprochen hat. Wer weiß, warum genau diese Stellen scheitern, weiß auch, wo er nachschauen muss — Korrigieren wird so zu einem Zwei-Minuten-Durchgang statt einer Neufassung.

Ein Transkript, das zu fünfundneunzig Prozent stimmt und immer in denselben fünf Prozent daneben liegt, ist keine kaputte Funktion. Es ist genau das, was Spracherkennung tatsächlich ist: ein Modell, das Laute errät — sehr gut bei gewöhnlichen Wörtern, schlecht bei denen, die es nie zu erwarten gelernt hat.

Warum die Wörter überhaupt falsch herauskommen

Zwei verschiedene Dinge entscheiden, was am Ende dasteht. Das eine: welche Erkennung gelaufen ist. Die Spracherkennung von iOS versucht zuerst das Modell auf dem Gerät und weicht nur dann auf Apples Server aus, wenn dieser lokale Durchlauf leer zurückkommt oder fehlschlägt. Beide Wege können ein falsches Wort liefern — es ist nicht so, dass der eine zuverlässig ist und der andere nicht, sondern dass beide unter Unsicherheit raten, nur mit unterschiedlich großen Modellen.

Das andere: was im Raum tatsächlich passiert ist. Abstand zur sprechenden Person, Hintergrundgeräusche und Leute, die sich ins Wort fallen, verschlechtern das Signal, bevor überhaupt eine der beiden Erkennungen es zu sehen bekommt. Ein Modell kann nur aus dem raten, was bei ihm ankam, und ein leises Nuscheln aus einem Meter Entfernung zum Mikrofon gibt ihm sehr wenig, womit es arbeiten kann.

Die Fehler, die sich wiederholen, und warum

Namen und Eigennamen

Ein Sprachmodell ist auf allgemeine Sprache trainiert, nicht auf Ihr Adressbuch oder Ihre Familie. Es hat Ihre Straße, den Nachnamen einer Kollegin oder den Namen des Hundes noch nie gehört und setzt stattdessen das nächstliegende gewöhnliche Wort ein, das es kennt. Das ist mit Abstand die häufigste Korrektur, die jeder an einem Transkript vornimmt.

Fachjargon und Fachbegriffe

Derselbe Mechanismus, eine andere Ursache. Ein auf Alltagssprache trainiertes Modell hat keinen Grund, einen Chemiebegriff, eine juristische Formulierung oder den Namen des internen Tools Ihres Teams zu erwarten, und greift stattdessen zu etwas, das ähnlich klingt.

Zahlen, Buchstabierungen und alles schnell Gesagte

Eine Telefonnummer, eine buchstabierte E-Mail-Adresse oder eine schnell aufgezählte Liste lassen der Erkennung weniger Zeit pro Wort, und Fehler häufen sich genau dort, selbst wenn der Rest des Satzes sauber herauskommt.

Überlappende oder leise Sprache

Wenn zwei Personen gleichzeitig sprechen oder jemand am Satzende leiser wird, arbeitet die Erkennung mit einem tatsächlich verschlechterten Signal. Kein nachträgliches Korrigieren behebt das an der Quelle — es zeigt nur, wo man beim Gegenlesen genauer hinhören sollte.

Zwei verschiedene Fehlertypen, zwei verschiedene Korrekturen

Es lohnt sich, die beiden vor dem Korrigieren auseinanderzuhalten, denn sie verlangen unterschiedlich viel Arbeit.

Wie man korrigiert, ohne alles neu zu machen

Bald tun, nicht irgendwann

Ein Transkript wird kopiert, durchsucht und weitergeleitet, lange bevor jemand daran denkt, es noch einmal gegenzulesen. Wenn Sie später nach einem Namen suchen und er nicht auftaucht, liegt das meist daran, dass die Aufnahme ihn falsch verstanden hat und noch niemand den Text korrigiert hat — ein verunstaltetes Wort ist für die Suche nach dem richtigen unsichtbar. Es einmal zu korrigieren, solange Sie noch wissen, was wirklich gesagt wurde, macht es von da an auffindbar und zitierbar.

Was Korrigieren nicht kann

Das Bearbeiten des Texts behebt falsche Wörter, keine fehlende Struktur. Die Spracherkennung von iOS kennzeichnet nicht, wer spricht, also bleibt das Transkript einer Zwei-Personen-Unterhaltung fortlaufender Text, und keine Korrektur fügt die Kennzeichnungen „A:“ und „B:“ nachträglich ein — das muss von Hand geschehen, falls nötig. Und wenn ein Audioabschnitt tatsächlich leer zurückkam, weil er zu leise oder zu verrauscht war, bedeutet Korrigieren: selbst zuhören und selbst tippen, was man hört. Es gibt keinen Knopf, der eine schlechte Aufnahme beim zweiten Mal besser transkribiert. Liegt das Problem im Audio selbst, sitzt die eigentliche Lösung vor dem Transkript: näher am Mikrofon, ein ruhigerer Raum beim nächsten Mal.

So funktioniert das in Voice Studio

Das Transkript lässt sich nachträglich bearbeiten — einen Namen korrigieren, den Rest lassen. Das gehört zur kostenlosen App, nicht zu dem, was Pro zurückhält; ein Transkript zu korrigieren ist Teil der normalen Nutzung, genau wie Aufnehmen oder Exportieren. Einmal korrigiert, bleibt es überall korrigiert, wo dieser Text verwendet wird: Die Bibliothekssuche, die Titel, Transkripte und Ortsnamen durchsucht, findet das korrigierte Wort, und ein TXT- oder JSON-Export trägt die Korrektur mit sich, nicht die ursprüngliche Vermutung.

Häufige Fragen

Warum wird derselbe Name in meinem Transkript jedes Mal falsch erkannt?

Die Erkennung hat kein Gedächtnis zwischen den einzelnen Vorkommen — sie rät bei jedem Mal neu aus dem Klang, ohne sich an eine frühere Korrektur zu erinnern. Die erste Stelle zu korrigieren, korrigiert nicht die übrigen; jede braucht dieselbe Korrektur.

Kann ich einen leeren Abschnitt erneut transkribieren lassen?

Ein Transkript am iPhone zu korrigieren bedeutet, sich die fehlenden Wörter selbst anzuhören und einzutippen. Es gibt keinen separaten Wiederholungsschritt für einen leer zurückgekommenen Abschnitt — war das Audio selbst zu leise oder zu verrauscht, gilt diese Einschränkung bei einem zweiten Versuch genauso.

Ändert das Korrigieren eines Transkripts die ursprüngliche Aufnahme?

Nein. Das Bearbeiten ändert nur den Text. Die aufgenommene Audiodatei bleibt unangetastet, sodass Sie eine Korrektur jederzeit noch einmal gegen das tatsächlich Gesagte prüfen können.

Kostet das Korrigieren eines Transkripts in Voice Studio etwas?

Nein. Das Bearbeiten des Transkripts gehört zur kostenlosen App, genau wie Aufnehmen, Marker, Suche und Export. Es ist nicht eines der Dinge, die Pro hinzufügt.

In Voice Studio ausprobieren

Voice Studio nimmt auf, transkribiert im iPhone selbst und legt jede Notiz nach Zeit und Ort ab — damit der Gedanke aus dem Auto auch nächsten Monat noch auffindbar ist.

Im App Store laden

Kostenloser Download · iPhone und iPad · iOS 16.4 oder neuer