Voice Studio

Warum bricht meine iPhone-Transkription mitten in der Aufnahme ab?

Kurz gesagt: Bei einer langen Aufnahme verarbeitet die Spracherkennung nicht alles als einen einzigen Block. Sie arbeitet den Ton in Abschnitten ab, und ein Abschnitt kann leer zurückkommen, während die vorherigen einwandfrei funktioniert haben — die Transkription endet dann einfach, mitten in der Aufnahme, ohne jede Fehlermeldung.

Eine abbrechende Transkription ist ein besonders verwirrender Fehlerfall. Anders als eine leere Transkription hat diese hier eindeutig funktioniert — die ersten Minuten lesen sich richtig, Namen stimmen, das Tempo wirkt normal — und dann, mittendrin, nichts mehr. Kein Fehler, kein neuer Versuch, nur Stille, wo Text stehen sollte. Es sieht aus, als wäre die App abgestürzt oder hätte das Interesse verloren. Meist stimmt keines von beidem.

Warum eine lange Aufnahme nicht als ein Stück erkannt wird

Die Spracherkennung von iOS — dasselbe Speech Framework, auf das jede Transkriptions-App auf dem iPhone zurückgreift — ist nicht dafür gebaut, einem Modell eine neunzigminütige Datei zu übergeben und eine einzige Antwort zurückzubekommen. Langes Audio wird in Abschnitten verarbeitet, und jeder Abschnitt ist ein eigener Erkennungsversuch. Gelingt ein Abschnitt, landet sein Text in der Transkription. Scheitert ein Abschnitt, trägt er einfach nichts bei, und die App macht mit dem weiter, was danach kommt, sofern sie kann — oder hört auf, wenn nicht.

Das ist der mechanische Grund, warum eine Transkription eine Weile vollständig wirken und dann einfach ausgehen kann. Meist ist es nicht ein einzelner katastrophaler Fehler, sondern ein Abschnitt, irgendwo in der Mitte oder gegen Ende, der leer zurückkam.

Warum sich das nicht von selbst durch einen erneuten Versuch löst

Die Erkennung auf dem Gerät wird zuerst versucht und weicht nur dann auf einen Server-Durchlauf aus, wenn der erste Versuch komplett leer zurückkommt oder einen Fehler wirft. Diese Rückfalllogik prüft das Ergebnis der Anfrage als Ganzes. Eine Aufnahme, die fünfzehn Minuten guten Text geliefert hat und danach nichts mehr, ist aus Sicht dieser Prüfung kein leeres Ergebnis — sie hat etwas produziert. Die Bedingung, die einen erneuten Versuch auslöst, greift also nie, obwohl gerade der gescheiterte Teil davon profitiert hätte.

Das ist gut zu wissen, weil es etwas erklärt, das sonst wie ein Programmierfehler wirkt: Genau dieselbe Transkription an genau derselben Datei noch einmal laufen zu lassen, führt meist zu genau demselben Abbruch. Der Ton hat sich nicht geändert, und der Abschnitt, der beim ersten Mal gescheitert ist, hat beim zweiten Mal keinen neuen Grund, es zu schaffen.

Was einen Abschnitt tatsächlich scheitern lässt

Die Aufnahme ist lang

Je länger eine Datei ist, in desto mehr einzelne Abschnitte wird sie aufgeteilt, und desto mehr Gelegenheiten gibt es, dass einer davon auf etwas trifft, mit dem das Modell nicht zurechtkommt. Eine fünfminütige Sprachnotiz hat dafür deutlich weniger Gelegenheiten als ein zweistündiges Interview.

Eine Passage mit Stille, Lärm oder Ruhe

Eine Pause, in der jemand aufsteht, um Kaffee zu holen, ein Schub Hintergrundlärm oder mehrere Minuten fast völliger Stille mitten in einer Aufnahme geben diesem Abschnitt sehr wenig verwertbare Sprache zum Erkennen. Kommt er leer zurück, ist genau diese Lücke es, die als Ende der Transkription erscheint — selbst wenn die Leute eine Minute später im Audio selbst wieder völlig klar sprechen.

Abstands- oder Lautstärkeänderungen im Verlauf

Ist das Telefon an einem Ort geblieben, aber jemand hat sich weiter entfernt, sich vom Mikrofon weggedreht, oder der Raum ist im Verlauf der Aufnahme lauter geworden, kann die Audioqualität in späteren Abschnitten tatsächlich schlechter sein als in früheren — obwohl es dieselbe Datei, dasselbe Telefon und durchgehend dieselbe Einstellung ist.

Was sich zu versuchen lohnt

Wie Voice Studio damit umgeht

Voice Studio transkribiert über Apples Speech Framework genau wie oben beschrieben: zuerst Erkennung auf dem Gerät, mit einem Rückfall auf Apples Server nur dann, wenn ein Durchlauf komplett leer zurückkommt oder einen Fehler wirft. Bricht eine Transkription mitten in einer langen Aufnahme ab, bedeutet das, dass ein Abschnitt keinen Text geliefert hat, während die umliegenden es taten — die Aufnahme selbst bleibt davon unberührt, und der Ton des Abschnitts, den die Transkription verpasst hat, liegt weiterhin in der .m4a-Datei bereit, um erneut abgespielt oder erneut transkribiert zu werden.

Häufige Fragen

Bedeutet eine abbrechende Transkription, dass ein Teil der Aufnahme fehlt?

Nein. Audiodatei und Transkription sind zwei getrennte Dinge. Eine abgebrochene Transkription bedeutet, dass die Erkennung für diese Passage keinen Text geliefert hat — die Aufnahme selbst enthält weiterhin alles, und diese Passage lässt sich abspielen oder erneut transkribieren.

Behebt ein erneutes Transkribieren derselben Aufnahme den Abbruch?

Meist nur, wenn sich an den Bedingungen etwas geändert hat, am häufigsten der Wechsel von offline zu online. Hat sich nichts geändert, scheitert derselbe Abschnitt in der Regel wieder.

Passiert das bei längeren Aufnahmen häufiger?

Ja. Längeres Audio wird in mehr Abschnitte aufgeteilt, also gibt es mehr Gelegenheiten, dass einer davon leer zurückkommt. Bei einer kurzen Aufnahme ist dafür deutlich weniger Raum.

Ist eine abgebrochene Transkription dasselbe Problem wie eine leere Transkription?

Verwandt, aber nicht dasselbe. Eine leere Transkription bedeutet, dass die Erkennung für die gesamte Aufnahme gescheitert ist. Eine abgebrochene Transkription bedeutet, dass sie für einen Teil funktioniert hat und dann aufgehört hat — der bereits vorhandene Text davor bleibt korrekt.

In Voice Studio ausprobieren

Voice Studio nimmt auf, transkribiert im iPhone selbst und legt jede Notiz nach Zeit und Ort ab — damit der Gedanke aus dem Auto auch nächsten Monat noch auffindbar ist.

Im App Store laden

Kostenloser Download · iPhone und iPad · iOS 16.4 oder neuer