Voice Studio

Kann ein Transkript teils lokal und teils in der Cloud entstehen?

Ja, und bei allem, was länger als ein kurzer Clip ist, ist das der Normalfall statt der Ausnahme. Lokal oder Cloud wird meist als eine Entscheidung beschrieben, die eine Aufnahme einmal trifft. Bei einer Aufnahme von einiger Länge ist es eine Entscheidung, die immer wieder getroffen wird, einmal pro Abschnitt Audio — was bedeutet, dass das fertige Transkript ein Flickwerk sein kann, ohne dass die Nähte je auffallen.

Die meisten Erklärungen zu lokal gegen Cloud — auch die auf dieser Seite — beschreiben etwas, das einer Aufnahme widerfährt: Der lokale Durchgang wird versucht, und entweder er gelingt, oder die Anfrage fällt zurück auf Apples Server. Dieser Rahmen stimmt für eine kurze Sprachnotiz, in einem Durchgang transkribiert. Er hört still auf, das ganze Bild zu sein, sobald eine Aufnahme lang genug ist, um aufgeteilt zu werden, bevor sie überhaupt bei der Erkennung ankommt.

Eine lange Aufnahme ist keine einzige Anfrage

Spracherkennung unter iOS ist nicht dafür gebaut, eine Stunde Audio zu nehmen und in einem einzigen Rundgang eine Stunde Text zurückzugeben. Was auf Apples Sprachframework aufbaut, arbeitet längeres Audio in Abschnitten ab und reicht jeden als eigene Erkennungsanfrage ein. Eine dreiminütige Sprachnotiz kann ein einziger Abschnitt sein. Eine Vorlesung, ein Interview oder alles, was länger läuft, sind mehrere, nacheinander verarbeitet.

Dieses Detail zählt hier genau deshalb, weil die Regel, die zwischen lokal und Server entscheidet, nicht einmal für die ganze Aufnahme gilt — sie gilt einzeln, für jeden Abschnitt. Jeder bekommt seinen eigenen Versuch, Sprache lokal zu erkennen, und jeder kann auf einem anderen Weg landen als sein Nachbar.

Was einen Abschnitt zum Server schickt, während ein anderer lokal bleibt

Die Wiederholungsregel ist dieselbe, die eine kurze Aufnahme regelt: Erst wird lokale Erkennung versucht, und nur wenn dieser Versuch nichts Brauchbares zurückgibt oder einen Fehler wirft, wird dasselbe Audio mit abgeschalteter lokaler Erkennung erneut versucht — das ist der Weg, der es zu Apples Sprachdienst schickt. Wendet man das abschnittsweise an, folgt das Ergebnis ganz natürlich daraus, was tatsächlich in jedem Stück Audio steckt. Ein Abschnitt voller klarer, durchgehender Sprache gelingt meist lokal, und die Rückfalllogik greift nie. Ein Abschnitt, der überwiegend Stille ist, entferntes Rauschen, eine Salve Statisches oder Sprache in einer Sprache, für die das lokale Modell nicht gebaut wurde, ist genau die Art Audio, die leer zurückkommt — und leer ist die einzige Bedingung, die den erneuten Versuch auslöst.

Nichts davon braucht irgendetwas Ungewöhnliches an der Aufnahme. Es passiert mitten in einer gewöhnlichen Besprechung, die eine ruhige Phase hat, während Leute Platz nehmen, in einer Vorlesung mit einer langen Pause für Fragen, oder in einer Sprachnotiz, die mit etwas Herumfummeln beginnt, bevor jemand zu reden anfängt. Die Teile, die einem lokalen Modell leichtfallen, laufen problemlos lokal durch. Die, die es nicht sind, sind genau die, die am Ende beim Server um Hilfe bitten — und eine einzige Aufnahme enthält ganz gewöhnlich beides.

Das fertige Transkript kann also wirklich gemischt sein

Legt man diese beiden Tatsachen zusammen, ist die Antwort auf die Frage im Titel keine Ausflucht — es ist das, was der Mechanismus tatsächlich tut. Eine vierzigminütige Aufnahme kann ihre ersten zehn Minuten vollständig lokal verarbeitet bekommen, einen zweiminütigen Abschnitt mit Umgebungsgeräusch in der Mitte, der auf den Server zurückfällt, und den Rest wieder lokal — alles innerhalb eines Transkripts, das man als einen durchgehenden Text liest. Es gibt keine Regel, die eine Aufnahme zwingt, sich für den einen oder den anderen Weg zu entscheiden. Die beiden Wege haben sich auf Ebene der ganzen Datei nie ausgeschlossen — nur auf Ebene eines einzelnen Abschnitts.

Warum das Transkript nicht zeigt, wo die Naht ist

Hier wird es wirklich schwer, im Nachhinein nachzuvollziehen. Ein fertiges Transkript liest sich als ein durchgehender Text, weil die App genau das tut, was man sich wünschen würde: die Abschnitte der Reihe nach zusammenzunähen und die Worte zu zeigen, nicht die Mechanik dahinter. Es gibt kein Merkmal, keinen Farbwechsel, keinen Hinweis in einer exportierten TXT- oder JSON-Datei, der einen Satz aus einem lokalen Durchgang von einem aus einem Server-Wiederholungsversuch unterscheidet. Beide kommen über denselben Aufruf an und werden gleich angezeigt — bis man das Ergebnis liest, sehen der Teil der Aufnahme, der ganz auf dem Telefon blieb, und der Teil, der Apples Server berührt hat, identisch aus.

Das bedeutet auch, dass eine Stichprobe nicht die ganze Datei klärt. Einen Teil einer langen Aufnahme im Flugmodus zu testen — oder zu bemerken, dass der Großteil des Transkripts schnell zurückkam, ein grobes Zeichen für einen lokalen Durchgang — sagt etwas über den getesteten Teil aus, nicht über einen zweiminütigen Geräuschabschnitt zwanzig Minuten später, der nie geprüft wurde.

Was das an der Denkweise darüber ändert

Was der Flugmodus hier wirklich garantiert

Das Netz vor dem Transkribieren abzuschalten lässt nicht jeden Abschnitt gelingen — ein Abschnitt, der den Server gebraucht hätte, um etwas Brauchbares zurückzugeben, scheitert weiterhin, genau wie er offline bei einer kurzen Aufnahme scheitern würde. Was es garantiert, ist enger gefasst und trotzdem etwas wert: Ohne verfügbare Netzroute hat kein Abschnitt, an keiner Stelle der Datei, irgendwohin, um sein Audio zu schicken. Man tauscht die Worte, die nur der Server-Durchgang gerettet hätte, gegen die Gewissheit, dass aus keinem Teil der Aufnahme etwas hinausging. Für eine Aufnahme, bei der jedes Wort mehr zählt als diese Garantie, ist das ein echter Preis. Für eine, bei der die Garantie der Punkt ist, ist es die einzige Methode, die sie wirklich durchgehend liefert und nicht nur für eine Stichprobe.

Wie Voice Studio hier hineinpasst

Voice Studio nutzt Apples Sprachframework genau so, wie hier beschrieben: lokale Erkennung wird zuerst versucht, mit einem Wiederholungsversuch gegen Apples Server nur für das, was leer zurückkommt oder einen Fehler wirft, und lange Aufnahmen werden als mehr als eine Anfrage verarbeitet statt als eine. Das bedeutet, ein langes Transkript in der App kann eine echte Mischung sein — ein Teil ganz auf dem Telefon entstanden, ein Teil erst nach einem Wiederholungsversuch, der Apples Sprachdienst erreichte —, ohne dass irgendetwas in der Oberfläche der App oder in ihrem TXT- oder JSON-Export markiert, welcher Satz aus welchem Durchgang stammt, weil die App selbst diesen Unterschied auch nicht mitverfolgt. Voice Studio hat kein Konto, keinen eigenen Server und kein Analyse-SDK, also ist Apples Sprachdienst der einzige Ort, an den überhaupt Audio gehen kann; braucht eine bestimmte Aufnahme eine Garantie, die die ganze Datei abdeckt statt nur eine Stichprobe, ist sie im Flugmodus zu transkribieren aus den oben genannten Gründen der einzige Weg dorthin.

Häufige Fragen

Wird eine lange Aufnahme auf einmal in die Cloud geschickt, oder in Stücken?

In Stücken. Langes Audio wird in Abschnitten verarbeitet, und jeder Abschnitt wird für sich zur Erkennung eingereicht — auch deshalb entscheidet jeder unabhängig von den anderen zwischen lokal und Server.

Wenn der Großteil meiner Aufnahme schnell transkribiert wurde, bedeutet das, dass nichts den Server erreicht hat?

Nicht unbedingt. Eine Aufnahme kann überwiegend klare Sprache sein, die in Sekunden lokal transkribiert wird, und trotzdem einen kurzen Abschnitt mit Geräusch oder Stille enthalten, der leer zurückkam und einen Wiederholungsversuch nur für diesen Abschnitt auslöste.

Kann ich im Nachhinein erkennen, welche Sätze eines Transkripts von welchem Weg stammen?

Nein. Der fertige Text sieht in beiden Fällen identisch aus, und nichts in der Oberfläche der App oder in einem exportierten TXT oder JSON markiert, welcher Abschnitt lokal entstand und welcher durch den Server-Wiederholungsversuch.

Garantiert Transkribieren im Flugmodus, dass aus einer langen Aufnahme nichts irgendwohin geschickt wurde?

Ja, für die gesamte Datei, weil kein Abschnitt eine Netzroute nutzen kann. Der Preis dafür ist, dass Abschnitte, die den Server gebraucht hätten, einfach leer zurückkommen statt mit Text.

In Voice Studio ausprobieren

Voice Studio nimmt auf, transkribiert im iPhone selbst und legt jede Notiz nach Zeit und Ort ab — damit der Gedanke aus dem Auto auch nächsten Monat noch auffindbar ist.

Im App Store laden

Kostenloser Download · iPhone und iPad · iOS 16.4 oder neuer