Mehrere Transkripte von Sprachnotizen zu einem Dokument zusammenführen
Eine Transkriptions-App transkribiert eine Aufnahme nach der anderen, weil das die Einheit ist, die sie tatsächlich hat — das Audio, das in einem durchgehenden Take eingefangen wurde. Wenn Sie eigentlich eine Woche Tagebuch, oder beide Hälften eines Interviews, als ein einziges Stück lesen wollen, ist das Text — und Text lässt sich zusammenführen. Er tut es nur nicht von selbst.
Das kommt öfter vor, als das Wort „Zusammenführen" vermuten lässt. Selten ist es eine Aufnahme, die sich rätselhaft in zwei geteilt hat. Häufiger sind es mehrere Aufnahmen, die immer schon getrennt waren — eine zweite Interviewsitzung an einem anderen Tag, eine Vorlesungsreihe, in der jede Vorlesung ihre eigene Datei ist, ein Projekt, zu dem Sie seit einer Woche Sprachnotizen aufnehmen — und die Sie erst im Nachhinein als ein Dokument gelesen haben möchten, statt als ein Regal einzeln benannter Einträge.
Wann es wirklich mehrere Aufnahmen sind — und keine kaputte
Das lohnt sich präzise zu klären, weil es ändert, wonach Sie suchen. Eine einzelne, durchgehende Aufnahme, die von einem Anruf unterbrochen wird, muss nicht zusammengeführt werden — die App pausiert bei der Unterbrechung und setzt in derselben Datei fort, sodass Sie eine Aufnahme mit einer Lücke bekommen, nicht zwei. Zwei getrennte Dateien für das, was sich wie eine Sitzung anfühlte, hat meist einen konkreten Grund: Speicher oder Akku sind mittendrin ausgegangen, und der Rest musste eine frische Aufnahme werden, sobald das behoben war, oder eine Anrufunterbrechung traf einen Moment, aus dem sich wirklich nicht fortsetzen ließ. Wenn Ihnen gerade eines davon passiert ist, lohnt es sich, das eigenständig nachzulesen. Hier auf dieser Seite geht es um den weit häufigeren Fall: Aufnahmen, die nie ein einziger Take waren und die Sie trotzdem jetzt zu einem Dokument zusammenstellen wollen.
Es gibt keine Massenzusammenführung, und das ist in Ordnung
Keine Recorder-App beobachtet, welche Aufnahmen zusammengehören, und bietet an, ihre Transkripte zu verweben — das würde erfordern zu erraten, welche zusammengehören, und das ist ein Urteil, das nur Sie fällen können. Was jede Aufnahme aber hat, ist ein Transkript, das Sie als reinen Text herausholen können, und reinen Text zu einem Dokument zusammenzustellen ist mit Werkzeugen, die Sie bereits haben, eine Sache von fünf Minuten — keine fehlende Funktion.
Jedes Transkript korrigieren, bevor Sie sie zusammenführen — nicht danach
Das zuerst erledigen, denn es ist deutlich mühsamer, sobald mehrere Transkripte schon in einem Dokument zusammengefügt sind. Spracherkennung hat kein Gedächtnis zwischen Aufnahmen — ein Name, den sie am Montag falsch verstand, wird am Donnerstag frisch neu geraten, und es gibt keinen Grund anzunehmen, dass dabei zweimal dieselbe falsche Schreibweise herauskommt. Lesen Sie jedes Transkript für sich und korrigieren Sie, was falsch ist, solange es noch eine einzelne Datei ist und Sie sich noch erinnern, was tatsächlich gesagt wurde; eine uneinheitliche Schreibweise desselben Namens über drei getrennte Transkripte hinweg zu entdecken, nachdem sie bereits ein Dokument sind, ist ein deutlich mühsameres Lesen.
Die Reihenfolge klären, bevor Sie irgendetwas einfügen
Chronologisch ist in fast jedem Fall, in dem das hier zutrifft, die richtige Standardwahl — ein Interview über mehrere Sitzungen, eine Woche Tagebuch, eine Vorlesungsreihe. Die Bibliothek nach Datum sortieren, um die tatsächliche Reihenfolge der Ereignisse zu sehen, statt sich auf die Erinnerung oder auf die Reihenfolge zu verlassen, in der die Aufnahmen zufällig auf dem Bildschirm stehen — die Reihenfolge, in der Sie aufgenommen haben, und die, in der Sie gerade hinschauen, sind nicht immer dieselbe.
Jede Aufnahme exportieren
Für ein Dokument, das gelesen werden soll, als TXT exportieren, nicht als JSON. Der TXT-Export stellt Titel, Datum, Uhrzeit und Ort bereits über das Transkript — dieser Kopf leistet hier über seinen ursprünglichen Zweck hinaus nützliche Arbeit, denn sobald mehrere Transkripte in einem Dokument zusammengefügt sind, ist er es, der zeigt, wo eine Aufnahme endet und die nächste beginnt. Behalten Sie ihn, statt ihn für eine sauber aussehende Seite zu entfernen.
Bei zwei oder drei Aufnahmen ist es die ganze Arbeit, jede einzeln über das Teilen-Menü zu exportieren und den Text nach und nach in eine Notiz- oder Dokument-App einzufügen. Bei einer längeren Reihe — eine ganze Vorlesungsreihe, ein Monat Tagebuch — ist es schneller, alles auf einmal über die Dateien-App herauszuziehen, als das Teilen-Menü Aufnahme für Aufnahme zu wiederholen, weil das alle exportierten Dateien an einem Ort liefert statt einzeln.
Das Dokument zusammenstellen
Jedes Transkript in der festgelegten Reihenfolge einfügen und seinen TXT-Kopf als Abschnittstrenner stehen lassen — so entsteht ein einziges Dokument, in dem „die Sitzung am Dienstag" und „die Sitzung am Donnerstag" beide sichtbar und zuordenbar bleiben, statt eines undifferenzierten Textblocks, der einmal zwei getrennte Aufnahmen war. Eine Leerzeile oder ein Trennstrich zwischen den Abschnitten reicht; mehr braucht ein Dokument nicht, dessen ganzer Zweck ist, in einem Zug gelesen zu werden.
Wann JSON die bessere Quelle ist
Von Hand einfügen ist das richtige Werkzeug für eine Handvoll Aufnahmen, die eine Person liest. Bauen Sie stattdessen etwas, das regelmäßig eine große Zahl von Transkripten verarbeiten muss — sie in eine Tabelle importieren, ein Skript füttern, das Ihnen das Dokument zusammenbaut —, ist JSON das dafür gemachte Format. Es hält Datum, Dauer und Transkript als getrennte Felder, die ein Programm zuverlässig sortieren und zusammenfügen kann, statt Text, den eine Person lesen und von Auge platzieren muss. Was davon richtig ist, hängt ganz davon ab, ob eine Person oder ein Programm zusammenstellt — nicht davon, welches Format „besser" wäre.
Was in einem zusammengeführten Dokument nicht erhalten bleibt
Ein während einer der ursprünglichen Aufnahmen gesetzter Marker ist eine Linie auf der Wellenform genau dieser Aufnahme, gedacht, um die Wiedergabe an einen Moment im Audio zurückzuspringen — er hat keine Entsprechung in reinem Text, taucht also nicht im Export auf und kann in einem Dokument, das aus mehreren zusammengefügten Exporten besteht, nicht auftauchen. Wenn ein während der Aufnahme markierter Moment im zusammengeführten Dokument erhalten bleiben soll, ist das eine handschriftliche Notiz, die Sie selbst beim Zusammenstellen hinzufügen — nichts, was den Export automatisch übersteht.
Das ist nicht dieselbe Aufgabe wie eine Vollsicherung
Eine Vollsicherung ist eine einzelne JSON-Datei, die die gesamte Bibliothek des Telefons abdeckt, gedacht, damit sich die ganze Bibliothek wiederherstellen lässt — nicht, damit sich eine Handvoll zusammengehöriger Aufnahmen als ein Dokument lesen lässt. Sie kennt keinen Zusammenhang zwischen Aufnahmen und ist nicht dazu gedacht, geöffnet und gelesen zu werden wie ein zusammengeführtes Dokument — sie ist eine Versicherung für den Tag, an dem das Telefon verloren geht, kein Abkürzungsweg dafür. Das Dokument zu bauen, das Sie eigentlich lesen wollen, bedeutet weiterhin, die relevanten Aufnahmen auszuwählen und einzeln zu exportieren, egal ob nebenher noch eine Vollsicherung läuft oder nicht.
Wie das bei Voice Studio aussieht
Es gibt keinen eingebauten Weg, mehrere Aufnahmen auszuwählen und ein zusammengeführtes Dokument zu exportieren — jede Aufnahme exportiert ihr Transkript für sich als TXT oder JSON, oder ihr Audio als die ursprüngliche .m4a, und die Bibliothek lässt sich nach neuestem Datum, nach Länge oder nach Wortzahl sortieren, um die Aufnahmen vor dem Start in die benötigte Reihenfolge zu bringen. Das Transkript bleibt bis zum Export bearbeitbar, sodass ein Namen in der Montagssitzung zu korrigieren, bevor sie neben der Donnerstagssitzung eingefügt wird, im Moment einen Augenblick kostet und später ein deutlich längeres Lesen erspart. Nichts davon braucht Pro — Export, und die Bearbeitung, die den Export erst lohnenswert macht, sind beide in der kostenlosen App enthalten.
Häufige Fragen
Kann ich mehrere Aufnahmen auswählen und ein zusammengeführtes Dokument exportieren?
Nein. Jede Aufnahme exportiert ihr Transkript oder ihr Audio für sich — als TXT, JSON oder die ursprüngliche .m4a. Mehrere zu einem Dokument zu verbinden bedeutet, jede einzeln zu exportieren und selbst zusammenzustellen, was bei einer Handvoll Aufnahmen eine kurze Aufgabe ist.
In welcher Reihenfolge sollten die Transkripte stehen?
Chronologisch, in fast jedem Fall, in dem das vorkommt — ein Interview über mehrere Sitzungen, eine Vorlesungsreihe, eine Folge von Tagebucheinträgen. Die Bibliothek nach Datum sortieren, statt sich auf die Reihenfolge zu verlassen, in der die Aufnahmen zufällig auf dem Bildschirm stehen.
Taucht ein während der Aufnahme gesetzter Marker im zusammengeführten Dokument auf?
Nein. Ein Marker ist eine Position auf der Wellenform genau dieser Aufnahme, gedacht, um die Wiedergabe dorthin zurückzuspringen — er hat keine Entsprechung in Text und taucht in keinem TXT- oder JSON-Export auf. Den Moment selbst notieren, wenn er im zusammengeführten Dokument erhalten bleiben soll.
Sollte ich die Vollsicherung nehmen, statt jede Aufnahme einzeln zu exportieren?
Nein. Die Vollsicherung ist ein einzelnes JSON, das die gesamte Bibliothek abdeckt, gedacht, um bei Verlust des Telefons alles wiederherzustellen — nicht, um eine Handvoll zusammengehöriger Aufnahmen zu einem lesbaren Dokument zusammenzustellen. Stattdessen die konkret benötigten Aufnahmen einzeln exportieren.
In Voice Studio ausprobieren
Voice Studio nimmt auf, transkribiert im iPhone selbst und legt jede Notiz nach Zeit und Ort ab — damit der Gedanke aus dem Auto auch nächsten Monat noch auffindbar ist.
Kostenloser Download · iPhone und iPad · iOS 16.4 oder neuer