Voice Studio

M4A oder WAV für Sprachaufnahmen

Für die Aufnahme einer menschlichen Stimme ist M4A fast immer die richtige Antwort, und die Datei ist grob ein Zehntel so groß. WAV hat seinen Platz in einer schmalen Gruppe von Fällen, die man kennen sollte — schon um zu merken, wenn man nicht darin steckt.

Was die beiden Formate wirklich sind

WAV ist ein Container für unkomprimiertes Audio, meist lineares PCM. Jeder Abtastwert wird so gespeichert, wie er ist. Nichts wird verworfen, nichts modelliert, und die Größe ist reine Arithmetik: Abtastrate × Bittiefe × Kanäle × Sekunden. Eine Minute mit 44,1 kHz, 16 Bit, Mono sind rund 5 MB.

M4A ist ein Container — der von MPEG-4 — der unter iOS fast immer AAC enthält. AAC ist verlustbehaftet: Es verwirft Details, die ein psychoakustisches Modell als unhörbar vorhersagt, und speichert den Rest weit kompakter. Dieselbe Minute landet je nach Encoder-Einstellung bei etwa 0,5 MB.

Eine verbreitete Verwechslung sei benannt: M4A ist der Container, AAC der Codec. Ein M4A kann auch Apple Lossless enthalten, das gar nicht verlustbehaftet ist. Steht in einem Datenblatt nur „M4A", ist die wichtigere Hälfte ungesagt geblieben.

Schadet verlustbehaftete Kompression der Sprache?

Weit weniger, als man annimmt. AAC wurde entlang der Funktionsweise des menschlichen Gehörs entworfen, und Sprache ist sein leichtester Fall: schmaler Frequenzbereich, eine Quelle, hohe Redundanz. Bei den Datenraten, die ein Telefonrekorder verwendet, ist der Unterschied an einer Sprachaufnahme nichts, was Sie in einer realen Wiedergabesituation hören.

Was eine Sprachaufnahme wirklich verschlechtert, der Reihe nach: Entfernung zur sprechenden Person, Raumhall, Störgeräusche und Übersteuerung. Alle vier stellen den Codec in den Schatten. WAV zu wählen, um die Qualität zu schützen, während man drei Meter entfernt in einem lauten Raum sitzt, optimiert die einzige Variable, die nicht das Problem ist.

Wann WAV richtig ist

Das Muster: WAV ist ein Arbeits- und Archivformat. M4A ist ein Aufnahme- und Auslieferungsformat. Wenn Sie eine Besprechung, eine Vorlesung, ein Interview oder eine Notiz an sich selbst aufnehmen, nehmen Sie auf und liefern aus.

Abtastrate und Kanäle

Abtastrate

Die Rate legt die höchste darstellbare Frequenz fest — theoretisch die Hälfte. Die Verständlichkeit von Sprache spielt sich weitgehend unter 8 kHz ab, weshalb selbst 16 kHz verständlich bleibt; 22,05 kHz klingt bequem klar; 44,1 kHz erfasst mit Reserve alles, was eine Stimme hervorbringt. Der Schritt auf 48 kHz ändert bei gesprochener Sprache im Hörbaren praktisch nichts und bringt vor allem Bequemlichkeit, wenn das Audio später in eine Videospur mit 48 kHz wandert.

Mono oder Stereo

Ein Telefon, das eine Stimme aufnimmt, sollte in Mono aufnehmen. Stereo verdoppelt die Datei für ein Raumbild, das bei einer gesprochenen Aufnahme niemand will, und eine Aufnahme mit einem einzigen Mikrofon hat ohnehin keine echte Stereoinformation. Jeder ernsthafte Sprachrekorder ist deshalb Mono.

Was Voice Studio aufnimmt

Voice Studio nimmt AAC in einer .m4a-Datei auf, in Mono, mit drei Qualitätsstufen: Standard mit 22,05 kHz, Hoch mit 44,1 kHz und Ultra mit 48 kHz. „Hoch" ist die Voreinstellung und für praktisch jede gesprochene Aufnahme die richtige Wahl. Eine WAV-Option gibt es nicht: Sie würde die Dateigröße etwa verzehnfachen für einen Unterschied, den Sie bei Sprache nicht hören würden — also haben wir sie nicht eingebaut.

Die .m4a ist eine ganz normale Datei. Sie können sie aus der App heraus teilen oder über die Dateien-App erreichen, und sie öffnet sich überall: Musik, QuickTime, Audacity, ein Videoschnittprogramm, Windows. Falls Sie doch einmal PCM für eine Bearbeitungskette brauchen, ist M4A nach WAV in jedem Audiowerkzeug ein Ein-Schritt-Vorgang; die Gegenrichtung ist die, die etwas verliert.

Häufige Fragen

Sind M4A und AAC dasselbe?

Nicht ganz. M4A ist der Container; AAC ist der Codec, der unter iOS normalerweise darin steckt. Ein M4A kann auch Apple Lossless enthalten, das verlustfrei ist.

Höre ich bei einer Sprachaufnahme den Unterschied zwischen M4A und WAV?

Bei Sprache und den Datenraten eines Telefonrekorders nicht — in keiner Wiedergabe, die Sie tatsächlich nutzen. Entfernung, Raum und Störgeräusche wiegen weit schwerer.

Nimmt Voice Studio in WAV auf?

Nein. Es nimmt Mono-AAC in .m4a mit 22,05, 44,1 oder 48 kHz auf, je nach Qualitätseinstellung. Die exportierte Datei lässt sich in jedem Audiowerkzeug nach WAV wandeln, falls ein Arbeitsablauf PCM verlangt.

Welche Abtastrate soll ich für Sprache nehmen?

„Hoch" mit 44,1 kHz ist die vernünftige Voreinstellung. „Standard" mit 22,05 kHz ist einwandfrei verständlich und kleiner; „Ultra" mit 48 kHz hilft vor allem, wenn das Audio in eine 48-kHz-Videospur geht.

In Voice Studio ausprobieren

Voice Studio nimmt auf, transkribiert im iPhone selbst und legt jede Notiz nach Zeit und Ort ab — damit der Gedanke aus dem Auto auch nächsten Monat noch auffindbar ist.

Im App Store laden

Kostenloser Download · iPhone und iPad · iOS 16.4 oder neuer