Voice Studio

M4A ou WAV pour enregistrer la voix

Pour enregistrer une voix humaine, M4A est presque toujours la bonne réponse, et le fichier pèse environ dix fois moins. WAV garde sa place dans un ensemble étroit de cas qu'il vaut la peine de connaître, ne serait-ce que pour reconnaître quand on n'en fait pas partie.

Ce que sont réellement ces deux formats

WAV est un conteneur d'audio non compressé, en général du PCM linéaire. Chaque échantillon est stocké tel quel. Rien n'est jeté, rien n'est modélisé, et la taille est de l'arithmétique pure : fréquence × profondeur de bits × canaux × secondes. Une minute en 44,1 kHz, 16 bits, mono fait environ 5 Mo.

M4A est un conteneur — celui de MPEG-4 — qui sur iOS contient presque toujours de l'AAC. L'AAC est avec perte : il jette le détail qu'un modèle psychoacoustique prédit inaudible, et stocke le reste bien plus compactement. La même minute tombe autour de 0,5 Mo selon les réglages de l'encodeur.

Une confusion mérite d'être nommée : M4A est le conteneur, AAC est le codec. Un M4A peut aussi contenir de l'Apple Lossless, qui n'a aucune perte. Si une fiche technique dit seulement « M4A », elle a tu la moitié importante.

La compression avec perte abîme-t-elle la parole ?

Bien moins qu'on ne le croit. L'AAC a été conçu contre le fonctionnement de l'audition humaine, et la parole est son cas le plus facile : bande de fréquences étroite, source unique, forte redondance. Aux débits qu'utilise un enregistreur de téléphone, la différence sur un enregistrement de voix n'est pas quelque chose que vous entendrez sur une écoute réelle.

Ce qui dégrade vraiment un enregistrement de voix, dans l'ordre : la distance à l'orateur, la réverbération de la pièce, le bruit de fond et la saturation. Ces quatre facteurs écrasent le codec. Choisir WAV pour préserver la qualité alors qu'on est à trois mètres dans une pièce bruyante, c'est optimiser la seule variable qui n'est pas le problème.

Quand WAV est le bon choix

Le motif est clair : WAV est un format de travail et d'archive. M4A est un format de captation et de livraison. Si vous enregistrez une réunion, un cours, un entretien ou une note pour vous-même, vous captez et vous livrez.

Fréquence d'échantillonnage et canaux

La fréquence

La fréquence fixe la plus haute fréquence représentable : la moitié, en théorie. L'intelligibilité de la parole se joue en grande partie sous 8 kHz, si bien que même 16 kHz reste intelligible ; 22,05 kHz est largement clair ; 44,1 kHz capte avec marge tout ce que produit une voix. Passer à 48 kHz pour de la parole ne change essentiellement rien d'audible, et sert surtout au confort si l'audio part ensuite dans un montage vidéo qui tourne à 48 kHz.

Mono ou stéréo

Un téléphone qui enregistre une voix devrait enregistrer en mono. La stéréo double le fichier pour une image spatiale que personne n'attend d'un enregistrement parlé, et une captation à un seul micro n'a de toute façon pas de véritable information stéréo. Tout enregistreur vocal sérieux est mono pour cette raison.

Ce que Voice Studio enregistre

Voice Studio enregistre de l'AAC dans un fichier .m4a, en mono, avec trois niveaux de qualité : standard à 22,05 kHz, élevée à 44,1 kHz et ultra à 48 kHz. « Élevée » est la valeur par défaut et le bon choix pour à peu près tout enregistrement parlé. Il n'y a pas d'option WAV : elle multiplierait la taille par environ dix pour une différence que vous n'entendriez pas sur de la voix, donc nous ne l'avons pas ajoutée.

Le .m4a est un fichier ordinaire. Vous pouvez le partager depuis l'app ou l'atteindre par l'app Fichiers, et il s'ouvre partout : Musique, QuickTime, Audacity, un montage vidéo, Windows. Si vous avez un jour besoin de PCM pour une chaîne de traitement, convertir M4A en WAV se fait en une étape dans n'importe quel outil audio ; c'est le sens inverse qui perd quelque chose.

Questions fréquentes

M4A et AAC, est-ce la même chose ?

Pas tout à fait. M4A est le conteneur ; AAC est le codec qu'il contient normalement sur iOS. Un M4A peut aussi contenir de l'Apple Lossless, qui est sans perte.

Entendrai-je la différence entre M4A et WAV sur une voix ?

Sur de la parole, aux débits d'un enregistreur de téléphone, non — sur aucune écoute que vous pratiquez réellement. La distance, la pièce et le bruit de fond pèsent infiniment plus.

Voice Studio enregistre-t-il en WAV ?

Non. Il enregistre de l'AAC mono en .m4a à 22,05, 44,1 ou 48 kHz selon le réglage de qualité. Vous pouvez convertir le fichier exporté en WAV dans n'importe quel outil audio si un flux de travail réclame du PCM.

Quelle fréquence choisir pour la parole ?

« Élevée », à 44,1 kHz, est la valeur par défaut sensée. « Standard » à 22,05 kHz est parfaitement intelligible et plus légère ; « ultra » à 48 kHz sert surtout si l'audio part dans un montage vidéo à 48 kHz.

Essayer dans Voice Studio

Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.

Télécharger dans l’App Store

Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure