M4A ou WAV pour enregistrer la voix
Pour enregistrer une voix humaine, M4A est presque toujours la bonne réponse, et le fichier pèse environ dix fois moins. WAV garde sa place dans un ensemble étroit de cas qu'il vaut la peine de connaître, ne serait-ce que pour reconnaître quand on n'en fait pas partie.
Ce que sont réellement ces deux formats
WAV est un conteneur d'audio non compressé, en général du PCM linéaire. Chaque échantillon est stocké tel quel. Rien n'est jeté, rien n'est modélisé, et la taille est de l'arithmétique pure : fréquence × profondeur de bits × canaux × secondes. Une minute en 44,1 kHz, 16 bits, mono fait environ 5 Mo.
M4A est un conteneur — celui de MPEG-4 — qui sur iOS contient presque toujours de l'AAC. L'AAC est avec perte : il jette le détail qu'un modèle psychoacoustique prédit inaudible, et stocke le reste bien plus compactement. La même minute tombe autour de 0,5 Mo selon les réglages de l'encodeur.
Une confusion mérite d'être nommée : M4A est le conteneur, AAC est le codec. Un M4A peut aussi contenir de l'Apple Lossless, qui n'a aucune perte. Si une fiche technique dit seulement « M4A », elle a tu la moitié importante.
La compression avec perte abîme-t-elle la parole ?
Bien moins qu'on ne le croit. L'AAC a été conçu contre le fonctionnement de l'audition humaine, et la parole est son cas le plus facile : bande de fréquences étroite, source unique, forte redondance. Aux débits qu'utilise un enregistreur de téléphone, la différence sur un enregistrement de voix n'est pas quelque chose que vous entendrez sur une écoute réelle.
Ce qui dégrade vraiment un enregistrement de voix, dans l'ordre : la distance à l'orateur, la réverbération de la pièce, le bruit de fond et la saturation. Ces quatre facteurs écrasent le codec. Choisir WAV pour préserver la qualité alors qu'on est à trois mètres dans une pièce bruyante, c'est optimiser la seule variable qui n'est pas le problème.
Quand WAV est le bon choix
- Vous allez traiter l'audio en plusieurs étapes — réduction de bruit, puis égalisation, puis compression. Chaque réencodage avec perte cumule les artefacts ; travailler en WAV l'évite.
- Vous alimentez un outil ou une chaîne qui n'accepte que du PCM. Certains outils d'analyse et de médecine légale l'imposent.
- Vous avez besoin d'une édition à l'échantillon près ou d'une mesure exacte, plutôt que d'écouter.
- Une politique d'archivage exige un original non modifié, courant en recherche et en contexte juridique.
Le motif est clair : WAV est un format de travail et d'archive. M4A est un format de captation et de livraison. Si vous enregistrez une réunion, un cours, un entretien ou une note pour vous-même, vous captez et vous livrez.
Fréquence d'échantillonnage et canaux
La fréquence
La fréquence fixe la plus haute fréquence représentable : la moitié, en théorie. L'intelligibilité de la parole se joue en grande partie sous 8 kHz, si bien que même 16 kHz reste intelligible ; 22,05 kHz est largement clair ; 44,1 kHz capte avec marge tout ce que produit une voix. Passer à 48 kHz pour de la parole ne change essentiellement rien d'audible, et sert surtout au confort si l'audio part ensuite dans un montage vidéo qui tourne à 48 kHz.
Mono ou stéréo
Un téléphone qui enregistre une voix devrait enregistrer en mono. La stéréo double le fichier pour une image spatiale que personne n'attend d'un enregistrement parlé, et une captation à un seul micro n'a de toute façon pas de véritable information stéréo. Tout enregistreur vocal sérieux est mono pour cette raison.
Ce que Voice Studio enregistre
Voice Studio enregistre de l'AAC dans un fichier .m4a, en mono, avec trois niveaux de qualité : standard à 22,05 kHz, élevée à 44,1 kHz et ultra à 48 kHz. « Élevée » est la valeur par défaut et le bon choix pour à peu près tout enregistrement parlé. Il n'y a pas d'option WAV : elle multiplierait la taille par environ dix pour une différence que vous n'entendriez pas sur de la voix, donc nous ne l'avons pas ajoutée.
Le .m4a est un fichier ordinaire. Vous pouvez le partager depuis l'app ou l'atteindre par l'app Fichiers, et il s'ouvre partout : Musique, QuickTime, Audacity, un montage vidéo, Windows. Si vous avez un jour besoin de PCM pour une chaîne de traitement, convertir M4A en WAV se fait en une étape dans n'importe quel outil audio ; c'est le sens inverse qui perd quelque chose.
Questions fréquentes
M4A et AAC, est-ce la même chose ?
Pas tout à fait. M4A est le conteneur ; AAC est le codec qu'il contient normalement sur iOS. Un M4A peut aussi contenir de l'Apple Lossless, qui est sans perte.
Entendrai-je la différence entre M4A et WAV sur une voix ?
Sur de la parole, aux débits d'un enregistreur de téléphone, non — sur aucune écoute que vous pratiquez réellement. La distance, la pièce et le bruit de fond pèsent infiniment plus.
Voice Studio enregistre-t-il en WAV ?
Non. Il enregistre de l'AAC mono en .m4a à 22,05, 44,1 ou 48 kHz selon le réglage de qualité. Vous pouvez convertir le fichier exporté en WAV dans n'importe quel outil audio si un flux de travail réclame du PCM.
Quelle fréquence choisir pour la parole ?
« Élevée », à 44,1 kHz, est la valeur par défaut sensée. « Standard » à 22,05 kHz est parfaitement intelligible et plus légère ; « ultra » à 48 kHz sert surtout si l'audio part dans un montage vidéo à 48 kHz.
Essayer dans Voice Studio
Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.
Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure