Enregistrer en meilleure qualité améliore-t-il la précision de la transcription ?
Réponse courte : à peine, et souvent pas du tout. Le réglage de qualité change surtout la taille du fichier, pas ce que reçoit le moteur de reconnaissance vocale. Ce qui rend vraiment une transcription meilleure ou pire se joue ailleurs.
C'est une hypothèse raisonnable si l'on vient de la photo : une image en plus haute résolution rend la reconnaissance de texte plus fiable, donc un enregistrement de meilleure qualité devrait rendre la reconnaissance vocale plus fiable aussi. Pour l'audio et la parole, cette hypothèse ne tient presque jamais, et il vaut la peine de savoir pourquoi avant de choisir une qualité pour la mauvaise raison.
Ce qu'un réglage de qualité change vraiment
Sur un enregistreur de téléphone proposant plusieurs niveaux de qualité, ce qui bouge généralement entre eux, c'est la fréquence d'échantillonnage — le nombre de fois par seconde où le signal du microphone est mesuré. Les trois niveaux de Voice Studio sont standard à 22,05 kHz, haute à 44,1 kHz et ultra à 48 kHz, toujours en AAC mono. Monter d'un niveau capture une tranche plus large du spectre audible et produit un fichier plus lourd. Cela ne change pas le schéma de compression, et cela n'ajoute aucune information qui n'était pas déjà présente dans la pièce.
Où vit vraiment l'information dont une transcription a besoin
L'intelligibilité de la parole se situe surtout en dessous d'environ 8 kHz — consonnes, voyelles et hauteur d'une voix tiennent largement sous ce plafond. Même le plus bas des trois réglages, à 22,05 kHz, se situe confortablement au-dessus du point où la parole devient claire, car la fréquence d'échantillonnage doit être environ le double de la fréquence la plus haute qui compte. Concrètement : au moment de choisir entre standard, haute et ultra, la partie du signal à partir de laquelle une transcription est construite est déjà entièrement présente dans les trois. Monter en qualité capture davantage de détails de la pièce, pas davantage de la voix.
Ce qui détermine vraiment la qualité d'une transcription
Deux choses distinctes décident du résultat d'une transcription, et aucune n'est le curseur de qualité.
Si la reconnaissance s'est faite sur l'appareil ou sur le serveur d'Apple
La reconnaissance vocale sur iOS tente d'abord la voie locale et, dans de nombreuses mises en œuvre, retente contre le serveur d'Apple si cette passe revient vide ou échoue. La voie choisie dépend de la couverture linguistique et du fait que le modèle local de cette langue ait été téléchargé sur le téléphone, pas de la façon dont l'audio a été encodé. Un enregistrement en qualité standard dans une langue avec un bon modèle local se transcrit exactement aussi bien qu'un enregistrement en qualité ultra.
Ce qu'il y a réellement dans l'audio
C'est la partie qu'un réglage de qualité ne peut pas corriger. La distance par rapport à la personne qui parle, le bruit de fond, un microphone mal placé, des voix qui se chevauchent et un audio saturé parce qu'on a parlé trop près ou trop fort dégradent tous ce que reçoit le moteur de reconnaissance — et aucun de ces éléments n'a de lien avec la fréquence d'échantillonnage. Une pièce calme avec le téléphone à quinze centimètres de la bouche de quelqu'un, en qualité standard, transcrira mieux qu'un café bruyant enregistré en ultra, à chaque fois.
Alors, quelle qualité choisir si l'objectif est de transcrire
Haute est un réglage par défaut raisonnable pour presque tout enregistrement de parole — largement au-delà du point où la clarté de la voix serait limitée par quoi que ce soit que fait l'encodeur. Si l'espace de stockage est vraiment serré, passer en standard ne coûte rien qu'une transcription aurait utilisé ; la plage de fréquences capturée couvre déjà ce dont la parole a besoin. Ultra ne rendra pas une transcription plus précise. Ce réglage vaut la peine seulement si vous voulez la copie la plus fidèle possible de l'audio lui-même, pour une autre raison — ce n'est pas un réglage pensé pour la transcription.
Comment fonctionne le réglage de qualité dans Voice Studio
Le réglage de qualité — standard, haute ou ultra — est gratuit, il ne fait pas partie des quelques fonctions réservées à Pro. La transcription tente toujours d'abord la voie locale et ne recourt au serveur d'Apple que si cette passe revient vide ou échoue, quel que soit le niveau de qualité utilisé à l'enregistrement. Si une transcription sort moins bonne que prévu, ce qui mérite d'être vérifié, c'est où était posé le téléphone pendant l'enregistrement, pas quel niveau de qualité était sélectionné.
Questions fréquentes
Enregistrer en qualité ultra donne-t-il une transcription plus précise qu'en haute ?
Non, pas de façon significative. La reconnaissance vocale travaille à partir d'une plage de fréquences que les deux réglages couvrent largement. Ultra donne un fichier plus lourd, pas une transcription plus claire.
Qu'est-ce qui dégrade vraiment une transcription ?
La distance par rapport à la personne qui parle, le bruit de fond, les voix qui se chevauchent et un audio saturé par une voix trop proche ou trop forte. Tout cela compte bien plus que le réglage de qualité.
Dois-je utiliser la qualité standard si seule la transcription m'intéresse, pour économiser de l'espace ?
C'est un choix raisonnable. La qualité standard se situe déjà au-dessus de la plage de fréquences dont la reconnaissance vocale a besoin, donc vous ne sacrifiez pas la transcription, seulement la taille du fichier.
Une fréquence d'échantillonnage plus élevée aide-t-elle iOS à utiliser la reconnaissance locale plutôt que de recourir au serveur ?
Non. Ce choix dépend de la couverture linguistique et du téléchargement du modèle local pour cette langue sur le téléphone, pas de la façon dont l'enregistrement a été encodé.
Essayer dans Voice Studio
Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.
Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure