Pourquoi ma transcription iPhone est-elle vide ?
Réponse courte : l'audio est intact, mais la reconnaissance vocale n'en a rien tiré, deux fois si l'app retente sur le serveur quand la passe locale échoue. Une transcription vide signale un échec de reconnaissance, pas un enregistrement abîmé.
C'est une frustration bien particulière : vous relancez l'enregistrement, l'audio est là, on entend clairement les gens parler, et la transcription en dessous est vide, ou s'arrête après une ligne. Avant de chercher à réparer quoi que ce soit, il faut savoir que c'est un problème de reconnaissance, pas d'enregistrement. Le fichier .m4a et la transcription sont deux choses produites par deux étapes distinctes, et la seconde peut échouer pendant que la première fonctionne parfaitement.
Ce que « transcrire » recouvre réellement
Sur iPhone, transcrire n'est pas quelque chose qu'une app construit elle-même : elle confie l'audio au framework Speech d'Apple et récupère du texte, ou pas. Ce framework tente d'abord la reconnaissance sur l'appareil, avec un modèle de langue déjà présent sur le téléphone. Si cette passe revient vide ou plante, l'étape suivante habituelle est de réessayer avec la reconnaissance locale désactivée, ce qui envoie l'audio au service vocal d'Apple. Si les deux tentatives ne donnent rien, la transcription obtenue est vide — non pas parce que l'app a abandonné, mais parce qu'aucune des deux tentatives de reconnaissance n'a réussi sur cet audio.
Ce sont deux chances pour le fichier d'échouer, pas une seule. Un résultat vide signifie que les deux ont échoué, ce qui restreint déjà pas mal les causes possibles.
Les raisons les plus courantes des deux échecs
L'audio est trop faible ou trop lointain
Les modèles de reconnaissance ont besoin d'un signal vocal exploitable, pas seulement techniquement présent. Un téléphone enregistré depuis l'autre bout d'une grande salle, dans une poche, ou avec le micro couvert peut produire un audio qui, à l'oreille humaine, ressemble à une parole faible mais audible, et pour un modèle entraîné sur de l'audio plus propre, à du bruit dans sa majeure partie. Vous distinguez les mots parce que vous savez ce qui a été dit ; le modèle n'a pas cette longueur d'avance.
L'enregistrement est surtout du silence ou du son non vocal
Un fichier où les trois minutes intéressantes sont entourées de vingt minutes de bruit de fond, de frappe au clavier, ou de quelqu'un posant le téléphone, reste techniquement un enregistrement contenant de la voix. Certaines implémentations traitent le fichier entier et peuvent ne rien renvoyer si le rapport entre parole exploitable et le reste est trop faible, ou si la parole tombe justement dans une portion traitée comme du silence.
La langue de transcription ne correspond pas à ce qui a réellement été dit
La reconnaissance vocale se configure par langue, et c'est réellement une étape de reconnaissance, pas de traduction : pointer un reconnaisseur anglais sur un enregistrement en français ne produit pas de texte en français, il ne produit quasiment rien, parce que le modèle compare des motifs sonores à un vocabulaire auquel ces mots n'appartiennent pas. Si un enregistrement mélange les langues, ou si la mauvaise langue a été sélectionnée avant de transcrire, un résultat vide ou quasi vide est attendu, ce n'est pas un bug.
Le modèle de langue local n'a jamais vraiment été installé
La reconnaissance sur l'appareil dépend d'un modèle de langue qui doit, à un moment donné, être téléchargé sur le téléphone — il n'est pas fourni automatiquement avec iOS pour toutes les langues prises en charge. Si ce modèle manque et que le téléphone est hors ligne au moment de transcrire, il n'y a pas non plus de serveur vers lequel se replier, et le résultat est vide pour une raison qui n'a rien à voir avec l'enregistrement lui-même.
Ce qu'il faut réellement vérifier
- Relisez l'enregistrement à un moment où vous savez que quelqu'un parlait, et jugez honnêtement à quel point c'est audible par rapport au bruit de fond — pas si vous comprenez les mots, puisque vous les connaissez déjà.
- Vérifiez que la langue de transcription correspond à la langue réellement parlée dans l'enregistrement, surtout si vous enregistrez dans plusieurs langues.
- Vérifiez que vous avez une connexion réseau au moment de transcrire. Si le modèle local pour cette langue n'est pas installé, le repli sur le serveur est la seule voie restante, et elle a besoin d'être en ligne pour fonctionner.
- Essayez de transcrire un court extrait clairement articulé dans la même langue. Si celui-ci revient vide aussi, le problème vient de la langue ou de la configuration, pas de cet enregistrement précis.
Ce que relancer la transcription répare, et ce que ça ne répare pas
Relancer la même transcription sans rien changer d'autre donnera probablement le même résultat vide : l'audio n'a pas changé, et le modèle qui l'examine non plus. Ce qui peut changer le résultat, c'est de repasser en ligne si vous étiez hors ligne auparavant, puisque cela ouvre le repli serveur indisponible la première fois. Rapprocher le téléphone la prochaine fois, ou choisir la bonne langue, corrige les futurs enregistrements mais ne fait rien pour un audio déjà enregistré trop faible pour être reconnu.
Un enregistrement qui n'a pas pu être transcrit n'a rien perdu. Le fichier audio reste intact dans tous les cas, et il est toujours là pour être relu, partagé, ou retranscrit plus tard une fois que la langue ou la situation réseau a changé.
Comment Voice Studio gère cela
Voice Studio transcrit via le framework Speech d'Apple de la même façon : d'abord sur l'appareil, et seulement si cette passe revient vide ou plante, il retente avec la reconnaissance locale désactivée, en envoyant l'audio au serveur d'Apple si vous êtes en ligne. Une transcription vide signifie ici que les deux tentatives n'ont rien trouvé, le plus souvent à cause d'un audio faible ou lointain, d'une langue mal choisie, ou d'une absence de réseau pour atteindre le repli. L'enregistrement lui-même n'est jamais touché par une transcription échouée — il reste exactement tel qu'enregistré, et vous pouvez retenter la transcription une fois que ce qui a causé l'échec a changé.
Questions fréquentes
Une transcription vide signifie-t-elle que le fichier d'enregistrement est corrompu ?
Non. L'audio et la transcription sont produits par des étapes distinctes. Une transcription vide signifie que la reconnaissance vocale n'a pas trouvé de parole exploitable dans l'audio — l'enregistrement se relit exactement comme il a été capturé.
Relancer la transcription du même enregistrement donnera-t-il un résultat différent ?
Généralement non, sauf si autre chose a changé — par exemple le téléphone est maintenant en ligne alors qu'il ne l'était pas avant, ce qui ouvre le repli serveur que la reconnaissance locale seule ne pouvait pas utiliser.
Choisir une autre langue de transcription peut-il corriger un résultat vide ?
Seulement si la langue sélectionnée à l'origine était la mauvaise. Si elle correspond déjà à ce qui a réellement été dit, en changer n'aidera pas et empirera généralement le résultat.
Une transcription vide prend-elle le même temps qu'une transcription réussie ?
La reconnaissance doit tout de même traiter l'audio pour déterminer qu'il n'y a rien d'exploitable, donc une tentative échouée n'est pas forcément plus rapide qu'une tentative réussie sur un enregistrement de même durée.
Essayer dans Voice Studio
Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.
Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure