Pourquoi ma transcription iPhone s'arrête-t-elle en plein milieu de l'enregistrement ?
Réponse courte : sur un enregistrement long, la reconnaissance vocale ne traite pas tout d'un seul bloc. Elle avance dans l'audio par segments, et un segment peut ne rien renvoyer alors que les précédents ont bien fonctionné — la transcription s'arrête donc simplement, en plein milieu de l'enregistrement, sans aucun message d'erreur.
Une transcription qui s'arrête est une panne d'un genre particulier et déroutant. Contrairement à une transcription vide, celle-ci a manifestement fonctionné — les premières minutes se lisent correctement, les noms sont exacts, le rythme semble normal — puis, en cours de route, plus rien. Aucune erreur, aucune nouvelle tentative, juste du silence là où il devrait y avoir du texte. On dirait que l'app a planté ou perdu le fil. Ce n'est généralement ni l'un ni l'autre.
Pourquoi un long enregistrement n'est pas reconnu comme un seul bloc
La reconnaissance vocale d'iOS — le même Speech framework que sollicite toute app de transcription sur iPhone — n'est pas conçue pour recevoir un fichier de quatre-vingt-dix minutes et renvoyer une seule réponse. L'audio long est traité par segments, et chaque segment est sa propre tentative de reconnaissance. Quand un segment réussit, son texte atterrit dans la transcription. Quand un segment échoue, il n'apporte simplement rien, et l'app continue avec la suite si elle le peut, ou s'arrête si elle ne le peut pas.
C'est la raison mécanique pour laquelle une transcription peut sembler complète un moment puis s'arrêter net. Ce n'est généralement pas un échec unique et catastrophique — c'est un segment, quelque part au milieu ou vers la fin, qui n'a rien renvoyé.
Pourquoi une nouvelle tentative ne règle pas ça toute seule
La reconnaissance sur l'appareil est tentée en premier, et ne bascule vers une tentative côté serveur que si le premier passage revient totalement vide ou lève une erreur. Cette logique de repli vérifie le résultat de la requête dans son ensemble. Un enregistrement qui a produit quinze bonnes minutes de texte puis plus rien n'est pas, du point de vue de cette vérification, un résultat vide — il a produit quelque chose. La condition qui déclenche une nouvelle tentative ne se déclenche donc jamais, même si le segment défaillant aurait justement eu besoin d'un second essai.
Cela vaut la peine d'être su, car cela explique quelque chose qui ressemble sinon à un bug : relancer exactement la même transcription sur exactement le même fichier reproduit généralement exactement la même coupure. L'audio n'a pas changé, et le segment qui a échoué la première fois n'a aucune nouvelle raison de réussir la seconde.
Ce qui fait vraiment échouer un segment
L'enregistrement est long
Plus un fichier est long, plus il est découpé en segments individuels, et plus il y a de chances que l'un d'eux tombe sur quelque chose que le modèle ne parvient pas à traiter. Un mémo vocal de cinq minutes a beaucoup moins d'occasions d'échouer ainsi qu'un entretien de deux heures.
Un passage de calme, de bruit ou de silence
Une pause pendant laquelle quelqu'un se lève chercher un café, un pic de bruit de fond, ou plusieurs minutes de quasi-silence au milieu d'un enregistrement donnent à ce segment très peu de parole exploitable à reconnaître. S'il ne renvoie rien, c'est ce vide qui apparaît comme la fin de la transcription — même si les gens recommencent à parler parfaitement clairement une minute plus tard dans l'audio lui-même.
Changements de distance ou de volume en cours de route
Si le téléphone est resté au même endroit mais que la personne qui parlait s'est éloignée, s'est tournée à l'écart du micro, ou que la pièce est devenue plus bruyante au fil de l'enregistrement, la qualité audio des segments ultérieurs peut être réellement moins bonne que celle des premiers — même si c'est le même fichier, le même téléphone, le même réglage du début à la fin.
Ce qui vaut la peine d'être essayé
- Écoutez l'enregistrement à peu près à l'endroit où la transcription s'arrête. Si les voix restent audibles et claires à cet endroit, l'audio lui-même est en bon état — c'est la transcription qui manque de texte, pas une preuve que l'enregistrement a échoué.
- Relancez la transcription. Cela reproduit souvent la même coupure, mais si le premier passage s'est fait sans connexion, le refaire en étant connecté donne au chemin de repli une chance d'atteindre un segment que la reconnaissance sur l'appareil n'a pas pu traiter.
- Pour tout ce que vous enregistrez régulièrement et longuement — cours, longs entretiens — mieux vaut réécouter la seconde moitié plutôt que de supposer que la transcription la couvre entièrement.
- Complétez le passage manquant à l'oreille plutôt que de jeter toute la transcription. La partie qui a fonctionné reste exacte, et elle vous a déjà évité de la taper.
Comment Voice Studio gère cela
Voice Studio transcrit via le Speech framework d'Apple de la même façon que décrit ci-dessus : reconnaissance sur l'appareil en premier, avec un repli vers le serveur d'Apple uniquement quand un passage revient totalement vide ou lève une erreur. Une transcription qui s'arrête en plein milieu d'un long enregistrement signifie qu'un segment n'a pas produit de texte alors que ceux autour de lui l'ont fait — l'enregistrement lui-même reste intact, et l'audio du passage manqué par la transcription est toujours là, dans le .m4a, prêt à être réécouté ou retranscrit.
Questions fréquentes
Une transcription qui s'arrête signifie-t-elle qu'une partie de l'enregistrement manque ?
Non. Le fichier audio et la transcription sont deux choses distinctes. Une transcription coupée signifie que la reconnaissance n'a pas produit de texte pour ce passage — l'enregistrement, lui, conserve tout, et vous pouvez écouter ou retranscrire cette partie.
Retranscrire le même enregistrement corrige-t-il la coupure ?
En général seulement si quelque chose a changé dans les conditions, le plus souvent le fait de passer d'une absence de connexion à une connexion active. Si rien n'a changé, le même segment tend à échouer de nouveau.
Cela arrive-t-il davantage sur les enregistrements longs ?
Oui. L'audio long est traité en davantage de segments, donc il y a davantage d'occasions pour que l'un d'eux ne renvoie rien. Un enregistrement court laisse beaucoup moins de place à ce problème.
Une transcription coupée est-elle le même problème qu'une transcription vide ?
C'est lié, mais différent. Une transcription vide signifie que la reconnaissance a échoué sur l'ensemble de l'enregistrement. Une transcription coupée signifie qu'elle a fonctionné sur une partie puis s'est arrêtée — le texte obtenu avant la coupure reste exact.
Essayer dans Voice Studio
Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.
Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure