Voice Studio

Pourquoi ma transcription iPhone confond-elle des mots qui se prononcent pareil ?

Réponse courte : parce que les deux mots sonnent de façon identique, ou assez proche pour que rien dans l'enregistrement ne permette de les distinguer. La reconnaissance vocale convertit du son en texte — elle ne peut pas retrouver une distinction qui n'était jamais dans le son, aussi clairement que vous ayez parlé.

C'est un type d'erreur de transcription particulier, qui ne ressemble pas aux autres. La phrase n'est pas hachée, le rythme est le bon, chaque autre mot est correct — et soudain « ces » apparaît à la place de « ses », ou une transcription sur la météo écrit « quand » là où vous avez clairement dit « qu'en ». Rien dans l'enregistrement ne sonne faux à l'écoute, ce qui rend justement ce schéma d'erreur déroutant la première fois qu'on le remarque.

Le son, vraiment, ne les distingue pas

Un mot mal articulé ou couvert par du bruit de fond est un problème de signal — l'audio transportait moins d'information que d'habitude, et la reconnaissance a dû deviner avec un signal plus pauvre. Les homophones sont une situation totalement différente : « ces », « ses » et « c'est » ne se ressemblent pas, ils sonnent exactement pareil. Il n'existe aucune façon de prononcer l'un d'eux plus clairement qui changerait l'onde sonore captée, parce que la différence entre eux n'a jamais été acoustique — elle vit entièrement dans l'orthographe et la grammaire, des choses auxquelles un microphone n'a pas accès.

Les quasi-homophones fonctionnent pareil, avec un peu plus de marge : « quand », « quant » et « qu'en » ne diffèrent que par une nuance si fine que la parole courante l'efface presque toujours. Un système qui ne travaille qu'à partir de l'audio part de la même position impossible qu'une personne qui entendrait la phrase sans jamais la voir écrite.

Ce qui tranche vraiment le doute

La reconnaissance vocale ne se contente pas d'associer des sons à des mots — elle évalue aussi quelle séquence de mots est la plus probable selon l'usage courant de la langue, ce qui lui permet généralement de retomber juste plutôt que de produire un non-sens, malgré des sons très proches. Cette évaluation fait un vrai travail, et c'est pour cela que les erreurs d'homophones restent l'exception plutôt que la norme dans une transcription qui fonctionne bien.

Mais cette évaluation reste une habitude statistique apprise sur d'énormes quantités de texte ordinaire, pas une compréhension de la phrase précise que vous avez dite. Elle retient le mot qui apparaît le plus souvent à cet endroit grammatical dans le langage courant — et pour une vraie paire d'homophones, les deux mots sont souvent assez courants, dans des positions assez semblables, pour que les probabilités soient serrées. Une personne qui relit la phrase la résout instantanément parce qu'elle sait ce qu'elle voulait dire. Un modèle statistique n'a aucune version de « ce que vous vouliez dire » sur laquelle se rabattre — seulement ce qui est habituel.

C'est l'envers du problème des noms propres, pas le même problème

Un nom propre est écorché parce qu'il est rare — le modèle ne l'a presque jamais vu, donc il le remplace par quelque chose de courant. Une confusion d'homophones, c'est l'inverse : les deux candidats sont généralement des mots ordinaires, très ordinaires, et le modèle hésite vraiment entre deux choses qu'il connaît bien plutôt que de se rabattre sur un substitut. C'est aussi pour cela que la correction diffère. Un nom mal transcrit tend à ressortir faux de la même façon à chaque fois, une fois le schéma repéré. Un dérapage d'homophones se décide phrase par phrase, selon la lecture qui a obtenu un score légèrement supérieur pour ce contexte précis — la même paire de mots peut donc être correcte dans une phrase et fausse dans la suivante, au sein de la même transcription.

Pourquoi le réglage de qualité et le type de reconnaissance utilisé n'y changent rien

Il vaut la peine d'écarter les suspects habituels, car cette erreur ne vient d'aucun des deux. Une fréquence d'échantillonnage plus élevée capte plus de détail dans le son lui-même, ce qui aide pour une voix faible ou lointaine — mais « ces » et « ses » produisent le même son à n'importe quelle fréquence d'échantillonnage, donc plus de détail ne crée pas une différence qui n'existait pas à capter. Et la reconnaissance sur l'appareil comme le relais via un serveur évaluent les séquences de mots exactement de la même façon statistique, sur le même type de langage d'entraînement courant, donc aucune des deux passes n'a réellement l'avantage ici. Une transcription enregistrée dans des conditions parfaites, au réglage de qualité le plus élevé, par l'une ou l'autre voie de reconnaissance, peut quand même tomber sur la mauvaise moitié d'une paire d'homophones — parce que le problème n'a jamais été dans l'audio.

La corriger, c'est lire, pas réécouter

Réécouter l'audio n'aide pas comme pour un mot réellement peu clair, parce qu'il n'y a rien à écouter de plus attentivement — le son est le même dans les deux cas. Ce qui fonctionne vraiment, c'est de relire la transcription comme n'importe quel texte : à un rythme normal, en suivant le sens de chaque phrase plutôt qu'en la vérifiant mot à mot contre l'enregistrement. Vous disposez déjà de la seule information que la reconnaissance n'a jamais eue — ce que vous vouliez vraiment dire — et cela suffit pour repérer un « quand » à la place d'un « qu'en » presque aussi vite que vous lisez la phrase.

Il est utile d'attendre ces erreurs à des endroits précis plutôt que de suspecter chaque phrase de la même façon : les petits mots grammaticaux extrêmement courants — ces/ses/c'est, quand/quant/qu'en, ou/où, a/à — sont les endroits où cela arrive le plus, simplement parce que ce sont les paires avec le plus d'usages quotidiens et à peu près aussi probables des deux côtés. Une paire d'homophones plus rare et plus distinctive trébuche bien moins souvent que la poignée de petits mots dont dépend presque chaque phrase.

Comment Voice Studio s'inscrit dans tout cela

Voice Studio transcrit via le framework vocal d'Apple de la même façon pour chaque enregistrement : reconnaissance sur l'appareil en premier, puis seulement une nouvelle tentative avec la reconnaissance sur l'appareil désactivée — envoyant l'audio au serveur d'Apple — si cette première passe revient vide ou échoue. Les deux passes sont des modèles de langage généralistes qui évaluent des séquences de mots selon l'usage habituel de la langue, pas un système ayant accès au sujet réel d'une phrase précise, donc un dérapage d'homophones peut survenir par l'une ou l'autre voie sans que cela signifie qu'une passe a mal fonctionné. La transcription de n'importe quel enregistrement reste du texte modifiable, donc corriger un mot inversé est la même modification simple que corriger n'importe quoi d'autre dedans, et l'exporter ensuite en TXT ou en JSON reprend le texte tel qu'il se lit à cet instant.

Questions fréquentes

Confondre « ces » et « ses » veut-il dire que l'application m'a mal entendu ?

Non. Les deux mots sonnent de façon identique, donc rien dans l'audio lui-même ne permettait de les distinguer. La reconnaissance évalue quel mot est statistiquement le plus probable dans cette phrase, et choisit parfois la mauvaise moitié d'une paire qui sonne réellement pareil.

Retranscrire le même enregistrement corrige-t-il cela ?

En général non. L'audio n'a pas changé, et les deux passes de reconnaissance évaluent les séquences de mots de la même façon statistique, donc le même doute serré tend à se résoudre pareil, sauf si autre chose change.

Un réglage de qualité plus élevé aide-t-il pour ce type d'erreur ?

Non. Une fréquence d'échantillonnage plus élevée capte plus de détail dans le son, ce qui aide pour une voix faible ou peu claire. Cela n'aide pas ici, car les homophones produisent le même son quelle que soit la quantité de détail captée.

Est-ce plus fréquent avec la reconnaissance sur l'appareil ou avec le relais via serveur ?

Aucun des deux n'a réellement l'avantage. Les deux sont des modèles de langage généralistes qui évaluent les séquences de mots de la même façon statistique, donc une confusion d'homophones est à peu près aussi probable par l'une ou l'autre voie.

Essayer dans Voice Studio

Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.

Télécharger dans l’App Store

Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure