Voice Studio

Pourquoi ma transcription iPhone écorche-t-elle les noms propres ?

Réponse courte : le système ne cherche pas qui vous connaissez, il devine le mot statistiquement le plus probable pour le son entendu — et un nom peu courant perd presque toujours ce pari face à un mot ordinaire, ou face à un autre nom plus fréquent qui sonne à peu près pareil.

C'est un agacement précis et récurrent : une transcription reste parfaitement propre pendant trois paragraphes, ne se trompe sur aucune phrase ordinaire, puis transforme le nom d'un collègue en trois mots différents et faux à trois mentions différentes dans le même enregistrement. Cela paraît rarement aléatoire une fois qu'on repère le schéma, et ce n'est effectivement pas aléatoire : c'est ce que fait un modèle de reconnaissance vocale généraliste face à un mot qu'il n'a jamais été entraîné à attendre.

Le système ignore que les noms propres existent

La reconnaissance vocale sur iPhone fonctionne en comparant le son de ce que vous avez dit à un modèle de langage, puis en choisissant la séquence de mots la plus probable pour ce son — probable selon l'usage habituel de la langue, pas selon qui se trouve réellement avec vous dans la pièce. Ce modèle n'a jamais rencontré les personnes, produits ou lieux précis de votre vie. Il n'a vu que d'immenses quantités de langage ordinaire, et il évalue chaque mot possible selon sa fréquence dans ce type de langage.

Un prénom courant apparaît en général assez souvent dans cet entraînement pour avoir de bonnes chances. Un nom moins courant, un nom de famille, une marque ou le nom inventé d'un produit est rare, voire absent, de ce que le modèle a vu — ses chances sont donc faibles dès le départ, et il doit malgré tout produire quelque chose. Il se rabat sur le mot courant ou le nom plus familier qui sonne suffisamment proche pour combler le vide, parce que « ce qui ressemble le plus à ce que je connais vraiment » l'emporte toujours sur « rien » quand la reconnaissance doit trancher.

Pourquoi les noms propres perdent ce pari en particulier

Ils sont rares par définition

Qu'un mot soit peu courant n'est pas un cas limite pour un modèle de langage : c'est la condition normale d'une immense part des noms propres réels. La raison même pour laquelle un nom identifie une personne ou une chose précise, c'est que la plupart des noms ne sont pas partagés par tout le monde — exactement la propriété qui en fait des candidats statistiquement improbables pour un système bâti sur la fréquence d'apparition d'un mot.

Le contexte environnant les aide peu

La reconnaissance s'appuie beaucoup sur le contexte : un son ambigu au milieu d'une phrase ordinaire se résout parce que seuls certains mots ont un sens grammatical et sémantique à cet endroit. « C'est [nom] à l'appareil, pour la facture » indique au modèle que cet emplacement contient un nom quelconque, mais la grammaire seule ne dit pas lequel — n'importe quel nom y est grammaticalement interchangeable, donc le modèle retombe sur celui qu'il a le plus vu, pas sur celui que vous avez réellement prononcé.

Ce n'est pas propre aux personnes

Le même mécanisme écorche les noms de marque, les noms de médicaments, les noms de rues, les numéros de modèle dits à voix haute et le jargon technique propre à un domaine. Tout ce qui est assez inhabituel pour compter est, par ce même trait, assez inhabituel pour qu'un modèle généraliste se trompe dessus.

Ce n'est pas le signe d'un échec

Un nom mal transcrit au milieu d'une transcription par ailleurs correcte signifie que la reconnaissance a fonctionné et a commis une erreur précise et explicable — une situation différente d'une transcription vide, qui signifie que la reconnaissance n'a produit aucun texte exploitable. L'audio lui-même n'est touché dans aucun des deux cas ; un nom écorché dans la transcription ne veut pas dire que le nom a été mal enregistré, seulement que la conversion de ce son précis en texte a abouti au mauvais mot.

Ce n'est pas non plus quelque chose qu'une passe de reconnaissance corrige et qu'une autre laisse tel quel. La reconnaissance sur l'appareil et le relais via un serveur sont tous deux des modèles de langage généralistes entraînés de la même façon, sur le même type de langage ordinaire, et non un annuaire personnel de noms que l'un posséderait et l'autre pas. Rien ne justifie vraiment de s'attendre à ce qu'un nom ressorte plus propre selon la passe utilisée.

Ce qui réduit un peu l'écart

Corriger après coup est la vraie solution

Il n'existe aucun réglage qui apprenne à l'avance un nom précis au système de reconnaissance vocale d'un iPhone, et aucune façon de régler cela durablement avant d'enregistrer. La voie pratique est la même que pour toute autre erreur de transcription : relire la transcription une fois, corriger le nom là où il est faux, puis continuer. Cette correction se fait sur la fiche de l'enregistrement lui-même, d'où l'intérêt de la faire avant d'exporter ou de partager la transcription plutôt qu'après — un fichier TXT ou JSON créé à partir du texte est une photographie à cet instant précis, et une correction faite plus tard n'atteint pas une copie déjà partie.

Comment Voice Studio gère cela

Voice Studio transcrit via le framework vocal d'Apple : reconnaissance sur l'appareil en premier, puis seulement une nouvelle tentative avec la reconnaissance sur l'appareil désactivée, envoyant l'audio au serveur d'Apple, si cette première passe revient vide ou échoue. Aucune des deux passes n'a de connaissance particulière des noms qui font partie de votre vie, donc un nom écorché est un résultat ordinaire du fonctionnement de la reconnaissance vocale généraliste, pas quelque chose de propre à un enregistrement ou à une passe en particulier. La transcription de n'importe quel enregistrement est modifiable à tout moment et sans frais — corriger un nom est la même action gratuite que corriger n'importe quoi d'autre dedans — et l'exporter ensuite en TXT ou en JSON reprend le texte corrigé, puisque l'export reflète toujours l'état de la transcription à cet instant.

Questions fréquentes

Existe-t-il un moyen d'apprendre un nom à l'application pour qu'elle arrête de se tromper ?

Non. Il n'existe pas de dictionnaire personnalisé ni de liste de noms que la reconnaissance consulterait en priorité — chaque passe est un modèle de langage généraliste sans aucune connaissance des personnes, lieux ou produits précis de votre vie. Corriger le nom dans la transcription après coup est la vraie solution.

Le relais via serveur reconnaît-il mieux les noms que la reconnaissance sur l'appareil ?

Pas de façon fiable. Les deux sont des modèles de langage généralistes entraînés de la même manière, pas un annuaire personnel consulté, donc rien ne justifie vraiment de s'attendre à ce que l'un gère mieux un nom précis que l'autre.

Retranscrire le même enregistrement corrige-t-il un nom faux ?

En général non. L'audio n'a pas changé, ni le modèle qui l'analyse, donc le même nom a tendance à ressortir faux de la même façon, sauf si autre chose a changé entre-temps.

Si je corrige un nom dans une transcription, sera-t-il reconnu correctement dans les enregistrements suivants ?

Non. Une correction s'applique à la fiche de transcription de cet enregistrement précis. Ce n'est pas une entrée de dictionnaire que la reconnaissance consulterait pour ce qui est enregistré ensuite.

Essayer dans Voice Studio

Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.

Télécharger dans l’App Store

Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure