Voice Studio

Une transcription iPhone indique-t-elle qui parle ?

Non, pas toute seule. Demandez à un iPhone de transcrire une conversation entre deux personnes ou plus, et le résultat est un flux de texte continu, sans aucun nom ni étiquette marquant où l'une s'arrête et où l'autre commence. Ce n'est pas un réglage oublié — c'est une tâche que la transcription n'a jamais eu pour mission d'accomplir.

Cela se remarque en général la première fois que quelqu'un transcrit une interview ou une réunion plutôt qu'une seule voix parlant seule. Les mots sont souvent proches de la réalité. Ce qui manque, sans message d'erreur et sans réglage évident pour y remédier, c'est toute indication de qui a dit quelle partie.

Deux problèmes différents qui n'en ont l'air que d'un seul

Transformer la parole en mots est une tâche : un modèle écoute un passage audio et prédit la suite de mots qui l'a produit. Déterminer combien de voix distinctes se trouvent dans un enregistrement et à quelle voix appartient chaque passage est une tâche complètement différente, généralement appelée diarisation des locuteurs. Elle ne demande pas ce qui a été dit — elle demande qui parlait, à partir d'éléments comme la hauteur, le timbre et l'empreinte acoustique d'une voix.

Une transcription terminée donne l'impression que c'est un seul travail parce qu'on veut les deux réponses en même temps. Le framework vocal d'Apple, sur lequel tournent aussi bien la transcription sur l'appareil que la transcription serveur sur iPhone, ne fait que la première. Il donne des mots. Que l'audio contienne une voix ou cinq, le résultat est un bloc de texte brut — rien dans le framework n'identifie ni ne sépare les locuteurs, et aucune app tierce qui l'utilise ne peut lui faire faire ce qu'il ne fait pas.

À quoi cela ressemble quand on tombe dessus

La transcription d'une interview à deux se lit comme un seul paragraphe qui enchaîne questions et réponses, sans « Q : » ni nom pour marquer le passage de l'une à l'autre. La parole qui se chevauche — quelqu'un qui parle en même temps qu'un autre — ressort avec les mots que le modèle a pu séparer, sans aucune indication que deux personnes étaient impliquées. Si vous n'étiez pas présent, ou que vous ne vous souvenez plus de la conversation, rien dans le texte lui-même ne dit qui a prononcé quelle ligne.

Ce qui marche vraiment à la place

Dire les noms à voix haute, sur l'enregistrement

La solution la moins coûteuse se joue avant même que la transcription ne commence. Si vous répétez un nom ou un rôle au début d'un tour de parole — « alors, Priya, qu'est-ce qui s'est passé ensuite » — cette phrase se retrouve dans la transcription comme des mots ordinaires, et fait le travail d'étiquetage qu'une fonction de diarisation ferait sinon. Cela ne coûte rien et ne demande aucun support de la part de l'app.

Marquer les changements de locuteur pendant l'enregistrement

Poser un marqueur au moment où une nouvelle personne se met à parler vous laisse un ensemble d'horodatages à exploiter ensuite, la même habitude qui aide pour un cours ou une longue interview, pour des raisons totalement différentes. Quand vous reviendrez modifier la transcription, ces marqueurs vous indiquent exactement où insérer un nom, sans avoir à réécouter tout l'enregistrement pour retrouver les changements.

Modifier la transcription une fois, posément

Comme la transcription est un texte ordinaire et modifiable, la solution pratique consiste en une seule relecture après coup : rejouer l'audio en accéléré, et là où les marqueurs ou le contenu lui-même indiquent que le locuteur a changé, taper le nom. Pour une interview courte, cela prend quelques minutes, pas des heures, et il ne faut le faire qu'une seule fois par enregistrement.

Enregistrer séparément quand cela compte vraiment

Pour tout ce où se tromper d'attribution serait un vrai problème — une conversation à portée légale, une interview formelle que vous comptez citer mot pour mot — la solution la plus fiable évite carrément la transcription : que chaque personne enregistre sur son propre appareil. Un seul téléphone avec un seul microphone n'a aucun moyen physique de séparer deux voix dans la même pièce ; deux enregistrements distincts n'ont pas cette ambiguïté au départ.

Là où cela compte le plus

Cela se remarque justement là où les transcriptions sont les plus utiles : interviews, réunions, et toute conversation que l'on souhaite citer plus tard plutôt que simplement rechercher dedans. Aucune de ces situations n'est aggravée par l'absence d'étiquettes de locuteur — elles ont juste besoin du petit effort manuel décrit ci-dessus pour transformer un mur de texte en quelque chose de citable avec confiance.

Comment Voice Studio gère cela

Voice Studio utilise le framework vocal d'Apple pour la transcription, donc ce qu'il produit correspond exactement à ce qui est décrit plus haut : des mots exacts, sans étiquettes de locuteur automatiques. La transcription est un texte ordinaire et modifiable, donc ajouter des noms ou un schéma « Q : »/« R : » après coup ne prend qu'une relecture. Les marqueurs posés pendant l'enregistrement servent justement à guider cette relecture — un moyen rapide de se rappeler où le locuteur a changé sans réécouter tout le fichier. Une fois la transcription telle que vous la voulez, elle s'exporte en TXT ou en JSON, ou vous pouvez transmettre l'audio lui-même sous forme de fichier .m4a.

Questions fréquentes

Une app iPhone peut-elle vraiment ajouter des étiquettes de locuteur automatiquement ?

Certaines apps appliquent un traitement supplémentaire sur la transcription pour deviner les changements de locuteur à partir des caractéristiques de la voix. C'est une fonctionnalité réellement différente de la reconnaissance vocale elle-même, et elle tend à peiner quand les voix se ressemblent ou que l'audio n'est pas propre — c'est une estimation, pas une garantie, contrairement à la transcription de mots ordinaire.

Enregistrer en stéréo ou avec deux microphones résout-il ce problème ?

Pas à lui seul. Séparer les voix de façon fiable demande soit des enregistrements vraiment distincts par personne, soit une étape de diarisation conçue spécifiquement pour cela — capter davantage de canaux, à lui seul, n'indique pas qui parle.

Pourquoi la transcription retrouve-t-elle les noms correctement quand les gens les prononcent à voix haute ?

Parce qu'à ce moment-là, elle ne fait que transcrire des mots ordinaires. « C'est Priya » ressort sous forme de texte comme n'importe quelle autre phrase — l'étiquetage se joue dans ce qui a été dit, pas dans quoi que ce soit que ferait la fonction de transcription en plus.

Cela affecte-t-il les enregistrements à une seule personne, comme un cours ou un journal vocal ?

Non. L'absence d'étiquettes de locuteur ne compte que lorsqu'il y a plus d'une voix à distinguer. Avec un seul locuteur, il n'y a rien à désambiguïser.

Essayer dans Voice Studio

Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.

Télécharger dans l’App Store

Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure