Voice Studio

¿Por qué mi transcripción en el iPhone confunde los nombres?

Respuesta corta: el sistema no busca a quién conoces, adivina la palabra estadísticamente más probable para el sonido que oyó — y un nombre poco común casi siempre pierde esa apuesta frente a una palabra corriente, o frente a otro nombre más habitual que suena parecido.

Es una molestia concreta y que se repite: una transcripción va perfectamente limpia durante tres párrafos, acierta cada frase normal, y luego convierte el nombre de un compañero en tres palabras distintas y erróneas en tres menciones distintas dentro de la misma grabación. Rara vez parece aleatorio en cuanto se nota el patrón, y no lo es: es lo que hace un modelo de voz genérico cuando se encuentra con una palabra para la que nunca fue entrenado.

El sistema no sabe que los nombres existen

El reconocimiento de voz en el iPhone funciona comparando el sonido de lo que dijiste con un modelo de lenguaje, y eligiendo después la secuencia de palabras más probable que encaje con ese sonido — probable según cómo se usa normalmente el idioma, no según quién esté de verdad contigo en la sala. Ese modelo nunca ha conocido a las personas, productos o lugares concretos de tu vida. Solo ha visto enormes cantidades de lenguaje corriente, y puntúa cada palabra posible según lo habitual que sea en ese tipo de lenguaje.

Un nombre de pila común suele aparecer con la frecuencia suficiente en ese entrenamiento como para tener buenas probabilidades. Un nombre menos común, un apellido, una marca o el nombre inventado de un producto es raro o directamente inexistente en lo que el modelo ha visto, así que parte con pocas probabilidades — y aun así tiene que decir algo. Recurre a la palabra corriente o al nombre más familiar que suene lo bastante parecido para rellenar el hueco, porque "lo más parecido que conozco de verdad" gana siempre a "nada" cuando el reconocimiento tiene que comprometerse con una respuesta.

Por qué los nombres pierden esa apuesta en concreto

Son raros por definición

Que una palabra sea poco común no es un caso extremo para un modelo de lenguaje: es la condición normal de una enorme parte de los nombres reales. La razón misma por la que un nombre identifica a una persona o cosa concreta es que la mayoría de los nombres no los comparte todo el mundo — justo la propiedad que los convierte en candidatos estadísticamente improbables para un sistema construido sobre lo probable que es que aparezca una palabra.

El contexto que los rodea ayuda poco

El reconocimiento se apoya mucho en el contexto: un sonido ambiguo en mitad de una frase corriente se resuelve porque solo ciertas palabras tienen sentido gramatical y semántico en ese hueco. "Soy [nombre], llamo por la factura" le dice al modelo que ese hueco contiene algún tipo de nombre, pero la gramática por sí sola no reduce cuál de todos — cualquier nombre encaja gramaticalmente ahí, así que el modelo recurre al que más ha visto, no al que dijiste realmente.

No es solo cosa de personas

El mismo mecanismo estropea nombres de marca, nombres de medicamentos, calles, números de modelo dichos en voz alta y términos técnicos propios de un sector concreto. Cualquier palabra lo bastante inusual como para importar es, por esa misma razón, lo bastante inusual como para que un modelo genérico se equivoque con ella.

Esto no es señal de que algo haya fallado

Un nombre mal transcrito dentro de una transcripción por lo demás correcta significa que el reconocimiento funcionó y cometió un error concreto y explicable — es una situación distinta de una transcripción que vuelve en blanco, que significa que el reconocimiento no logró producir texto útil en absoluto. El audio en sí no se ve afectado en ningún caso; un nombre mal escrito en la transcripción no significa que el nombre se grabase mal, solo que convertir ese sonido concreto en texto acabó en la palabra equivocada.

Tampoco es algo que un intento de reconocimiento arregle y otro no. El reconocimiento en el dispositivo y el respaldo a través de un servidor son ambos modelos de lenguaje genéricos entrenados de la misma forma, con el mismo tipo de lenguaje corriente, y no una consulta contra una agenda personal de nombres que uno tenga y el otro no. No hay ninguna base real para esperar que un nombre salga más limpio por pasar por un intento en lugar del otro.

Qué reduce un poco la diferencia

Corregirlo después es la solución real

No existe un ajuste que le enseñe a un iPhone un nombre concreto de antemano, ni ninguna forma de resolver esto de manera permanente antes de grabar. El camino práctico es el mismo que para cualquier otro error de transcripción: leer la transcripción una vez, corregir el nombre donde esté mal, y seguir adelante. Esa corrección se hace sobre la propia entrada de la grabación, por lo que conviene hacerla antes de exportar o compartir la transcripción y no después — un archivo TXT o JSON creado a partir del texto es una instantánea de ese momento, y una corrección hecha más tarde no llega a una copia que ya ha salido.

Cómo lo gestiona Voice Studio

Voice Studio transcribe a través del framework de voz de Apple: primero reconocimiento en el dispositivo, y solo un reintento con el reconocimiento en el dispositivo desactivado, enviando el audio al servidor de Apple, si ese primer intento vuelve vacío o falla. Ninguno de los dos intentos tiene ningún conocimiento especial de los nombres de tu vida, así que un nombre mal transcrito es un resultado corriente de cómo funciona el reconocimiento de voz genérico, no algo propio de una grabación o de un intento concreto. La transcripción de cualquier grabación se puede editar en cualquier momento y sin coste — corregir un nombre es la misma acción gratuita que corregir cualquier otra cosa en ella — y exportarla después como TXT o JSON incluye el texto ya corregido, porque la exportación siempre refleja cómo se lee la transcripción en ese momento.

Preguntas frecuentes

¿Hay alguna forma de enseñarle un nombre a la app para que deje de confundirlo?

No. No existe un diccionario personalizado ni una lista de nombres que el reconocimiento consulte primero — cada intento es un modelo de lenguaje genérico sin ningún conocimiento de las personas, lugares o productos concretos de tu vida. Corregir el nombre en la transcripción después es la solución real.

¿El respaldo por servidor reconoce mejor los nombres que el reconocimiento en el dispositivo?

No de forma fiable. Ambos son modelos de lenguaje genéricos entrenados de la misma manera, no una consulta contra una agenda personal, así que no hay una base real para esperar que uno maneje mejor un nombre concreto que el otro.

¿Volver a transcribir la misma grabación arregla un nombre mal escrito?

Normalmente no. El audio no ha cambiado y tampoco el modelo que lo procesa, así que el mismo nombre tiende a salir mal de la misma forma otra vez, salvo que haya cambiado alguna otra condición.

Si corrijo un nombre en una transcripción, ¿se reconocerá bien en grabaciones futuras?

No. Una corrección se aplica a la entrada de transcripción de esa grabación en concreto. No es una entrada de diccionario que el reconocimiento consulte para nada grabado después.

Pruébalo en Voice Studio

Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.

Descargar en el App Store

Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior