¿Grabar en más calidad mejora la precisión de la transcripción?
Respuesta corta: casi nada, y muchas veces nada en absoluto. El ajuste de calidad cambia sobre todo el tamaño del archivo, no lo que recibe el motor de reconocimiento de voz. Lo que de verdad hace mejor o peor una transcripción está en otro sitio.
Es una suposición razonable si viene de la fotografía: una imagen de más resolución hace el reconocimiento de texto más fiable, así que una grabación de más calidad debería hacer el reconocimiento de voz más fiable también. Con el audio y el habla, esa suposición casi nunca se cumple, y merece la pena saber por qué antes de elegir una calidad por el motivo equivocado.
Qué cambia realmente un ajuste de calidad
En una grabadora de teléfono con varios niveles de calidad, lo que suele cambiar entre ellos es la frecuencia de muestreo: cuántas veces por segundo se mide la señal del micrófono. Los tres niveles de Voice Studio son estándar a 22,05 kHz, alta a 44,1 kHz y ultra a 48 kHz, siempre en AAC mono. Subir de nivel captura una franja más ancha del espectro audible y produce un archivo más grande. No cambia el esquema de compresión, y no añade información que no estuviera ya en la sala.
Dónde vive realmente la información que necesita una transcripción
La inteligibilidad del habla está sobre todo por debajo de los 8 kHz: consonantes, vocales y el tono de una voz caben cómodamente por debajo de ese techo. Incluso el nivel más bajo de los tres, a 22,05 kHz, queda bastante por encima del punto donde el habla se vuelve clara, porque la frecuencia de muestreo necesita ser aproximadamente el doble de la frecuencia más alta que importa. En la práctica: cuando estás eligiendo entre estándar, alta y ultra, la parte de la señal de la que se construye una transcripción ya está completa en las tres. Subir de nivel captura más detalle del resto de la sala, no más voz.
Qué determina de verdad que una transcripción salga bien
Dos cosas distintas deciden cómo sale una transcripción, y ninguna es el selector de calidad.
Si el reconocimiento se hizo en el dispositivo o en el servidor de Apple
El reconocimiento de voz en iOS intenta primero la vía local y, en muchas implementaciones, reintenta contra el servidor de Apple si esa pasada vuelve vacía o da error. Qué vía se usa depende de la cobertura de idiomas y de si el modelo local de ese idioma está de verdad descargado en el teléfono, no de cómo se codificó el audio. Una grabación en calidad estándar en un idioma con buen modelo local se transcribe igual de bien que una en calidad ultra.
Lo que hay de verdad en el audio
Esto es lo que un ajuste de calidad no puede arreglar. La distancia a quien habla, el ruido de fondo, un micrófono mal colocado, las voces superpuestas y un audio saturado por hablar demasiado cerca o demasiado alto empeoran lo que recibe el reconocedor, y ninguna de esas cosas tiene que ver con la frecuencia de muestreo. Una habitación tranquila con el teléfono a quince centímetros de la boca de alguien, en calidad estándar, transcribe mejor que una cafetería ruidosa grabada en ultra, siempre.
Entonces, ¿en qué calidad grabar si el objetivo es transcribir
Alta es un valor por defecto razonable para casi cualquier grabación hablada: queda bastante por encima del punto donde la claridad del habla se ve limitada por algo que haga el codificador. Si el espacio anda justo, bajar a estándar no te cuesta nada que una transcripción fuera a usar; la franja de frecuencias que captura ya cubre lo que necesita el habla. Ultra no va a hacer una transcripción más precisa. Merece la pena solo si quieres la copia de más fidelidad del propio audio por otro motivo, no es un ajuste pensado para transcribir.
Cómo funciona el ajuste de calidad en Voice Studio
El ajuste de calidad —estándar, alta o ultra— es gratuito, no una de las pocas cosas reservadas a Pro. La transcripción siempre intenta primero la vía local y solo recurre al servidor de Apple si esa pasada devuelve vacío o falla, sea cual sea el nivel de calidad con el que se grabó. Si una transcripción sale peor de lo esperado, lo que merece la pena revisar es dónde estaba el teléfono durante la grabación, no qué nivel de calidad tenía seleccionado.
Preguntas frecuentes
¿Grabar en calidad ultra da una transcripción más precisa que en alta?
No, no de forma apreciable. El reconocimiento de voz trabaja con una franja de frecuencias que ambos ajustes cubren de sobra. Ultra da un archivo más grande, no una transcripción más clara.
¿Qué es lo que de verdad empeora una transcripción?
La distancia a quien habla, el ruido de fondo, las voces superpuestas y un audio saturado por hablar demasiado cerca o demasiado alto. Todo eso importa mucho más que el ajuste de calidad.
¿Debería usar calidad estándar si lo que me importa es la transcripción, para ahorrar espacio?
Es una elección razonable. La calidad estándar ya está por encima de la franja de frecuencias que necesita el reconocimiento de voz, así que no estás sacrificando la transcripción, solo el tamaño del archivo.
¿Una frecuencia de muestreo más alta ayuda a que iOS use el reconocimiento local en vez de recurrir al servidor?
No. Esa elección depende de la cobertura de idiomas y de si el modelo local de ese idioma está descargado en el teléfono, no de cómo se codificó la grabación.
Pruébalo en Voice Studio
Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.
Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior