Voice Studio

Transcripción local o en la nube: qué sale realmente de tu teléfono

Respuesta corta: en los iPhone actuales la mayoría de las transcripciones se hacen en local, pero iOS recurre en silencio a los servidores de Apple para ciertos idiomas y ciertos audios. La única forma de garantizar que no se transmite nada es cortar tú la red.

Cualquier app de voz a texto en iPhone que no incluya su propio modelo llama por debajo a lo mismo: el framework Speech de Apple. Ese framework tiene dos modos, y la diferencia entre ellos es toda la historia de la privacidad.

Los dos modos, en concreto

Una petición de reconocimiento en iOS lleva una marca que pide reconocimiento en el dispositivo. Cuando está activada, el audio lo procesa un modelo que ya vive en tu teléfono, descargado junto con los recursos del idioma. Nada sale por la red: la petición se completa en modo avión.

Cuando esa marca está desactivada, el audio se envía al servicio de reconocimiento de voz de Apple, se transcribe allí y vuelve el texto. Es la vía más antigua y, para muchos idiomas, todavía la más precisa, porque el modelo del servidor es mucho mayor que cualquier cosa que quepa en la memoria de un teléfono.

La trampa está en que la marca es una petición, no una garantía. Si el idioma solicitado no tiene modelo local instalado, la petición local sencillamente falla o devuelve vacío. Ahí la app elige: avisarte del fallo, o reintentar en silencio contra el servidor.

Qué determina cuál se ejecuta

Cobertura de idiomas

Apple ofrece reconocimiento local para una parte de los idiomas que soporta en total. Los más extendidos —inglés, español, francés, alemán, chino mandarín, japonés— tienen modelo local en el hardware actual. Los idiomas minoritarios y algunas variantes regionales solo existen en servidor. Esa lista cambia entre versiones de iOS y ninguna app la controla.

Si el recurso está descargado

Que un idioma esté soportado no significa que esté instalado. El modelo local llega cuando el sistema decide descargarlo, lo que en la práctica ocurre después de añadir ese idioma al teclado o al dictado y de dejar el teléfono un rato en Wi-Fi. Un teléfono recién restaurado puede estar «soportado» y no tener nada local con lo que trabajar.

Calidad y duración del audio

Los modelos locales son más pequeños y menos tolerantes. Un audio bajo, lejano, con acento marcado o con ruido de fondo que el servidor resuelve puede volver vacío desde el modelo local. Los archivos largos se trocean, y un trozo concreto puede fallar mientras el resto funciona.

Cómo saber cuál se ejecutó de verdad

Casi ninguna app te lo indica en pantalla. La prueba fiable cuesta treinta segundos y no exige creerse el marketing de nadie:

Repítelo idioma por idioma. Lo que ocurra en español no te dice nada de lo que ocurrirá en ucraniano.

Qué se transmite en la vía de servidor

Cuando se usa el servidor, lo que se envía es el audio, no un resumen ni solo el texto. Apple lo documenta como parte de su framework Speech y de sus avisos de privacidad, y es el mismo servicio que siempre ha movido el dictado del teclado. Es una vía de Apple, no de un tercero, pero «de Apple» no equivale a «local», y ambas cosas se confunden continuamente en las descripciones de las apps.

Desconfía de cualquier app que diga «totalmente en el dispositivo» sin matizar por idioma. Si usa el framework Speech y admite cuarenta idiomas, no es totalmente local en los cuarenta: o falla en el resto, o recurre al servidor.

Cómo lo hace Voice Studio

Voice Studio usa el framework Speech e intenta siempre primero la vía local. Si esa pasada devuelve vacío o da error, reintenta el mismo audio sin la marca de reconocimiento local, lo que significa que el audio va al servicio de voz de Apple cuando hay conexión. Ese respaldo existe porque la alternativa es entregarte una transcripción vacía, y una transcripción vacía es lo que la gente reporta como «la app no funciona».

Preferimos decirlo así de claro antes que prometer una garantía que no podemos sostener. Si necesitas certeza en una grabación concreta, transcríbela en modo avión: el respaldo no tiene red a la que llegar, así que o lo resuelve el modelo local o no obtienes nada, y en ambos casos no se envió nada. Fuera de esa vía, Voice Studio no tiene cuenta, ni servidor propio, ni SDK de analítica; las grabaciones y las transcripciones se guardan en el almacenamiento de la propia app, en el dispositivo.

Preguntas frecuentes

¿La transcripción local funciona en modo avión?

Sí, con los idiomas que tengan el modelo local instalado en el teléfono. Precisamente por eso el modo avión es una buena prueba: si vuelve texto sin red disponible, se generó en local.

¿Enviar audio a los servidores de Apple es como enviarlo a un tercero?

Es un servicio del propio Apple, el mismo que hay detrás del dictado del teclado. No es una empresa ajena, pero el audio sí sale de tu dispositivo, así que tampoco es local.

¿Puede una app usar solo la vía local y no recurrir nunca al servidor?

Técnicamente sí: puede pedir reconocimiento local y limitarse a informar del fallo en lugar de reintentar. El precio son transcripciones vacías en todo idioma o audio que el modelo local no resuelva.

¿Voice Studio envía mis grabaciones a un servidor suyo?

No. Voice Studio no tiene cuenta ni servidor propio. La única vía por la que el audio sale del dispositivo es el servicio de voz de Apple, como respaldo, según se explica arriba.

Pruébalo en Voice Studio

Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.

Descargar en el App Store

Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior