Voice Studio

¿Una app de grabación de voz usa tus grabaciones para entrenar IA en el iPhone?

Respuesta corta: una app no puede entrenar un modelo con audio que nunca recibe. La pregunta real no es qué promete una política de privacidad, sino cuáles de tus grabaciones llegan a salir del teléfono — y en la mayor parte de la transcripción en iPhone, «la mayor parte» no es «todas».

Entrenar un modelo exige que ocurran tres cosas en orden: el audio tiene que llegar a algún servidor, tiene que quedar registrado o conservado en lugar de descartarse, y tiene que acabar dentro del conjunto que más tarde se use para entrenar algo. Cada paso es un hecho sobre un sistema, no una promesa sobre una intención, lo que convierte esto en una de las pocas preguntas de privacidad con una respuesta que se puede comprobar en vez de tener que creerse.

La pregunta que realmente lo resuelve

Pregunta primero «¿tiene esta app un servidor por el que pasen mis grabaciones?» antes de preguntar «¿las usaría para entrenar algo?». Una app sin servidor propio, sin cuenta y sin SDK de analítica no tiene dónde recopilar una grabación en primer lugar. Eso es una garantía más sólida que una frase en una política prometiendo no usar tus datos, porque no depende de que nadie cumpla una promesa: sencillamente no hay infraestructura al otro lado donde pueda aterrizar una grabación.

El único lugar por el que el audio sí puede salir del teléfono

La transcripción es donde una respuesta limpia de «todo se queda en el teléfono» se complica. La mayor parte de la transcripción en iPhone, en esta app y en casi cualquier otra que no traiga su propio modelo de voz, se apoya en el framework Speech de Apple, que intenta primero el reconocimiento en el dispositivo y, para ciertos idiomas y ciertos audios, reintenta contra el propio servidor de Apple si esa pasada local vuelve vacía o falla.

Ese respaldo merece nombrarse con claridad en lugar de pasarlo por alto, porque es exactamente el caso en el que una afirmación de «nunca enviamos tu audio a ningún sitio» puede dejar de ser cierta sin que nadie mienta. Si un idioma no tiene modelo local instalado, o el audio era demasiado bajo, demasiado lejano o demasiado largo para que la pasada local lo resolviera, el audio va al servicio de voz de Apple para transcribirse. Es una vía propia de Apple, no un tercero en medio — pero es, genuinamente, audio que sale del dispositivo, y fingir lo contrario no sería honesto.

De quién es la política que rige realmente esos datos

Qué ocurre con el audio una vez llega al servicio de voz de Apple — cuánto se conserva, si algo de ello alimenta la mejora de los propios modelos de Apple — no es algo que controle el desarrollador de una app concreta, ni algo que pueda prometer en nombre de Apple. Esa es infraestructura de Apple, cubierta por la propia documentación de privacidad de Apple para el framework Speech, la misma que cubre el dictado del teclado, porque es el mismo servicio por debajo. Un desarrollador que te dice «tus grabaciones nunca se usan para entrenar IA» está haciendo una afirmación sobre sus propios sistemas. No está en posición de hacer esa misma afirmación sobre lo que ocurre una vez el audio llega a los servidores de Apple, y una respuesta honesta lo dice en vez de mezclar las dos cosas.

Son, de verdad, dos riesgos distintos que conviene no confundir. Uno es una empresa sin relación con Apple recopilando tu voz en un servidor construido exactamente para eso, sin ninguna otra explicación de por qué existe. El otro es un respaldo documentado, propio de Apple, dentro de la misma función de iOS que ya mueve el dictado en cualquier iPhone, sujeto a los compromisos que Apple haga sobre esa función en general. Ninguno de los dos es «nada» — pero no son la misma pregunta, y una app que solo responde a una de ellas no ha respondido en realidad a esta.

Qué descarta, por separado, «sin SDK de analítica»

Deja la transcripción a un lado un momento. Muchas apps que nunca tocan tus grabaciones sí envían igualmente un registro continuo de cómo las usas — qué pantallas abres, cuánto tiempo te quedas, qué tocas — a través de un SDK de analítica o publicidad de un tercero incluido en la app. Ese flujo no es tu audio, pero sigue siendo información sobre ti que sale del dispositivo hacia una empresa cuyo negocio entero es agregar exactamente ese tipo de datos, a veces para fines que se solapan con entrenar alguna otra cosa. Una app sin SDK de analítica no tiene nada de eso que enviar, haga lo que haga con el audio en concreto.

Cómo comprobarlo tú mismo en vez de confiar en una afirmación

No hace falta creerse nada de lo anterior. La misma prueba que responde en general a la pregunta local frente a nube responde a esta: activa el modo avión, graba algo y transcríbelo. Un texto que vuelve se produjo enteramente en el teléfono, porque no había red disponible para enviar nada. Si vuelve vacío o falla, eso te dice que ese idioma y ese audio concretos habrían usado el respaldo del servidor de haber tenido conexión — un hecho sobre esa grabación, no una afirmación comercial sobre la app.

Cómo lo hace Voice Studio

Voice Studio no tiene servidor propio, ni cuenta, ni sincronización con CloudKit, ni SDK de analítica — no hay infraestructura de nuestro lado en la que recopilar una grabación, y mucho menos usarla después para algo. La transcripción intenta primero la vía local y solo recurre al servicio de voz de Apple, tal como se describe arriba, si esa pasada local vuelve vacía o falla; cuando eso ocurre, ese audio lo gestiona Apple, bajo los compromisos propios de Apple para el framework Speech, no nosotros. Si una grabación concreta te importa lo bastante como para querer certeza en vez de una explicación, la prueba del modo avión de arriba se aplica aquí exactamente igual que en cualquier otro sitio donde surja esta pregunta.

Preguntas frecuentes

¿Puede una app entrenar un modelo de IA con mi voz si no tiene servidor?

No de forma relevante. Entrenar exige que el audio se recopile en algún sitio primero, y una app sin servidor, sin cuenta y sin SDK de analítica no tiene dónde recopilarlo, diga lo que diga cualquier política sobre la intención.

¿Usa Apple el audio enviado a su servicio de voz para entrenar sus propios modelos?

Esa cuestión la rige la propia documentación de privacidad de Apple para el framework Speech, no la app que activó el respaldo. Un desarrollador puede describir qué ocurre en sus propios sistemas, pero no puede prometer nada sobre la infraestructura de Apple en nombre de Apple.

¿Cómo compruebo si una grabación concreta llegó a salir de mi teléfono?

Activa el modo avión antes de transcribirla. Un texto que vuelve se produjo enteramente en el dispositivo, porque no había red por la que enviar nada; si vuelve vacío o falla, esa grabación habría usado el respaldo del servidor.

¿«No usamos IA de terceros» significa que nada de mi grabación sale nunca del dispositivo?

No necesariamente. Normalmente significa que el desarrollador no dirige tu audio hacia el servicio de IA de otra empresa. La vía propia de Apple, local primero y con respaldo de servidor, es una pregunta aparte, y una respuesta completa aborda las dos, no solo una.

Pruébalo en Voice Studio

Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.

Descargar en el App Store

Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior