Voice Studio

¿Puede una transcripción ser en parte local y en parte en la nube?

Sí, y para cualquier cosa más larga que un audio corto es el caso normal, no la excepción. Local o en la nube se suele describir como una elección que hace una grabación una sola vez. Para una grabación de cierta duración, es una elección que se repite, una y otra vez, por cada tramo de audio, lo que significa que la transcripción final puede ser un mosaico sin que tú notes nunca las costuras.

La mayoría de las explicaciones sobre local o en la nube —también las de este sitio— describen algo que le pasa a una grabación: se intenta el paso local y, o funciona, o la petición cae al servidor de Apple. Ese planteamiento es exacto para una nota de voz corta, transcrita de una sola vez. Deja de ser el cuadro completo en el momento en que una grabación es lo bastante larga como para dividirse antes incluso de llegar al motor de reconocimiento.

Una grabación larga no es una sola petición

El reconocimiento de voz en iOS no está pensado para coger una hora de audio y devolver una hora de texto en un único viaje. Lo que usa el framework de voz de Apple procesa el audio largo por tramos, enviando cada uno como su propia petición de reconocimiento. Una nota de tres minutos puede ser un solo tramo. Una clase, una entrevista o cualquier cosa que se alargue son varios, uno detrás de otro.

Ese detalle importa aquí precisamente porque la regla que decide entre local y servidor no se aplica una vez, a la grabación entera; se aplica por separado, a cada tramo. Cada uno tiene su propio intento de reconocer el habla en local, y cada uno es libre de acabar en un camino distinto al de su vecino.

Qué manda un tramo al servidor mientras otro se queda en local

La regla de reintento es la misma que gobierna una grabación corta: primero se intenta el reconocimiento local y, solo si ese intento vuelve sin nada aprovechable o lanza un error, ese mismo audio se reintenta con el reconocimiento local desactivado, que es el camino que lo manda al servicio de voz de Apple. Aplica eso tramo por tramo y el resultado sale directamente de lo que de verdad hay en cada trozo de audio. Un tramo lleno de habla clara y continua suele salir bien en local y el reintento nunca salta. Un tramo que es sobre todo silencio, ruido lejano, una racha de estática o habla en un idioma para el que el modelo local no está preparado es exactamente la clase de audio que vuelve vacío —y vacío es la única condición que dispara el reintento.

Nada de eso requiere que la grabación tenga nada raro. Pasa dentro de una reunión normal que tiene un tramo tranquilo mientras la gente se sienta, una clase con una pausa larga para preguntas, o una nota de voz que empieza con algo de trajín antes de que nadie diga nada. Las partes que son fáciles para un modelo local pasan sin drama en local. Las que no lo son son justo las que acaban pidiendo ayuda al servidor —y una sola grabación tiene ambas con normalidad.

Así que la transcripción final puede ser mixta de verdad

Junta esos dos hechos y la respuesta a la pregunta del título no es una vaguedad: es lo que hace el mecanismo en realidad. Una grabación de cuarenta minutos puede tener sus primeros diez minutos resueltos enteramente en local, un tramo de dos minutos de ruido ambiente en medio que cae al servidor, y el resto volver a ir en local, todo dentro de una sola transcripción que lees como un único texto continuo. No hay ninguna regla que obligue a una grabación a ir por un camino o por el otro. Los dos caminos nunca fueron excluyentes a nivel de archivo completo, solo a nivel de cada tramo.

Por qué la transcripción no te enseña dónde está la costura

Aquí es donde de verdad cuesta razonar sobre esto después de los hechos. Una transcripción terminada se lee como un único texto continuo porque la app hace exactamente lo que querrías que hiciera: coser los tramos en orden y enseñarte las palabras, no la maquinaria que las produjo. No hay marca, ni cambio de color, ni nota en un TXT o JSON exportado que distinga una frase que vino de un paso local de otra que vino de un reintento en el servidor. Las dos llegan por la misma vía y se muestran igual, así que para cuando estás leyendo el resultado, la parte de la grabación que se quedó del todo en tu teléfono y la parte que tocó los servidores de Apple son indistinguibles.

Eso también significa que comprobar una parte no zanja el archivo entero. Probar un trozo de una grabación larga en Modo Avión —o fijarte en que la mayoría de la transcripción volvió rápido, señal aproximada de un paso local— te dice algo sobre el trozo que probaste, no sobre un tramo de dos minutos de ruido veinte minutos después que nunca se comprobó.

Qué cambia esto en cómo pensar sobre el tema

Qué garantiza en realidad el Modo Avión aquí

Apagar la red antes de transcribir no hace que todos los tramos salgan bien: un tramo que hubiera necesitado el servidor para devolver algo aprovechable sigue fallando, igual que fallaría sin conexión en una grabación corta. Lo que garantiza es más concreto y aun así vale la pena tenerlo: sin ninguna ruta de red disponible, ningún tramo, en ningún punto del archivo, tiene adónde mandar su audio. Cambias las palabras que solo el paso por servidor habría recuperado por la certeza de que nada de ninguna parte de la grabación salió. Para una grabación donde cada palabra importa más que esa garantía, es un coste real. Para una donde la garantía es lo importante, es el único método que de verdad la cumple de principio a fin y no solo en una muestra.

Cómo encaja esto en Voice Studio

Voice Studio usa el framework de voz de Apple tal como se describe aquí: reconocimiento local intentado primero, con un reintento contra el servidor de Apple solo para lo que vuelve vacío o lanza un error, y las grabaciones largas procesadas como más de una petición en vez de una sola. Eso significa que una transcripción larga en la app puede ser una mezcla de verdad —parte producida enteramente en el teléfono, parte solo tras un reintento que llegó al servicio de voz de Apple— sin nada en la interfaz de la app ni en su exportación TXT o JSON que marque qué frase vino de qué paso, porque la propia app tampoco lleva esa cuenta. Voice Studio no tiene cuenta, ni servidor propio, ni SDK de analítica, así que el servicio de voz de Apple es el único sitio al que puede ir cualquier audio; si una grabación concreta necesita una garantía que cubra el archivo entero y no solo una comprobación puntual, transcribirla en Modo Avión es la única forma de conseguirla, por las razones de arriba.

Preguntas frecuentes

¿Una grabación larga se manda a la nube de golpe, o por partes?

Por partes. El audio largo se procesa por tramos, y cada tramo se envía a reconocimiento por su cuenta, que es también por lo que cada uno decide entre local y servidor de forma independiente de los demás.

Si la mayor parte de mi grabación se transcribió rápido, ¿significa eso que nada llegó al servidor?

No necesariamente. Una grabación puede ser en su mayoría habla clara que se transcribe en local en segundos y aun así contener un tramo corto de ruido o silencio que volvió vacío y disparó un reintento solo para ese tramo.

¿Puedo saber después qué frases de una transcripción vinieron de qué camino?

No. El texto final es idéntico en ambos casos, y nada en la interfaz de la app ni en un TXT o JSON exportado marca qué tramo se produjo en local frente al reintento en el servidor.

¿Transcribir en Modo Avión garantiza que nada de una grabación larga se mandó a ningún sitio?

Sí, para el archivo entero, porque no hay ninguna ruta de red que ningún tramo pueda usar. La contrapartida es que los tramos que hubieran necesitado el servidor simplemente vuelven vacíos en vez de volver con texto.

Pruébalo en Voice Studio

Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.

Descargar en el App Store

Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior