Cómo juntar varias transcripciones de notas de voz en un solo documento
Una app de transcripción transcribe una grabación cada vez, porque esa es la unidad que realmente tiene: el audio capturado en una toma continua. Cuando lo que de verdad quieres es una semana de diario, o las dos mitades de una entrevista, leídas como una sola pieza, eso es texto, y el texto se puede juntar. Lo que no hace es juntarse solo.
Esto pasa más de lo que sugiere la palabra «fusionar». Casi nunca es una grabación que se partió por accidente en dos. Lo normal es que sean varias grabaciones que siempre fueron independientes —una segunda sesión de la misma entrevista otro día, un curso donde cada clase es su propio archivo, un proyecto sobre el que llevas apuntando notas de voz durante una semana— y que solo ahora quieres leer juntas, como un documento, en vez de como una estantería de entradas con su propio título cada una.
Cuándo son de verdad varias grabaciones, y no una que se rompió
Merece la pena precisar esto, porque cambia lo que estás buscando. Una única grabación continua interrumpida por una llamada no necesita juntarse con nada: la app la pausa en la interrupción y reanuda en el mismo archivo, así que acabas con una grabación con un hueco, no con dos. Que un mismo momento termine en dos archivos suele deberse a algo concreto: el teléfono se quedó sin espacio o sin batería a mitad y el resto tuvo que ser una grabación nueva una vez resuelto eso, o una interrupción por llamada llegó en un momento en el que de verdad no se pudo reanudar. Si te acaba de pasar cualquiera de las dos cosas, merece la pena leer sobre ello por separado. Esta página trata del caso mucho más habitual: grabaciones que nunca fueron una sola toma y que ahora quieres reunir de todos modos en un único documento.
No hay una función para fusionar en bloque, y no pasa nada
Ninguna app de grabación vigila qué grabaciones están relacionadas y se ofrece a coserlas: eso exigiría adivinar cuáles van juntas, y esa es una decisión que solo puedes tomar tú. Lo que sí tiene cada grabación es una transcripción que puedes sacar como texto plano, y montar texto plano en un solo documento es un trabajo de cinco minutos con herramientas que ya tienes, no una función que falta.
Corrige cada transcripción antes de juntarlas, no después
Haz esto primero, porque resulta mucho más pesado cuando varias transcripciones ya están pegadas en un mismo documento. El reconocimiento de voz no tiene memoria entre grabaciones: un nombre que se le resistió el lunes se vuelve a adivinar desde cero el jueves, y no hay motivo para esperar que acierte con la misma grafía equivocada dos veces. Lee cada transcripción por separado y corrige lo que esté mal mientras sigue siendo un solo archivo y todavía recuerdas lo que se dijo de verdad; encontrar una grafía distinta del mismo nombre repartida en tres transcripciones distintas, una vez que ya son un solo documento, es una lectura mucho más difícil.
Decide el orden antes de pegar nada
Cronológico es la opción por defecto acertada en casi todos los casos a los que se aplica esto: una entrevista en varias sesiones, una semana de diario, un curso de clases. Ordena la biblioteca por fecha para ver el orden real en que ocurrieron las cosas, en lugar de fiarte de la memoria o del orden en que las grabaciones aparecen en pantalla; el orden en que grabaste y el orden en que las estás mirando ahora no siempre coinciden.
Exportar cada una
Para un documento pensado para leerse, exporta en TXT y no en JSON. La exportación TXT ya coloca el título, la fecha, la hora y el lugar encima de la transcripción, y esa cabecera hace un trabajo útil aquí más allá de para lo que se pensó: una vez que varias transcripciones están pegadas en un solo documento, es lo que te dice dónde acaba una grabación y empieza la siguiente. Consérvala en vez de quitarla para que la página se vea más limpia.
Con dos o tres grabaciones, exportar una a una por la hoja de compartir y pegar cada texto en una app de notas o de documentos conforme sale es todo el trabajo. Para una serie más larga —un curso entero, un mes de diario— sacarlo todo de una vez por la app Archivos es más rápido que repetir la hoja de compartir grabación por grabación, porque te deja todos los archivos exportados en un mismo sitio en vez de uno a uno.
Montar el documento
Pega cada transcripción en el orden que hayas decidido y deja su cabecera de TXT en su sitio como separador de sección: así acabas con un único documento donde «la sesión del martes» y «la sesión del jueves» son visibles y se pueden distinguir, en vez de un bloque de texto sin diferenciar que antes eran dos grabaciones separadas. Basta con una línea en blanco o una raya entre secciones; no hace falta nada más elaborado para un documento cuyo único propósito es leerse de un tirón.
Cuándo el JSON es en realidad la mejor fuente
Pegar a mano es la herramienta adecuada para un puñado de grabaciones que va a leer una persona. Si en cambio estás montando algo que procesa muchas transcripciones de forma recurrente —importarlas a una hoja de cálculo, alimentar un script que te arma el documento—, JSON es el formato pensado para eso. Mantiene la fecha, la duración y la transcripción como campos separados que un programa puede ordenar y coser de forma fiable, en vez de texto que una persona tiene que leer y colocar a ojo. Cuál es el correcto depende por completo de si quien monta el documento es una persona o un programa, no de cuál formato sea «mejor».
Qué no pasa al documento combinado
Un marcador colocado en una de las grabaciones originales es una línea en la forma de onda de esa grabación, pensada para llevar la reproducción de vuelta a un momento del audio: no tiene equivalente en texto plano, así que no aparece en la exportación y no puede aparecer en un documento hecho a partir de varias exportaciones pegadas. Si un momento marcado durante la grabación merece la pena conservarlo en el documento combinado, eso es una nota manual que añades tú al montarlo, no algo que sobreviva a la exportación por sí solo.
Esto no es el mismo trabajo que una copia de seguridad completa
Una copia completa es un único JSON con todas las grabaciones del teléfono, pensado para restaurar toda la biblioteca, no para que un puñado de grabaciones relacionadas se lean como un solo documento. No sabe qué grabaciones van juntas y no está pensada para abrirse y leerse como se lee un documento combinado: es un seguro para el día en que se pierde el teléfono, no un atajo para esto. Construir el documento que de verdad quieres leer sigue significando elegir las grabaciones relevantes y exportarlas una a una, tengas o no también una copia completa funcionando aparte.
Cómo encaja esto en Voice Studio
No hay una forma integrada de seleccionar varias grabaciones y exportar un documento combinado: cada grabación exporta su transcripción como TXT o JSON por su cuenta, o su audio como el .m4a original, y la biblioteca se puede ordenar por más reciente, por duración o por número de palabras para tener las grabaciones en el orden que necesitas antes de empezar. La transcripción sigue siendo editable hasta el momento de exportarla, así que corregir un nombre en la sesión del lunes antes de pegarla junto a la del jueves cuesta un momento ahí y ahorra una lectura mucho más larga después. Nada de esto necesita Pro: la exportación, y la edición que hace que merezca la pena exportar, están las dos en la app gratuita.
Preguntas frecuentes
¿Hay alguna forma de seleccionar varias grabaciones y exportar un archivo combinado?
No. Cada grabación exporta su transcripción o su audio por separado, como TXT, JSON o el .m4a original. Juntar varias en un documento significa exportar cada una y montarlas tú mismo, lo que para un puñado de grabaciones es un trabajo corto.
¿En qué orden deberían ir las transcripciones?
Cronológico, casi siempre que se plantea esto: una entrevista en varias sesiones, un curso de clases, una tanda de entradas de diario. Ordena la biblioteca por fecha en vez de fiarte del orden en que las grabaciones aparecen en pantalla.
¿Un marcador que puse durante la grabación aparecerá en el documento combinado?
No. Un marcador es una posición en la forma de onda de esa grabación, pensada para llevar la reproducción de vuelta a un momento; no tiene equivalente en texto y no aparece en una exportación TXT ni JSON. Anota tú el momento si necesita sobrevivir en el documento combinado.
¿Debería usar la copia completa en vez de exportar cada grabación por separado?
No. La copia completa es un único JSON con toda la biblioteca, pensado para restaurarlo todo si se pierde el teléfono, no para montar un puñado de grabaciones relacionadas en un documento legible. Exporta las grabaciones concretas que necesitas, una a una.
Pruébalo en Voice Studio
Voice Studio graba, transcribe dentro de tu iPhone y archiva cada nota por hora y lugar, para que la idea que se te ocurrió en el coche siga estando localizable el mes que viene.
Descarga gratuita · iPhone y iPad · iOS 16.4 o posterior