Guía

Cómo manejar una grabación con varios hablantes

Las etiquetas automáticas de hablante son la función más sobrevendida de la transcripción. Esto es lo que la tecnología hace en realidad, y cómo conseguir aun así una transcripción precisa con varios hablantes.

La «identificación automática de hablantes» aparece en la lista de funciones de casi todos los productos de transcripción. Es tecnología real, a veces resulta genuinamente útil y no es ni de lejos tan fiable como sugiere el marketing.

Si vas a transcribir una reunión, una mesa redonda o una entrevista grupal, conviene saber qué estás obteniendo en realidad.

Qué hace la diarización de hablantes #

La diarización es un paso aparte de la transcripción. En lugar de reconocer palabras, agrupa el audio por características de la voz — tono, timbre, cadencia — y decide «este tramo suena a la misma persona que aquel otro». Después etiqueta los grupos como Hablante 1, Hablante 2 y así sucesivamente.

De esa descripción se derivan dos cosas que explican casi todas las quejas sobre la función.

No sabe quién es nadie. Produce «Hablante 1», no «Dra. Chen». Asignar nombres es siempre un paso humano; una herramienta que muestra nombres reales o bien usa metadatos de una plataforma que sabía quién tenía el micrófono abierto, o bien se los dijiste tú.

Funciona por similitud de voz, no por significado. Dos personas con voces parecidas se funden en una sola etiqueta. Una persona cuya voz cambia — se aparta del micrófono, se anima, se une por teléfono — se parte en dos.

Cuándo funciona y cuándo no #

Razonablemente fiable: dos personas, voces distintas, un micrófono cada una o un micrófono compartido cercano, alternando turnos sin mucho solapamiento. Un pódcast de dos personas bien grabado se acerca al mejor de los casos.

Poco fiable: cuatro personas o más. Una sala de reuniones con una sola grabadora en el centro. Cualquiera en manos libres. Voces parecidas: este es un modo de fallo real e incómodo, y afecta de forma desproporcionada a grupos de personas del mismo género y edad similar, que es la mayoría de reuniones.

Prácticamente imposible: el habla superpuesta. Cuando dos personas hablan a la vez, el audio contiene a ambas y la agrupación tiene que elegir una. Es justo ahí donde las transcripciones se atribuyen a la persona equivocada, y es exactamente el momento de una discusión o una negociación en el que más quieres ser preciso.

El fallo que importa #

Un error de transcripción suele ser evidente. Lees una frase que no tiene sentido y vas a comprobarla.

Un error de atribución de hablante es invisible. La frase es correcta, está bien formada y está atribuida a la persona equivocada. Nada en ella parece mal. Si construyes una cita, un acta de reunión o una nota legal sobre eso, el error se propaga en silencio.

Esa asimetría es la razón por la que yo no montaría un flujo de trabajo que dependa de que las etiquetas automáticas sean correctas.

Qué hacer en su lugar #

Si la plataforma sabía quién hablaba, úsalo #

Este es el único caso con una respuesta genuinamente mejor. Zoom, Teams y Meet saben quién tiene el micrófono abierto, así que sus propias transcripciones pueden etiquetar hablantes a partir de metadatos en vez de adivinarlo del audio. Si la atribución precisa es la prioridad y la reunión se grabó en la nube con un plan que incluye transcripción, esa es la fuente más fiable disponible. Nuestra guía de grabaciones de reuniones cubre los compromisos.

Graba de forma que el problema sea menor #

  • Un micrófono por persona si la grabación importa. Las pistas separadas hacen la atribución trivial y eliminan la diarización por completo.
  • Una mesa redonda en la que se pide a la gente que no hable encima de los demás produce una transcripción mucho mejor que una en la que sí lo hacen. Decirlo al empezar una reunión grabada es normal y ayuda a todo el mundo.
  • Pide a cada persona que se identifique la primera vez que hable — «aquí Priya» —, lo que te da un punto de anclaje en la transcripción.

Etiqueta tú, en el momento de usarlo #

Para la mayoría del trabajo no necesitas la transcripción entera etiquetada. Necesitas que los seis pasajes que vas a citar o sobre los que vas a actuar estén etiquetados correctamente.

El método práctico: trabaja en una vista por segmentos con marcas de tiempo, localiza los pasajes que importan, reproduce el audio de esas líneas y escribe el nombre a medida que lo confirmas. De todos modos vas a escuchar esos momentos para revisar las palabras. Etiquetarlos no cuesta nada extra y es el único método que resulta realmente preciso.

Usa la estructura en vez de las etiquetas #

Para mucho trabajo de reuniones, una transcripción con marcas de tiempo y sin etiquetas de hablante es perfectamente utilizable: buscas decisiones y tareas, no estás montando un guion teatral. No dediques una tarde a corregir etiquetas que nunca necesitaste.

Nuestra postura #

Offline Transcription no hace identificación automática de hablantes. Siendo claros sobre el porqué: la familia Whisper no hace diarización, añadirla significa un segundo modelo con las características de fiabilidad descritas arriba, y publicar etiquetas equivocadas de forma invisible es peor para el tipo de trabajo que hacen nuestros usuarios que no publicar etiqueta alguna.

Lo que sí ofrece es el flujo de trabajo que hace rápido el etiquetado manual: cada segmento lleva sus marcas de tiempo y puedes reproducir el audio que hay detrás de cualquier línea para confirmar quién lo dijo antes de escribir un nombre al lado.

Si las etiquetas automáticas son un requisito imprescindible para ti, ese es un motivo legítimo para usar otra herramienta, y prefiero decirlo a fingir lo contrario.

La versión corta #

La diarización agrupa voces; no conoce a las personas. Es aceptable con dos hablantes bien diferenciados y poco fiable con grupos, voces parecidas y habla superpuesta, y sus errores son invisibles de un modo en que los errores de transcripción no lo son. Graba pistas separadas si importa, usa los metadatos de la plataforma si los tienes y, si no, etiqueta de oído el puñado de pasajes que de verdad vayas a usar, en el momento de usarlos.

Consigue Offline Transcription

Transcribe audio y video por completo en tu propio Mac. No se sube nada, no hace falta cuenta y no hay cobro por minuto.

macOS 13.0 or higher · iOS 16.4 or higher