Guía
Tu transcripción es imprecisa: esto es lo que de verdad lo soluciona
La gente recurre primero a un modelo más grande. Es el cambio menos eficaz de todos, y el micrófono que ya tienes es el más eficaz.
Cuando una transcripción vuelve llena de errores, el instinto es culpar a la herramienta y buscar otra mejor. A veces es lo correcto. Normalmente el problema está más arriba en la cadena, y la solución es gratis.
Esto es lo que de verdad mueve la precisión, ordenado por efecto.
1. La distancia al micrófono (con diferencia, lo mayor) #
El reconocimiento de voz se degrada según la proporción entre la voz y todo lo demás. La distancia destruye esa proporción más rápido que ninguna otra cosa: la presión sonora cae con la distancia mientras el ruido de la sala se mantiene constante, así que cada paso hacia atrás hace que el habla suene más baja en relación con el aire acondicionado, el tráfico y la cafetera.
Un teléfono a cuarenta y cinco centímetros de la boca de quien habla produce una transcripción muchísimo mejor que ese mismo teléfono a dos metros, con la misma app y el mismo modelo. No es un efecto pequeño: es la diferencia entre una transcripción que corriges en cinco minutos y otra que reescribes entera.
Si solo puedes cambiar una cosa, cambia esta.
2. Dónde se coloca la grabadora #
Relacionado pero distinto, y es donde se tuercen las grabaciones de reuniones.
Un dispositivo en el centro de la mesa está a la misma distancia de todos, lo que significa que está lejos de todos y cerca de la mesa, que conduce cada golpecito, cada arrastre y cada taza de café directamente al micrófono. Mejor: levanta la grabadora de la superficie y oriéntala hacia quien más habla.
Para una clase o una presentación, si la sala tiene megafonía o una grabación oficial, esa señal es mejor que cualquier cosa que puedas captar desde un asiento.
3. Fija el idioma de forma explícita #
La detección automática de idioma muestrea el principio del archivo. Si los primeros treinta segundos son ruido de sala, música o alguien hablando en un idioma distinto del resto de la grabación, la detección puede quedarse con el idioma equivocado y seguir equivocada durante todo el archivo.
El síntoma es inconfundible y desconcertante: una transcripción en un idioma que nadie habló, o ráfagas de él. Si conoces el idioma, fíjalo en lugar de dejar que la herramienta adivine. En Offline Transcription puedes mantener pulsado el botón Transcribir de un archivo y elegir su idioma, algo que importa sobre todo cuando tienes varias grabaciones en idiomas distintos.
4. No grabes con demasiada compresión #
Por debajo de unos 64 kbps, la compresión con pérdida elimina el detalle de alta frecuencia que distingue consonantes parecidas: la diferencia entre «quince» y «cincuenta» vive ahí arriba. Ninguna herramienta de transcripción puede recuperar información que el codificador tiró.
Graba sin comprimir o a un bitrate normal. Si te dan un archivo de bitrate bajo, ese es tu techo de precisión y ningún ajuste lo cambia.
5. Recorta el silencio #
Los tramos largos sin habla no son neutros. Whisper genera texto para lo que sea que se le dé y, ante silencio, se repite, a veces durante páginas.
La detección de actividad de voz resuelve esto como es debido, no mostrándole nunca al modelo las partes silenciosas. En su defecto, recorta la grabación antes de transcribir.
6. Y entonces, quizá, un modelo más grande #
Esto va el último de la lista por algo.
El tamaño del modelo sí mejora la precisión, y la mejora es real, pero menor de lo que la gente espera, y cuesta mucho tiempo y mucho disco. Más importante: un modelo más grande no arregla ninguno de los problemas anteriores. Transcribirá algo mejor una grabación lejana, ruidosa y sobrecomprimida, y aun así lo hará mal.
Dicho con honestidad: el tamaño del modelo es un multiplicador de la calidad de tu audio. Multiplicar audio malo te da resultados un poco menos malos. Nuestra guía sobre cómo elegir modelo cubre ese equilibrio.
Lo que no ayuda en absoluto #
Volver a procesar el mismo archivo. El muestreo no es del todo determinista, así que puedes obtener errores ligeramente distintos. Eso es varianza, no mejora.
Subir el volumen. Amplificar una grabación baja amplifica el ruido de sala por igual. La proporción, que es lo que importa, no cambia.
La reducción de ruido, normalmente. El denoising agresivo introduce artefactos que confunden al modelo tanto como lo hacía el ruido. Un filtro paso alto suave para quitar retumbe puede ayudar un poco. El procesado fuerte suele perjudicar.
Pagar más por minuto. Los servicios en la nube ejecutan la misma familia de modelos. El precio no es precisión.
Cómo es un buen resultado #
Incluso con todo bien hecho, la transcripción automática no es perfecta y ninguna herramienta la va a hacer perfecta. Cuenta con que esto seguirá saliendo mal con cierta frecuencia: nombres propios poco conocidos, jerga técnica, cifras dichas rápido y momentos en que dos personas hablan a la vez.
Por eso el flujo de trabajo importa tanto como la precisión: usa una vista por segmentos con marcas de tiempo para poder reproducir el audio que hay detrás de cualquier línea que te genere dudas, y revisa las partes en las que piensas apoyarte. Nuestra guía de entrevistas explica una forma rápida de hacerlo.
La versión corta #
Acerca el micrófono. Saca la grabadora de la mesa y apúntala hacia quien habla. Fija el idioma de forma explícita en vez de fiarte de la detección. No grabes a bitrates bajos. Recorta el silencio o detéctalo. Solo entonces piensa en el tamaño del modelo, que es la menor de las seis palancas.
Consigue Offline Transcription
Transcribe audio y video por completo en tu propio Mac. No se sube nada, no hace falta cuenta y no hay cobro por minuto.