Guía

¿Qué modelo de Whisper necesitas en realidad?

Tiny, Base, Small, Medium, Large. Más grande es más preciso y mucho más lento, y en muchas grabaciones la diferencia es menor de lo que sugiere el marketing.

Toda app de transcripción local ejecuta alguna versión de Whisper, de OpenAI, y casi todas hacen hincapié en qué tamaños de modelo admiten. Los modelos más grandes son genuinamente más precisos. También son mucho más lentos y ocupan mucho más disco, y la diferencia de precisión depende bastante más de tu grabación que del modelo.

Así es como conviene pensarlo, sin comprar por reflejo lo más grande que haya en el escaparate.

Los tamaños #

Whisper viene en cinco tamaños principales. Las cifras importan menos que la forma de la curva:

Modelo Parámetros Aproximadamente en disco
Tiny 39 millones ~75 MB
Base 74 millones ~140 MB
Small 244 millones ~470 MB
Medium 769 millones ~1,5 GB
Large 1.500 millones ~3 GB

Cada escalón es aproximadamente tres veces el tamaño del anterior y tarda proporcionalmente más en ejecutarse. Pasar de Small a Large es unas seis veces los parámetros: en una grabación larga, esa es la diferencia entre prepararse un café e irse a comer.

La curva de precisión no sube ni de lejos así de rápido. Asciende con fuerza de Tiny a Small y luego se aplana.

Qué decide en realidad tu precisión #

Esta es la parte que se pierde de vista. La calidad de tu grabación importa más que el tamaño del modelo.

Una grabación limpia — un solo hablante, micrófono decente, sala tranquila, acento estándar — se transcribirá bien con Small. Pasar ese mismo archivo por Large te da un puñado de palabras corregidas, sobre todo nombres propios.

Lo que de verdad rompe una transcripción es:

  • El ruido de fondo. Una cafetería, un aire acondicionado, el tráfico.
  • El habla superpuesta. Dos personas hablando a la vez es difícil para todos los modelos.
  • La distancia al micrófono. Audio grabado desde el otro extremo de la mesa de una sala de reuniones.
  • Acentos marcados o poco comunes, sobre todo en un idioma del que el modelo vio menos durante el entrenamiento.
  • El vocabulario técnico, los nombres y los acrónimos. Ningún tamaño de modelo arregla un apellido poco habitual.
  • Los idiomas distintos del inglés. Los datos de entrenamiento de Whisper están muy escorados hacia el inglés, así que la diferencia entre tamaños de modelo es mucho mayor en otros idiomas.

Si tu audio tiene varios de esos rasgos, un modelo más grande vale dinero de verdad. Si no tiene ninguno, estás pagando por un error de redondeo.

Una forma práctica de elegir #

Tiny — Borradores y capacidad de búsqueda. Suficiente para encontrar qué parte de una grabación de dos horas necesitas. No suficiente para publicar.

Base — Notas de voz, apuntes para ti mismo, audio limpio de un solo hablante donde vas a leer el resultado y sabes qué quisiste decir.

Small — La opción sensata por defecto para la mayoría del trabajo. Entrevistas con un micrófono decente, episodios de pódcast, grabaciones de clases, audio de reuniones donde la gente está cerca del micrófono. Aquí es donde la curva se aplana para el habla limpia en inglés.

Medium y Large — Audio difícil, idiomas distintos del inglés o cualquier cosa que vayas a publicar sin leerla entera. También la elección correcta si tu tiempo vale más que la espera y releer una transcripción te cuesta más que el procesamiento extra.

Simplemente pruébalo #

La respuesta honesta es que nadie puede decírtelo a partir de una descripción de tus grabaciones, porque las variables de arriba interactúan entre sí.

Coge tu peor archivo — el ruidoso, el del acento difícil, el que ya sabes que es un problema — y pásalo por todos los tamaños de modelo que tengas disponibles. Compara las transcripciones. Esa única prueba te dirá más que cualquier tabla comparativa, porque usa tu micrófono, tu sala y tu materia.

Si el modelo pequeño se apaña con tu archivo más difícil, se apañará con todo lo demás, y acabas de ahorrarte varios gigabytes y mucha espera.

Dónde encaja esta app #

Siendo claros: Offline Transcription incluye Tiny, Base y Small. No incluye Medium ni Large.

Eso cubre la mayoría de la transcripción cotidiana — entrevistas limpias, pódcast, clases, reuniones, notas de voz — y mantiene la app pequeña y rápida, también en el iPhone. Si trabajas habitualmente con audio difícil o con grabaciones en idiomas distintos del inglés, donde los modelos grandes sí se ganan el sueldo, una app que los ofrezca encaja mejor, y nuestra comparativa con MacWhisper lo dice directamente.

La app es gratis de descargar, así que la prueba de arriba no te cuesta más que el tiempo de ejecutarla.

Una cosa que no tiene nada que ver con el tamaño del modelo #

Uses el modelo que uses, dónde se ejecuta es una cuestión aparte. Whisper es un modelo abierto, y se puede ejecutar en tu propia máquina o en el servidor de alguien. Un servicio de transcripción en la nube probablemente ejecuta Large, y además guarda una copia de tu grabación.

Ejecutar Small en local y ejecutar Large en el centro de datos de otra persona no son dos puntos de la misma escala. Si la grabación es confidencial, esa decisión va primero y el tamaño del modelo va después. Nuestra guía sobre cómo comprobar si una app funciona realmente sin conexión explica cómo verificarlo en cualquiera de los dos casos.

Consigue Offline Transcription

Transcribe audio y video por completo en tu propio Mac. No se sube nada, no hace falta cuenta y no hay cobro por minuto.

macOS 13.0 or higher · iOS 16.4 or higher