Guía
Por qué la transcripción va lenta en tu Mac
La misma grabación puede tardar dos minutos o cuarenta en distintos Mac con la misma app. Cuatro cosas explican casi toda la diferencia.
La velocidad de la transcripción local varía enormemente, y no en proporción a lo nuevo que sea tu Mac ni a lo que pagaste por él. La misma grabación de una hora puede tardar tres minutos en una máquina y media hora en otra, con la misma app.
Cuatro cosas explican casi todo.
1. Apple Silicon frente a Intel #
Este es el factor grande, y no es una diferencia pequeña.
La transcripción está dominada por la aritmética matricial. Apple Silicon tiene dos cosas que le vienen específicamente bien: un Neural Engine construido justo para esa aritmética y memoria unificada, de modo que los pesos del modelo no tienen que copiarse de un lado a otro entre la memoria de la CPU y la de la GPU.
Un Mac con Intel no tiene ninguna de las dos. No tiene Neural Engine en absoluto, así que el codificador — la mitad cara del modelo — recae en la CPU o en una GPU discreta al otro lado de un bus. El resultado suele ser varias veces más lento con el mismo archivo.
Si tienes un Mac con Intel, la transcripción sigue siendo perfectamente utilizable; simplemente es algo que lanzas y a lo que vuelves más tarde, en vez de quedarte mirando. Ningún software cierra esa brecha, porque la brecha es un trozo de silicio.
2. Si la app usa siquiera el Neural Engine #
Dos apps en el mismo Mac de la serie M pueden diferir por un factor grande, porque usar el Neural Engine no es automático.
El modelo tiene que compilarse por adelantado al formato de Core ML para que el codificador se ejecute ahí. Las apps que distribuyen un codificador de Core ML junto a los pesos toman la vía rápida; las que no lo hacen ejecutan todo en la GPU o la CPU y dejan mucho rendimiento sin usar.
Esto no se ve desde fuera, pero se nota: si una app de transcripción local es muchísimo más rápida que otra en tu máquina, normalmente es por esto.
3. El tamaño del modelo #
Los tamaños de Whisper se diferencian aproximadamente en 3× en parámetros en cada escalón, y el tiempo escala con ellos. Pasar de Base a Large son unas veinte veces los parámetros: en un archivo largo, esa es la diferencia entre un café y una tarde entera.
Si una app usa un modelo grande por defecto, o si elegiste uno porque «más grande» sonaba mejor, eso por sí solo puede explicar la espera. La ganancia de precisión es mucho menor de lo que sugiere la diferencia de tamaño, y en el habla limpia a menudo es imperceptible.
4. Cuánto silencio estás pagando por transcribir #
Una grabación de dos horas de una reunión de noventa minutos contiene treinta minutos de nada. Sin detección de actividad de voz, el modelo lo procesa todo, decodificando silencio con el mismo coste que decodificar habla y produciendo texto basura repetido mientras lo hace.
Las apps que ejecutan VAD primero se saltan esos tramos por completo. En grabaciones con mucho tiempo muerto, no es un ahorro marginal.
Qué la hace más rápida de verdad #
Por orden de efecto:
- Usa un modelo más pequeño. Base basta para la mayoría del habla limpia, y es muchas veces más rápido que Large.
- Usa una app con codificador de Core ML si estás en Apple Silicon.
- Recorta el tiempo muerto, o usa una herramienta que detecte el habla primero.
- Cierra todo lo demás que esté compitiendo. La transcripción usará todos los núcleos que pueda conseguir. Una exportación de vídeo en segundo plano reduce tu rendimiento a la mitad.
- Enchufa el portátil. Con batería, macOS limita el trabajo sostenido; el modo de bajo consumo lo hace de forma agresiva.
Qué no la hace más rápida #
Más RAM, salvo que estuvieras usando memoria de intercambio: el conjunto de trabajo es menor de lo que la gente supone.
Internet más rápida. No hay ningún paso de red en la transcripción local. Si tu velocidad depende de tu conexión, el trabajo no está ocurriendo en tu máquina.
Reiniciarla. Si una pasada va lenta, reiniciar empieza el mismo trabajo desde cero.
Una expectativa aproximada #
En un Mac con Apple Silicon, con un modelo Base y un codificador de Core ML, la transcripción va varias veces más rápido que el tiempo real: una grabación de una hora termina en unos pocos minutos. Nuestra propia medición con un archivo de dos horas fue de menos de tres minutos de principio a fin.
En un Mac con Intel, cuenta con que tarde una fracción notable de la duración de la grabación. Sigue mereciendo la pena, sigue siendo gratis; simplemente no es algo que quedarse mirando.
Si estás muy fuera de esos rangos en Apple Silicon, las causas probables son, por orden: un modelo grande, una app que no usa el Neural Engine, o mucho otro trabajo compitiendo por la máquina.
La versión corta #
Apple Silicon frente a Intel es el mayor factor y no puedes arreglarlo por software. Después de eso: usa un modelo más pequeño, usa una app que compile el codificador para el Neural Engine, sáltate el silencio en vez de transcribirlo, y no lo ejecutes junto a una exportación de vídeo con la batería.
Consigue Offline Transcription
Transcribe audio y video por completo en tu propio Mac. No se sube nada, no hace falta cuenta y no hay cobro por minuto.