Guia
Porque é que a transcrição é lenta no seu Mac
A mesma gravação pode demorar dois minutos ou quarenta em Macs diferentes com a mesma aplicação. Quatro coisas explicam quase toda a diferença.
A velocidade da transcrição local varia enormemente, e não em proporção com a idade do seu Mac nem com o que pagou por ele. A mesma gravação de uma hora pode demorar três minutos numa máquina e meia hora noutra, com a mesma aplicação.
Quatro coisas explicam quase tudo isso.
1. Apple Silicon versus Intel #
Este é o fator principal, e não é uma diferença pequena.
A transcrição é dominada por aritmética de matrizes. O Apple Silicon tem duas coisas que lhe assentam especificamente: um Neural Engine construído exatamente para essa aritmética, e memória unificada, para que os pesos do modelo não tenham de ser copiados de um lado para o outro entre a memória da CPU e a da GPU.
Um Mac Intel não tem nenhuma das duas. Não tem Neural Engine nenhum, por isso o codificador — a metade dispendiosa do modelo — recorre à CPU ou a uma GPU dedicada do outro lado de um barramento. O resultado é muitas vezes várias vezes mais lento no mesmo ficheiro.
Se tiver um Mac Intel, a transcrição continua perfeitamente utilizável; é apenas algo que inicia e a que volta mais tarde, em vez de ficar a ver. Nenhum software fecha essa diferença, porque a diferença é uma peça de silício.
2. Se a aplicação usa sequer o Neural Engine #
Duas aplicações no mesmo Mac da série M podem diferir por um fator grande, porque usar o Neural Engine não é automático.
O modelo tem de ser previamente compilado para o formato do Core ML para que o codificador possa correr lá. As aplicações que incluem um codificador Core ML a par dos pesos ficam com o caminho rápido; as que não incluem correm tudo na GPU ou na CPU e deixam muito desempenho por usar.
Não consegue ver isto de fora, mas sente-o: se uma aplicação de transcrição local for drasticamente mais rápida do que outra na sua máquina, normalmente é por isto.
3. Tamanho do modelo #
Os tamanhos do Whisper diferem cerca de 3× em parâmetros a cada degrau, e o tempo acompanha-os. Passar do Base para o Large é cerca de vinte vezes os parâmetros — num ficheiro longo, é a diferença entre um café e uma tarde.
Se uma aplicação usar por omissão um modelo grande, ou se escolheu um porque maior soava melhor, isso por si só pode explicar a espera. O ganho de exatidão é muito menor do que a diferença de tamanho sugere e, para fala limpa, é muitas vezes impercetível.
4. Quanto silêncio está a pagar para transcrever #
Uma gravação de duas horas de uma reunião de noventa minutos contém trinta minutos de nada. Sem deteção de atividade vocal, o modelo processa tudo isso — descodificando silêncio ao mesmo custo que descodificar fala, e produzindo texto repetido e inútil enquanto o faz.
As aplicações que correm VAD primeiro saltam esses trechos por completo. Em gravações com muito tempo morto, esta não é uma poupança marginal.
O que a torna mais rápida de facto #
Por ordem de efeito:
- Use um modelo mais pequeno. O Base chega para a maior parte da fala limpa, e é muitas vezes mais rápido do que o Large.
- Use uma aplicação com um codificador Core ML, se estiver em Apple Silicon.
- Corte o tempo morto, ou use uma ferramenta que detete a fala primeiro.
- Feche tudo o resto que esteja a competir. A transcrição usa todos os núcleos que conseguir. Uma exportação de vídeo em segundo plano corta o seu débito para metade.
- Ligue o portátil à corrente. Com bateria, o macOS limita o trabalho sustentado; o modo de baixo consumo fá-lo de forma agressiva.
O que não a torna mais rápida #
Mais RAM, a não ser que estivesse a usar memória virtual — o conjunto de trabalho é menor do que as pessoas assumem.
Internet mais rápida. Não há passo de rede na transcrição local. Se a sua velocidade depende da ligação, o trabalho não está a acontecer na sua máquina.
Reiniciar o processo. Se uma execução estiver lenta, reiniciar recomeça o mesmo trabalho do zero.
Uma expectativa aproximada #
Num Mac com Apple Silicon, com um modelo Base e um codificador Core ML, a transcrição corre várias vezes mais depressa do que o tempo real — uma gravação de uma hora termina em poucos minutos. A nossa própria medição num ficheiro de duas horas ficou abaixo dos três minutos de ponta a ponta.
Num Mac Intel, conte que demore uma fração considerável da duração da gravação. Continua a valer a pena, continua a ser gratuito, apenas não é algo para ficar a ver.
Se estiver muito fora destes intervalos em Apple Silicon, as causas prováveis são, por ordem: um modelo grande, uma aplicação que não usa o Neural Engine, ou muito outro trabalho a competir pela máquina.
A versão curta #
Apple Silicon versus Intel é o maior fator e não o consegue resolver por software. Depois disso: use um modelo mais pequeno, use uma aplicação que compile o codificador para o Neural Engine, salte o silêncio em vez de o transcrever, e não a ponha a correr ao mesmo tempo que uma exportação de vídeo com o portátil a bateria.
Obter o Offline Transcription
Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.