Guia

Porque é que a transcrição é lenta no seu Mac

A mesma gravação pode demorar dois minutos ou quarenta em Macs diferentes com a mesma aplicação. Quatro coisas explicam quase toda a diferença.

A velocidade da transcrição local varia enormemente, e não em proporção com a idade do seu Mac nem com o que pagou por ele. A mesma gravação de uma hora pode demorar três minutos numa máquina e meia hora noutra, com a mesma aplicação.

Quatro coisas explicam quase tudo isso.

1. Apple Silicon versus Intel #

Este é o fator principal, e não é uma diferença pequena.

A transcrição é dominada por aritmética de matrizes. O Apple Silicon tem duas coisas que lhe assentam especificamente: um Neural Engine construído exatamente para essa aritmética, e memória unificada, para que os pesos do modelo não tenham de ser copiados de um lado para o outro entre a memória da CPU e a da GPU.

Um Mac Intel não tem nenhuma das duas. Não tem Neural Engine nenhum, por isso o codificador — a metade dispendiosa do modelo — recorre à CPU ou a uma GPU dedicada do outro lado de um barramento. O resultado é muitas vezes várias vezes mais lento no mesmo ficheiro.

Se tiver um Mac Intel, a transcrição continua perfeitamente utilizável; é apenas algo que inicia e a que volta mais tarde, em vez de ficar a ver. Nenhum software fecha essa diferença, porque a diferença é uma peça de silício.

2. Se a aplicação usa sequer o Neural Engine #

Duas aplicações no mesmo Mac da série M podem diferir por um fator grande, porque usar o Neural Engine não é automático.

O modelo tem de ser previamente compilado para o formato do Core ML para que o codificador possa correr lá. As aplicações que incluem um codificador Core ML a par dos pesos ficam com o caminho rápido; as que não incluem correm tudo na GPU ou na CPU e deixam muito desempenho por usar.

Não consegue ver isto de fora, mas sente-o: se uma aplicação de transcrição local for drasticamente mais rápida do que outra na sua máquina, normalmente é por isto.

3. Tamanho do modelo #

Os tamanhos do Whisper diferem cerca de 3× em parâmetros a cada degrau, e o tempo acompanha-os. Passar do Base para o Large é cerca de vinte vezes os parâmetros — num ficheiro longo, é a diferença entre um café e uma tarde.

Se uma aplicação usar por omissão um modelo grande, ou se escolheu um porque maior soava melhor, isso por si só pode explicar a espera. O ganho de exatidão é muito menor do que a diferença de tamanho sugere e, para fala limpa, é muitas vezes impercetível.

4. Quanto silêncio está a pagar para transcrever #

Uma gravação de duas horas de uma reunião de noventa minutos contém trinta minutos de nada. Sem deteção de atividade vocal, o modelo processa tudo isso — descodificando silêncio ao mesmo custo que descodificar fala, e produzindo texto repetido e inútil enquanto o faz.

As aplicações que correm VAD primeiro saltam esses trechos por completo. Em gravações com muito tempo morto, esta não é uma poupança marginal.

O que a torna mais rápida de facto #

Por ordem de efeito:

  1. Use um modelo mais pequeno. O Base chega para a maior parte da fala limpa, e é muitas vezes mais rápido do que o Large.
  2. Use uma aplicação com um codificador Core ML, se estiver em Apple Silicon.
  3. Corte o tempo morto, ou use uma ferramenta que detete a fala primeiro.
  4. Feche tudo o resto que esteja a competir. A transcrição usa todos os núcleos que conseguir. Uma exportação de vídeo em segundo plano corta o seu débito para metade.
  5. Ligue o portátil à corrente. Com bateria, o macOS limita o trabalho sustentado; o modo de baixo consumo fá-lo de forma agressiva.

O que não a torna mais rápida #

Mais RAM, a não ser que estivesse a usar memória virtual — o conjunto de trabalho é menor do que as pessoas assumem.

Internet mais rápida. Não há passo de rede na transcrição local. Se a sua velocidade depende da ligação, o trabalho não está a acontecer na sua máquina.

Reiniciar o processo. Se uma execução estiver lenta, reiniciar recomeça o mesmo trabalho do zero.

Uma expectativa aproximada #

Num Mac com Apple Silicon, com um modelo Base e um codificador Core ML, a transcrição corre várias vezes mais depressa do que o tempo real — uma gravação de uma hora termina em poucos minutos. A nossa própria medição num ficheiro de duas horas ficou abaixo dos três minutos de ponta a ponta.

Num Mac Intel, conte que demore uma fração considerável da duração da gravação. Continua a valer a pena, continua a ser gratuito, apenas não é algo para ficar a ver.

Se estiver muito fora destes intervalos em Apple Silicon, as causas prováveis são, por ordem: um modelo grande, uma aplicação que não usa o Neural Engine, ou muito outro trabalho a competir pela máquina.

A versão curta #

Apple Silicon versus Intel é o maior fator e não o consegue resolver por software. Depois disso: use um modelo mais pequeno, use uma aplicação que compile o codificador para o Neural Engine, salte o silêncio em vez de o transcrever, e não a ponha a correr ao mesmo tempo que uma exportação de vídeo com o portátil a bateria.

Obter o Offline Transcription

Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.

macOS 13.0 or higher · iOS 16.4 or higher