Guia

De que modelo Whisper precisa realmente?

Tiny, Base, Small, Medium, Large. Maior é mais exato e muito mais lento e, para muitas gravações, a diferença é menor do que o marketing sugere.

Todas as aplicações de transcrição local correm alguma versão do Whisper da OpenAI, e a maioria faz questão de dizer que tamanhos de modelo suporta. Os modelos maiores são genuinamente mais exatos. São também drasticamente mais lentos e muito maiores em disco, e a diferença de exatidão depende muito mais da sua gravação do que do modelo.

Eis como pensar nisto sem comprar por reflexo a coisa maior que estiver à venda.

Os tamanhos #

O Whisper existe em cinco tamanhos principais. Os números importam menos do que a forma da curva:

Modelo Parâmetros Aproximadamente em disco
Tiny 39 milhões ~75 MB
Base 74 milhões ~140 MB
Small 244 milhões ~470 MB
Medium 769 milhões ~1,5 GB
Large 1,5 mil milhões ~3 GB

Cada degrau é aproximadamente três vezes o tamanho do anterior, e demora proporcionalmente mais tempo a correr. Passar do Small para o Large é cerca de seis vezes os parâmetros — numa gravação longa, é a diferença entre ir buscar um café e ir almoçar.

A curva de exatidão não sobe nem de perto tão depressa. Sobe acentuadamente do Tiny ao Small, e depois achata.

O que decide de facto a sua exatidão #

É esta a parte que se perde. A qualidade da sua gravação importa mais do que o tamanho do modelo.

Uma gravação limpa — um orador, microfone decente, sala silenciosa, sotaque padrão — transcreve-se bem no Small. Passar esse mesmo ficheiro pelo Large dá-lhe um punhado de palavras corrigidas, na maioria nomes próprios.

O que estraga mesmo a transcrição é:

  • Ruído de fundo. Um café, um ar condicionado, o trânsito.
  • Fala sobreposta. Duas pessoas a falar ao mesmo tempo é difícil para todos os modelos.
  • A distância ao microfone. Áudio gravado do outro lado de uma mesa de reuniões.
  • Sotaques fortes ou pouco comuns, sobretudo num idioma que o modelo viu menos durante o treino.
  • Vocabulário técnico, nomes e siglas. Nenhum tamanho de modelo resolve um apelido invulgar.
  • Idiomas que não o inglês. Os dados de treino do Whisper pendem fortemente para o inglês, por isso a diferença entre tamanhos de modelo é muito maior nos outros idiomas.

Se o seu áudio tiver vários destes problemas, um modelo maior vale mesmo o que custa. Se não tiver nenhum, está a pagar por um erro de arredondamento.

Uma forma prática de escolher #

Tiny — Rascunhos e pesquisabilidade. Bom o suficiente para encontrar a parte de uma gravação de duas horas de que precisa. Não é bom o suficiente para publicar.

Base — Memorandos de voz, notas para si próprio, áudio limpo com um só orador em que vai ler o resultado e saber o que quis dizer.

Small — A escolha sensata por omissão para a maior parte do trabalho. Entrevistas com um microfone decente, episódios de podcast, gravações de aulas, áudio de reuniões em que as pessoas estão perto do microfone. É aqui que a curva achata para fala limpa em inglês.

Medium e Large — Áudio difícil, idiomas que não o inglês, ou qualquer coisa que vá publicar sem ler na íntegra. Também a escolha certa se o seu tempo valer mais do que a espera, e se reler uma transcrição lhe custar mais do que o processamento adicional.

Basta testar #

A resposta honesta é que ninguém lhe consegue dizer a partir de uma descrição das suas gravações, porque as variáveis acima interagem entre si.

Pegue no seu pior ficheiro — o ruidoso, o do sotaque difícil, aquele que já sabe que é um problema — e passe-o por todos os tamanhos de modelo que tiver disponíveis. Compare as transcrições. Esse único teste diz-lhe mais do que qualquer tabela de referência, porque usa o seu microfone, a sua sala e o seu tema.

Se o modelo pequeno der conta do seu ficheiro mais difícil, dará conta de tudo o resto, e acabou de poupar vários gigabytes e muita espera.

Onde esta aplicação se situa #

Sendo direto: o Offline Transcription inclui Tiny, Base e Small. Não inclui Medium nem Large.

Isso cobre a maioria da transcrição do dia a dia — entrevistas limpas, podcasts, aulas, reuniões, memorandos de voz — e mantém a aplicação pequena e rápida, incluindo no iPhone. Se trabalha regularmente com áudio difícil ou com gravações que não em inglês, onde os modelos grandes justificam mesmo o que custam, uma aplicação que os ofereça é uma opção melhor, e a nossa comparação com o MacWhisper di-lo diretamente.

A aplicação é gratuita para transferir, por isso o teste acima não lhe custa nada além do tempo de o fazer.

Uma coisa que não tem nada a ver com o tamanho do modelo #

Seja qual for o modelo que usar, onde ele corre é uma questão separada. O Whisper é um modelo aberto, e pode ser executado na sua própria máquina ou no servidor de alguém. Um serviço de transcrição na nuvem está provavelmente a correr o Large — e a guardar também uma cópia da sua gravação.

Correr o Small localmente e correr o Large no centro de dados de outra pessoa não são pontos na mesma escala. Se a gravação for confidencial, essa decisão vem primeiro, e o tamanho do modelo vem depois. O nosso guia sobre verificar se uma aplicação é mesmo offline explica como o confirmar em qualquer dos casos.

Obter o Offline Transcription

Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.

macOS 13.0 or higher · iOS 16.4 or higher