Guia
De que modelo Whisper precisa realmente?
Tiny, Base, Small, Medium, Large. Maior é mais exato e muito mais lento e, para muitas gravações, a diferença é menor do que o marketing sugere.
Todas as aplicações de transcrição local correm alguma versão do Whisper da OpenAI, e a maioria faz questão de dizer que tamanhos de modelo suporta. Os modelos maiores são genuinamente mais exatos. São também drasticamente mais lentos e muito maiores em disco, e a diferença de exatidão depende muito mais da sua gravação do que do modelo.
Eis como pensar nisto sem comprar por reflexo a coisa maior que estiver à venda.
Os tamanhos #
O Whisper existe em cinco tamanhos principais. Os números importam menos do que a forma da curva:
| Modelo | Parâmetros | Aproximadamente em disco |
|---|---|---|
| Tiny | 39 milhões | ~75 MB |
| Base | 74 milhões | ~140 MB |
| Small | 244 milhões | ~470 MB |
| Medium | 769 milhões | ~1,5 GB |
| Large | 1,5 mil milhões | ~3 GB |
Cada degrau é aproximadamente três vezes o tamanho do anterior, e demora proporcionalmente mais tempo a correr. Passar do Small para o Large é cerca de seis vezes os parâmetros — numa gravação longa, é a diferença entre ir buscar um café e ir almoçar.
A curva de exatidão não sobe nem de perto tão depressa. Sobe acentuadamente do Tiny ao Small, e depois achata.
O que decide de facto a sua exatidão #
É esta a parte que se perde. A qualidade da sua gravação importa mais do que o tamanho do modelo.
Uma gravação limpa — um orador, microfone decente, sala silenciosa, sotaque padrão — transcreve-se bem no Small. Passar esse mesmo ficheiro pelo Large dá-lhe um punhado de palavras corrigidas, na maioria nomes próprios.
O que estraga mesmo a transcrição é:
- Ruído de fundo. Um café, um ar condicionado, o trânsito.
- Fala sobreposta. Duas pessoas a falar ao mesmo tempo é difícil para todos os modelos.
- A distância ao microfone. Áudio gravado do outro lado de uma mesa de reuniões.
- Sotaques fortes ou pouco comuns, sobretudo num idioma que o modelo viu menos durante o treino.
- Vocabulário técnico, nomes e siglas. Nenhum tamanho de modelo resolve um apelido invulgar.
- Idiomas que não o inglês. Os dados de treino do Whisper pendem fortemente para o inglês, por isso a diferença entre tamanhos de modelo é muito maior nos outros idiomas.
Se o seu áudio tiver vários destes problemas, um modelo maior vale mesmo o que custa. Se não tiver nenhum, está a pagar por um erro de arredondamento.
Uma forma prática de escolher #
Tiny — Rascunhos e pesquisabilidade. Bom o suficiente para encontrar a parte de uma gravação de duas horas de que precisa. Não é bom o suficiente para publicar.
Base — Memorandos de voz, notas para si próprio, áudio limpo com um só orador em que vai ler o resultado e saber o que quis dizer.
Small — A escolha sensata por omissão para a maior parte do trabalho. Entrevistas com um microfone decente, episódios de podcast, gravações de aulas, áudio de reuniões em que as pessoas estão perto do microfone. É aqui que a curva achata para fala limpa em inglês.
Medium e Large — Áudio difícil, idiomas que não o inglês, ou qualquer coisa que vá publicar sem ler na íntegra. Também a escolha certa se o seu tempo valer mais do que a espera, e se reler uma transcrição lhe custar mais do que o processamento adicional.
Basta testar #
A resposta honesta é que ninguém lhe consegue dizer a partir de uma descrição das suas gravações, porque as variáveis acima interagem entre si.
Pegue no seu pior ficheiro — o ruidoso, o do sotaque difícil, aquele que já sabe que é um problema — e passe-o por todos os tamanhos de modelo que tiver disponíveis. Compare as transcrições. Esse único teste diz-lhe mais do que qualquer tabela de referência, porque usa o seu microfone, a sua sala e o seu tema.
Se o modelo pequeno der conta do seu ficheiro mais difícil, dará conta de tudo o resto, e acabou de poupar vários gigabytes e muita espera.
Onde esta aplicação se situa #
Sendo direto: o Offline Transcription inclui Tiny, Base e Small. Não inclui Medium nem Large.
Isso cobre a maioria da transcrição do dia a dia — entrevistas limpas, podcasts, aulas, reuniões, memorandos de voz — e mantém a aplicação pequena e rápida, incluindo no iPhone. Se trabalha regularmente com áudio difícil ou com gravações que não em inglês, onde os modelos grandes justificam mesmo o que custam, uma aplicação que os ofereça é uma opção melhor, e a nossa comparação com o MacWhisper di-lo diretamente.
A aplicação é gratuita para transferir, por isso o teste acima não lhe custa nada além do tempo de o fazer.
Uma coisa que não tem nada a ver com o tamanho do modelo #
Seja qual for o modelo que usar, onde ele corre é uma questão separada. O Whisper é um modelo aberto, e pode ser executado na sua própria máquina ou no servidor de alguém. Um serviço de transcrição na nuvem está provavelmente a correr o Large — e a guardar também uma cópia da sua gravação.
Correr o Small localmente e correr o Large no centro de dados de outra pessoa não são pontos na mesma escala. Se a gravação for confidencial, essa decisão vem primeiro, e o tamanho do modelo vem depois. O nosso guia sobre verificar se uma aplicação é mesmo offline explica como o confirmar em qualquer dos casos.
Obter o Offline Transcription
Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.