Guia
A sua transcrição está imprecisa — eis o que a corrige mesmo
As pessoas começam por procurar um modelo maior. É a alteração menos eficaz que existe, e o microfone que já tem é a mais eficaz.
Quando uma transcrição volta cheia de erros, o instinto é culpar a ferramenta e ir à procura de outra melhor. Às vezes é o correto. Normalmente o problema está a montante, e a solução é gratuita.
Eis o que melhora mesmo a exatidão, por ordem de efeito.
1. A distância ao microfone (de longe a maior) #
O reconhecimento de fala degrada-se com a relação entre a voz e tudo o resto. A distância destrói essa relação mais depressa do que qualquer outra coisa: a pressão sonora diminui com a distância enquanto o ruído da sala se mantém constante, por isso cada passo atrás torna a fala mais silenciosa em relação ao ar condicionado, ao trânsito e à máquina do café.
Um telemóvel a meio metro da boca de quem fala produz uma transcrição drasticamente melhor do que o mesmo telemóvel a dois metros, com a mesma aplicação e o mesmo modelo. Não é um efeito pequeno — é a diferença entre uma transcrição que corrige em cinco minutos e outra que volta a escrever de raiz.
Se só puder mudar uma coisa, mude esta.
2. Onde fica o gravador #
Relacionado mas distinto, e é aqui que as gravações de reuniões correm mal.
Um dispositivo no meio da mesa está equidistante de todos, o que significa que está longe de todos e perto da mesa — que conduz cada pancadinha, cada arrastar e cada chávena de café diretamente para o microfone. Melhor: levante o gravador da superfície e aponte-o a quem fala mais.
Numa aula ou apresentação, se a sala tiver sistema de som ou uma gravação oficial, esse sinal é melhor do que qualquer coisa que consiga captar do seu lugar.
3. Defina o idioma explicitamente #
A deteção automática de idioma analisa o início do ficheiro. Se os primeiros trinta segundos forem ruído de sala, música, ou alguém a falar um idioma diferente do resto da gravação, a deteção pode fixar-se no idioma errado e ficar errada durante o ficheiro inteiro.
O sintoma é inconfundível e confuso: uma transcrição num idioma que ninguém falou, ou trechos dele. Se souber o idioma, defina-o em vez de deixar a ferramenta adivinhar. No Offline Transcription pode manter premido o botão Transcrever de um ficheiro e escolher o idioma, o que importa sobretudo quando tem várias gravações em idiomas diferentes.
4. Não grave com compressão excessiva #
Abaixo de cerca de 64 kbps, a compressão com perdas remove o detalhe de alta frequência que distingue consoantes parecidas — a diferença entre "quinze" e "cinquenta" está lá em cima. Nenhuma ferramenta de transcrição consegue repor informação que o codificador deitou fora.
Grave sem compressão ou com uma taxa de bits normal. Se lhe entregarem um ficheiro com taxa de bits baixa, esse é o seu teto de exatidão e nenhuma definição o altera.
5. Corte o silêncio #
Longos trechos sem fala não são neutros. O Whisper gera texto para o que lhe derem e, perante silêncio, repete-se, às vezes durante páginas.
A deteção de atividade vocal resolve isto como deve ser, ao nunca mostrar as partes silenciosas ao modelo. Na falta disso, corte a gravação antes de transcrever.
6. E depois, talvez, um modelo maior #
Isto está em último lugar por uma razão.
O tamanho do modelo melhora de facto a exatidão, e a melhoria é real mas menor do que as pessoas esperam — e custa muito tempo e disco. Mais importante ainda, um modelo maior não resolve nenhum dos problemas acima. Vai transcrever uma gravação distante, ruidosa e demasiado comprimida ligeiramente melhor, e continuará a fazê-lo mal.
O enquadramento honesto: o tamanho do modelo é um multiplicador da qualidade do seu áudio. Multiplicar áudio mau dá-lhe resultados um pouco menos maus. O nosso guia sobre escolher um modelo trata deste compromisso.
O que não ajuda de todo #
Voltar a processar o mesmo ficheiro. A amostragem não é totalmente determinística, por isso pode obter erros ligeiramente diferentes. Isso é variância, não melhoria.
Aumentar o volume. Amplificar uma gravação baixa amplifica o ruído da sala na mesma medida. A relação — aquilo que importa — não muda.
Redução de ruído, normalmente. A remoção agressiva de ruído introduz artefactos que confundem o modelo tanto como o ruído confundia. Uma filtragem passa-alto suave para retirar o ronco pode ajudar ligeiramente. Processamento pesado costuma prejudicar.
Pagar mais por minuto. Os serviços na nuvem correm a mesma família de modelos. Preço não é exatidão.
Como é um bom resultado #
Mesmo com tudo bem feito, a transcrição automática não é perfeita e nenhuma ferramenta a tornará perfeita. Conte que estes continuem errados com alguma frequência: nomes próprios pouco conhecidos, jargão técnico, números ditos depressa e momentos em que duas pessoas falam ao mesmo tempo.
É por isso que o fluxo de trabalho importa tanto como a exatidão: use uma vista por segmentos com marcações de tempo para poder ouvir o áudio por trás de qualquer linha de que duvide, e verifique as partes em que tenciona basear-se. O nosso guia de entrevistas explica uma forma rápida de o fazer.
A versão curta #
Aproxime o microfone. Tire o gravador da mesa e aponte-o a quem fala. Defina o idioma explicitamente em vez de confiar na deteção. Não grave com taxas de bits baixas. Corte ou detete o silêncio. Só depois pense no tamanho do modelo, que é a menor das seis alavancas.
Obter o Offline Transcription
Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.