Guia
Como lidar com uma gravação com vários oradores
A identificação automática de oradores é a funcionalidade mais sobrevendida da transcrição. Eis o que a tecnologia faz de facto, e como obter mesmo assim uma transcrição exata com vários oradores.
"Identificação automática de oradores" aparece na lista de funcionalidades da maioria dos produtos de transcrição. É tecnologia real, é genuinamente útil às vezes, e está muito longe de ser tão fiável como o marketing dá a entender.
Se está a transcrever uma reunião, um painel ou uma entrevista de grupo, vale a pena saber o que está realmente a receber.
O que a diarização de oradores faz #
A diarização é um passo separado da transcrição. Em vez de reconhecer palavras, agrupa o áudio por características de voz — altura, timbre, cadência — e decide "este trecho parece ser da mesma pessoa do que aquele trecho". Depois rotula os grupos como Orador 1, Orador 2, e assim por diante.
Duas coisas decorrem desta descrição, e explicam quase todas as queixas sobre a funcionalidade.
Não sabe quem é quem. Produz "Orador 1", não "Dra. Chen". Atribuir nomes é sempre um passo humano; uma ferramenta que mostra nomes reais ou está a usar metadados de uma plataforma que sabia quem tinha o microfone ligado, ou foi você que lhos deu.
Funciona por semelhança de voz, não por sentido. Duas pessoas com vozes parecidas fundem-se num só rótulo. Uma pessoa cuja voz muda — afasta-se do microfone, entusiasma-se, entra por telefone — divide-se em duas.
Quando funciona, e quando não funciona #
Razoavelmente fiável: duas pessoas, vozes distintas, um microfone para cada uma ou um microfone partilhado de perto, a falar à vez sem grande sobreposição. Um podcast de duas pessoas gravado como deve ser está perto do melhor cenário.
Pouco fiável: quatro ou mais pessoas. Uma sala de reuniões com um gravador ao meio. Alguém em alta-voz. Vozes parecidas — este é um modo de falha real e incómodo, e afeta desproporcionadamente grupos de pessoas do mesmo género e de idade semelhante, o que é a maioria das reuniões.
Praticamente sem esperança: sobreposição de vozes. Quando duas pessoas falam ao mesmo tempo, o áudio contém as duas, e o agrupamento tem de escolher uma. É precisamente aqui que as transcrições ficam atribuídas à pessoa errada — e é exatamente o momento de uma discussão ou de uma negociação em que mais quer ser exato.
A falha que importa #
Um erro de transcrição é normalmente óbvio. Lê uma frase que não faz sentido e vai verificá-la.
Um erro de atribuição de orador é invisível. A frase está correta, bem formada, e atribuída à pessoa errada. Nada nela parece mal. Se construir uma citação, uma ata ou uma nota jurídica em cima disso, o erro propaga-se em silêncio.
É essa assimetria que me leva a não construir um fluxo de trabalho dependente de as identificações automáticas estarem certas.
O que fazer em vez disso #
Se a plataforma sabia quem estava a falar, use isso #
Este é o único caso com uma resposta genuinamente melhor. O Zoom, o Teams e o Meet sabem quem está com o microfone ligado, por isso as suas próprias transcrições conseguem identificar oradores a partir de metadados em vez de adivinharem pelo áudio. Se a atribuição exata for a prioridade e a reunião tiver sido gravada na nuvem num plano que inclua transcrição, essa é a fonte mais fiável disponível. O nosso guia de gravações de reuniões trata dos compromissos envolvidos.
Grave de forma a que o problema seja menor #
- Um microfone por pessoa, se a gravação for importante. Faixas separadas tornam a atribuição trivial e eliminam a diarização por completo.
- Uma mesa-redonda em que se pede às pessoas que não falem por cima umas das outras produz uma transcrição muito melhor do que uma em que o fazem. Dizê-lo no início de uma reunião gravada é normal e ajuda toda a gente.
- Peça às pessoas que se identifiquem na primeira vez que falarem — "aqui Priya" — o que lhe dá uma âncora na transcrição.
Identifique você mesmo, no momento de usar #
Para a maior parte do trabalho não precisa da transcrição toda identificada. Precisa que as seis passagens que vai citar ou sobre as quais vai agir estejam identificadas corretamente.
O método prático: trabalhe numa vista por segmentos com marcações de tempo, encontre as passagens que importam, reproduza o áudio dessas linhas e escreva o nome à medida que o confirma. Já está a ouvir esses momentos de qualquer forma para verificar as palavras. Identificá-los não custa nada de extra e é o único método que é de facto exato.
Use a estrutura em vez de rótulos #
Para muito trabalho de reuniões, uma transcrição com marcações de tempo e sem identificação de oradores é perfeitamente utilizável — está a procurar decisões e ações, não a construir um guião de teatro. Não gaste uma tarde a corrigir rótulos de que nunca precisou.
A nossa posição #
O Offline Transcription não faz identificação automática de oradores. Sendo direto quanto ao motivo: a família Whisper não faz diarização, acrescentá-la significa um segundo modelo com as características de fiabilidade descritas acima, e entregar identificações erradas de forma invisível é pior, para o tipo de trabalho que os nossos utilizadores fazem, do que não entregar identificação nenhuma.
O que a aplicação oferece é o fluxo de trabalho que torna rápida a identificação manual: cada segmento tem as suas marcações de tempo, e pode reproduzir o áudio por trás de qualquer linha para confirmar quem a disse antes de escrever um nome ao lado.
Se a identificação automática for para si um requisito obrigatório, essa é uma razão legítima para usar outra ferramenta, e prefiro dizê-lo a fingir o contrário.
A versão curta #
A diarização agrupa vozes; não conhece pessoas. É razoável para dois oradores distintos e pouco fiável para grupos, vozes parecidas e sobreposição de vozes — e os seus erros são invisíveis de uma forma que os erros de transcrição não são. Grave faixas separadas se isso importar, use metadados da plataforma se os tiver, e caso contrário identifique à mão, de ouvido e no momento de usar, o punhado de passagens que realmente utiliza.
Obter o Offline Transcription
Transcreva áudio e vídeo inteiramente no seu Mac. Nada é enviado, não há conta e não há contador ao minuto.