Guide

Votre transcription est imprécise — voici ce qui la corrige vraiment

On pense d'abord à un modèle plus gros. C'est le changement le moins efficace à votre disposition, et le microphone que vous possédez déjà est le plus efficace.

Quand une transcription revient pleine d'erreurs, le réflexe est d'en vouloir à l'outil et d'en chercher un meilleur. Parfois c'est justifié. Le plus souvent, le problème se situe en amont, et la solution est gratuite.

Voici ce qui fait réellement bouger la précision, par ordre d'effet.

1. La distance du microphone (de loin le facteur principal) #

La reconnaissance vocale se dégrade en fonction du rapport entre la voix et tout le reste. La distance détruit ce rapport plus vite que n'importe quoi : la pression acoustique décroît avec la distance tandis que le bruit de la pièce reste constant, si bien que chaque pas en arrière rend la parole plus faible par rapport à la climatisation, à la circulation et à la machine à café.

Un téléphone placé à quarante-cinq centimètres de la bouche d'un intervenant produit une transcription nettement meilleure que le même téléphone à deux mètres, avec la même application et le même modèle. Ce n'est pas un petit effet — c'est la différence entre une transcription que vous corrigez en cinq minutes et une que vous retapez.

Si vous ne pouvez changer qu'une seule chose, changez celle-ci.

2. L'emplacement de l'enregistreur #

Point voisin mais distinct, et c'est là que les enregistrements de réunion échouent.

Un appareil posé au milieu d'une table est à égale distance de tout le monde, ce qui veut dire qu'il est loin de tout le monde et près de la table — laquelle conduit chaque tapotement, chaque frottement et chaque tasse de café directement dans le microphone. Mieux vaut : surélever l'enregistreur au-dessus de la surface, et l'orienter vers la personne qui parle le plus.

Pour un cours ou une présentation, si la salle dispose d'une sonorisation ou d'un enregistrement officiel, ce signal est meilleur que tout ce que vous pouvez capter depuis votre siège.

3. Indiquez la langue explicitement #

La détection automatique de la langue analyse le début du fichier. Si les trente premières secondes sont du bruit ambiant, de la musique, ou quelqu'un qui parle une autre langue que le reste de l'enregistrement, la détection peut se fixer sur la mauvaise langue et le rester pour tout le fichier.

Le symptôme est reconnaissable et déroutant : une transcription dans une langue que personne n'a parlée, ou par salves. Si vous connaissez la langue, indiquez-la plutôt que de laisser l'outil deviner. Dans Offline Transcription, vous pouvez maintenir le bouton Transcrire d'un fichier et choisir sa langue, ce qui compte surtout quand vous avez plusieurs enregistrements dans des langues différentes.

4. N'enregistrez pas trop compressé #

En dessous d'environ 64 kbit/s, la compression avec perte supprime le détail des hautes fréquences qui distingue les consonnes proches — la différence entre « quinze » et « cinquante » se joue là-haut. Aucun outil de transcription ne peut restituer une information que l'encodeur a jetée.

Enregistrez sans compression ou à un débit normal. Si l'on vous remet un fichier à bas débit, c'est votre plafond de précision et aucun réglage n'y changera rien.

5. Supprimez les silences #

Les longues plages sans parole ne sont pas neutres. Whisper génère du texte pour tout ce qu'on lui donne, et face au silence il se répète, parfois sur des pages entières.

La détection d'activité vocale résout cela proprement, en ne montrant jamais au modèle les parties silencieuses. À défaut, coupez l'enregistrement avant de le transcrire.

6. Ensuite, éventuellement, un modèle plus grand #

Ce point est le dernier de la liste, et ce n'est pas un hasard.

La taille du modèle améliore effectivement la précision, et le gain est réel mais plus faible qu'on ne l'imagine — et il coûte beaucoup de temps et d'espace disque. Plus important encore, un modèle plus grand ne corrige aucun des problèmes ci-dessus. Il transcrira un peu mieux un enregistrement lointain, bruyant et trop compressé, et le fera quand même mal.

Formulé honnêtement : la taille du modèle est un multiplicateur appliqué à la qualité de votre audio. Multiplier un audio médiocre donne un résultat un peu moins médiocre. Notre guide sur le choix d'un modèle détaille ce compromis.

Ce qui n'aide pas du tout #

Relancer le même fichier. L'échantillonnage n'est pas totalement déterministe, vous pouvez donc obtenir des erreurs légèrement différentes. C'est de la variance, pas une amélioration.

Augmenter le volume. Amplifier un enregistrement faible amplifie le bruit de la pièce à l'identique. Le rapport — la seule chose qui compte — reste inchangé.

La réduction de bruit, en général. Un débruitage agressif introduit des artefacts qui perturbent le modèle autant que le bruit. Un filtrage passe-haut léger pour supprimer les grondements peut aider un peu. Un traitement lourd nuit le plus souvent.

Payer plus cher à la minute. Les services en ligne font tourner la même famille de modèles. Le prix n'est pas la précision.

À quoi ressemble un bon résultat #

Même quand tout est bien fait, la transcription automatique n'est pas parfaite et aucun outil ne la rendra telle. Attendez-vous à ce que ces éléments restent erronés dans une certaine proportion : les noms propres peu courants, le jargon technique, les nombres prononcés rapidement, et les moments où deux personnes se coupent la parole.

C'est pourquoi le flux de travail compte autant que la précision : utilisez une vue par segments avec horodatage pour pouvoir écouter l'audio derrière toute ligne qui vous semble douteuse, et vérifiez les passages sur lesquels vous comptez vous appuyer. Notre guide sur les entretiens présente une façon rapide de le faire.

En bref #

Rapprochez le microphone. Décollez l'enregistreur de la table et orientez-le vers l'intervenant. Indiquez la langue explicitement au lieu de faire confiance à la détection. N'enregistrez pas à bas débit. Coupez les silences ou faites-les détecter. C'est seulement ensuite qu'il faut penser à la taille du modèle, qui est le plus faible des six leviers.

Obtenir Offline Transcription

Transcrivez vos fichiers audio et vidéo entièrement sur votre Mac. Rien n'est envoyé en ligne, aucun compte n'est requis et il n'y a pas de compteur à la minute.

macOS 13.0 or higher · iOS 16.4 or higher