Guide
Comment traiter un enregistrement à plusieurs intervenants
L'identification automatique des intervenants est la fonctionnalité la plus survendue de la transcription. Voici ce que la technologie fait réellement, et comment obtenir malgré tout une transcription multi-locuteurs exacte.
« Identification automatique des intervenants » figure dans la liste des fonctionnalités de la plupart des produits de transcription. C'est une technologie réelle, elle est parfois vraiment utile, et elle est loin d'être aussi fiable que le marketing le laisse entendre.
Si vous transcrivez une réunion, une table ronde ou un entretien de groupe, il vaut la peine de savoir ce que vous obtenez vraiment.
Ce que fait la diarisation #
La diarisation est une étape distincte de la transcription. Au lieu de reconnaître des mots, elle regroupe l'audio selon des caractéristiques vocales — hauteur, timbre, débit — et décide que « ce passage sonne comme la même personne que cet autre passage ». Puis elle étiquette les groupes Intervenant 1, Intervenant 2, et ainsi de suite.
Deux conséquences découlent de cette description, et elles expliquent presque toutes les plaintes sur cette fonctionnalité.
Elle ne sait qui est personne. Elle produit « Intervenant 1 », pas « docteure Chen ». Attribuer les noms est toujours une étape humaine ; un outil qui affiche de vrais noms utilise soit des métadonnées d'une plateforme qui savait qui avait coupé son micro, soit ce que vous lui avez indiqué.
Elle travaille sur la ressemblance des voix, pas sur le sens. Deux personnes aux voix proches fusionnent sous une même étiquette. Une personne dont la voix change — parce qu'elle s'éloigne du micro, s'anime, ou rejoint par téléphone — se scinde en deux.
Quand cela fonctionne, et quand cela ne fonctionne pas #
Raisonnablement fiable : deux personnes, des voix distinctes, un microphone chacune ou un micro partagé de proximité, qui parlent à tour de rôle sans trop se chevaucher. Un podcast à deux voix correctement enregistré est proche du meilleur cas.
Peu fiable : quatre personnes ou plus. Une salle de réunion avec un seul enregistreur au milieu. Toute personne au haut-parleur. Des voix proches — c'est un mode de défaillance réel et gênant, qui touche de façon disproportionnée les groupes de personnes de même genre et d'âge voisin, c'est-à-dire la plupart des réunions.
Pratiquement sans espoir : les chevauchements de parole. Quand deux personnes parlent simultanément, l'audio contient les deux, et le regroupement doit en choisir une. C'est précisément là que des propos sont attribués à la mauvaise personne — et c'est exactement le moment, dans une dispute ou une négociation, où vous tenez le plus à l'exactitude.
La défaillance qui compte #
Une erreur de transcription est en général évidente. Vous lisez une phrase qui n'a aucun sens et vous allez la vérifier.
Une erreur d'attribution est invisible. La phrase est correcte, bien formée, et attribuée à la mauvaise personne. Rien n'y semble faux. Si vous bâtissez dessus une citation, un compte rendu de réunion ou une note juridique, l'erreur se propage en silence.
Cette asymétrie explique pourquoi je ne construirais pas un flux de travail qui dépend de l'exactitude des étiquettes automatiques.
Que faire à la place #
Si la plateforme savait qui parlait, servez-vous-en #
C'est le seul cas où il existe une réponse réellement meilleure. Zoom, Teams et Google Meet savent qui a son micro ouvert : leurs propres transcriptions peuvent donc étiqueter les intervenants à partir de métadonnées plutôt qu'en devinant à l'oreille. Si l'exactitude de l'attribution est la priorité et que la réunion a été enregistrée dans le nuage sur une formule incluant la transcription, c'est la source la plus fiable disponible. Notre guide sur les enregistrements de réunion détaille les compromis.
Enregistrez de façon à réduire le problème #
- Un microphone par personne si l'enregistrement compte. Des pistes séparées rendent l'attribution triviale et éliminent complètement la diarisation.
- Une table ronde où l'on demande aux gens de ne pas se couper la parole produit une transcription bien meilleure que le contraire. Le dire au début d'une réunion enregistrée est normal et aide tout le monde.
- Faites que chacun se présente la première fois qu'il prend la parole — « Priya, ici » — ce qui vous donne un point de repère dans la transcription.
Étiquetez vous-même, au moment de l'usage #
Pour l'essentiel du travail, vous n'avez pas besoin que toute la transcription soit étiquetée. Vous avez besoin que les six passages que vous allez citer ou exploiter le soient, correctement.
La méthode pratique : travaillez dans une vue par segments avec horodatage, trouvez les passages qui comptent, lisez l'audio de ces lignes, et inscrivez le nom au fur et à mesure que vous le confirmez. Vous écoutez de toute façon ces moments pour vérifier les mots. Les étiqueter ne coûte rien de plus et c'est la seule méthode réellement exacte.
Utilisez la structure plutôt que les étiquettes #
Pour beaucoup de travail sur des réunions, une transcription horodatée sans étiquettes d'intervenants est parfaitement exploitable — vous y cherchez des décisions et des actions, vous ne montez pas une pièce de théâtre. Ne passez pas un après-midi à corriger des étiquettes dont vous n'avez jamais eu besoin.
Notre position #
Offline Transcription ne fait pas d'identification automatique des intervenants. Disons franchement pourquoi : la famille Whisper ne fait pas de diarisation, l'ajouter suppose un second modèle avec les caractéristiques de fiabilité décrites plus haut, et livrer des étiquettes fausses de manière invisible est pire, pour le type de travail que font nos utilisateurs, que ne livrer aucune étiquette.
Ce que l'application fournit, en revanche, c'est le flux de travail qui rend l'étiquetage manuel rapide : chaque segment porte ses horodatages, et vous pouvez lire l'audio derrière n'importe quelle ligne pour confirmer qui l'a dite avant d'y inscrire un nom.
Si les étiquettes automatiques sont pour vous une exigence incontournable, c'est une raison légitime d'utiliser un autre outil, et je préfère le dire plutôt que de prétendre le contraire.
En bref #
La diarisation regroupe des voix ; elle ne connaît pas les personnes. Elle est correcte pour deux voix distinctes et peu fiable pour les groupes, les voix proches et les chevauchements de parole — et ses erreurs sont invisibles d'une manière dont les erreurs de transcription ne le sont pas. Enregistrez des pistes séparées si cela compte, utilisez les métadonnées de la plateforme si vous en disposez, et sinon étiquetez à l'oreille, au moment de l'usage, la poignée de passages dont vous vous servez réellement.
Obtenir Offline Transcription
Transcrivez vos fichiers audio et vidéo entièrement sur votre Mac. Rien n'est envoyé en ligne, aucun compte n'est requis et il n'y a pas de compteur à la minute.