Guide

De quel modèle Whisper avez-vous réellement besoin ?

Tiny, Base, Small, Medium, Large. Plus grand veut dire plus précis et beaucoup plus lent, et pour bien des enregistrements l'écart est plus faible que ne le suggère le marketing.

Toutes les applications de transcription locale font tourner une version du Whisper d'OpenAI, et la plupart insistent sur les tailles de modèles qu'elles prennent en charge. Les modèles plus grands sont réellement plus précis. Ils sont aussi nettement plus lents et bien plus volumineux sur le disque, et l'écart de précision dépend bien davantage de votre enregistrement que du modèle.

Voici comment y réfléchir sans prendre par réflexe la plus grosse option disponible.

Les tailles #

Whisper existe en cinq tailles principales. Les chiffres comptent moins que la forme de la courbe :

Modèle Paramètres Environ sur le disque
Tiny 39 millions ~75 Mo
Base 74 millions ~140 Mo
Small 244 millions ~470 Mo
Medium 769 millions ~1,5 Go
Large 1,5 milliard ~3 Go

Chaque palier fait à peu près trois fois la taille du précédent, et prend proportionnellement plus de temps à s'exécuter. Passer de Small à Large représente environ six fois plus de paramètres — sur un long enregistrement, c'est la différence entre préparer un café et partir déjeuner.

La courbe de précision, elle, ne monte pas aussi vite, loin de là. Elle grimpe fortement de Tiny à Small, puis s'aplatit.

Ce qui détermine réellement votre précision #

C'est la partie que l'on perd de vue. La qualité de votre enregistrement compte davantage que la taille du modèle.

Un enregistrement propre — un seul intervenant, un micro correct, une pièce calme, un accent standard — se transcrira bien avec Small. Passer ce même fichier dans Large vous rapportera une poignée de mots corrigés, essentiellement des noms propres.

Ce qui met vraiment la transcription en difficulté, c'est :

  • Le bruit de fond. Un café, une climatisation, la circulation.
  • Les chevauchements de parole. Deux personnes qui parlent en même temps sont difficiles pour tous les modèles.
  • La distance au microphone. Un audio enregistré à travers une table de réunion.
  • Les accents marqués ou peu courants, en particulier dans une langue que le modèle a moins vue à l'entraînement.
  • Le vocabulaire technique, les noms propres et les acronymes. Aucune taille de modèle ne règle un nom de famille inhabituel.
  • Les langues autres que l'anglais. Les données d'entraînement de Whisper sont fortement pondérées vers l'anglais : l'écart entre les tailles de modèles est donc bien plus large pour les autres langues.

Si votre audio cumule plusieurs de ces points, un modèle plus grand vaut vraiment son coût. S'il n'en présente aucun, vous payez pour une erreur d'arrondi.

Une façon pratique de choisir #

Tiny — Brouillons et recherche. Assez bon pour repérer quelle partie d'un enregistrement de deux heures vous intéresse. Pas assez bon pour publier.

Base — Mémos vocaux, notes personnelles, audio propre à un seul intervenant, quand vous lirez le résultat en sachant ce que vous vouliez dire.

Small — Le choix par défaut raisonnable pour l'essentiel du travail. Entretiens sur un micro correct, épisodes de podcast, enregistrements de cours, audio de réunion où les gens sont près du micro. C'est là que la courbe s'aplatit pour de la parole anglaise propre.

Medium et Large — Audio difficile, langues autres que l'anglais, ou tout ce que vous publierez sans le lire intégralement. C'est aussi le bon choix si votre temps vaut plus que l'attente, et que relire une transcription vous coûte plus que le surcroît de traitement.

Testez, tout simplement #

La réponse honnête est que personne ne peut vous le dire à partir d'une description de vos enregistrements, parce que les variables ci-dessus interagissent.

Prenez votre pire fichier — le bruyant, celui à l'accent difficile, celui dont vous savez déjà qu'il pose problème — et passez-le dans toutes les tailles de modèles dont vous disposez. Comparez les transcriptions. Ce seul test vous en dira plus que n'importe quel tableau comparatif, parce qu'il utilise votre microphone, votre pièce et votre sujet.

Si le petit modèle vient à bout de votre fichier le plus difficile, il viendra à bout de tout le reste, et vous venez d'économiser plusieurs gigaoctets et beaucoup d'attente.

Où se situe cette application #

Disons-le franchement : Offline Transcription est livrée avec Tiny, Base et Small. Elle n'inclut ni Medium ni Large.

Cela couvre la majorité de la transcription quotidienne — entretiens propres, podcasts, cours, réunions, mémos vocaux — et cela garde l'application légère et rapide, y compris sur iPhone. Si vous travaillez régulièrement avec de l'audio difficile ou des enregistrements non anglophones où les grands modèles justifient vraiment leur coût, une application qui les propose vous conviendra mieux, et notre comparaison avec MacWhisper le dit directement.

L'application est gratuite à télécharger : le test ci-dessus ne vous coûte donc que le temps de le faire.

Une chose qui n'a rien à voir avec la taille du modèle #

Quel que soit le modèle utilisé, l'endroit où il s'exécute est une question distincte. Whisper est un modèle ouvert, et il peut tourner sur votre propre machine ou sur le serveur de quelqu'un. Un service de transcription en ligne fait probablement tourner Large — et conserve aussi une copie de votre enregistrement.

Faire tourner Small en local et faire tourner Large dans le centre de données d'un tiers ne sont pas deux points sur la même échelle. Si l'enregistrement est confidentiel, cette décision vient en premier, et la taille du modèle en second. Notre guide sur la vérification qu'une application fonctionne vraiment hors ligne explique comment le contrôler dans un cas comme dans l'autre.

Obtenir Offline Transcription

Transcrivez vos fichiers audio et vidéo entièrement sur votre Mac. Rien n'est envoyé en ligne, aucun compte n'est requis et il n'y a pas de compteur à la minute.

macOS 13.0 or higher · iOS 16.4 or higher