Guide

Pourquoi la transcription est lente sur votre Mac

Le même enregistrement peut prendre deux minutes ou quarante sur des Mac différents faisant tourner la même application. Quatre facteurs expliquent presque tout l'écart.

La vitesse de la transcription locale varie énormément, et pas proportionnellement à l'ancienneté de votre Mac ni à son prix. Le même enregistrement d'une heure peut prendre trois minutes sur une machine et une demi-heure sur une autre, avec la même application.

Quatre facteurs en expliquent la quasi-totalité.

1. Apple Silicon contre Intel #

C'est le facteur principal, et l'écart n'est pas mince.

La transcription est dominée par de l'arithmétique matricielle. Apple Silicon dispose de deux atouts qui lui conviennent précisément : un Neural Engine conçu exactement pour cette arithmétique, et une mémoire unifiée, de sorte que les poids du modèle n'ont pas à être copiés dans un sens puis dans l'autre entre la mémoire du processeur et celle du GPU.

Un Mac Intel n'a ni l'un ni l'autre. Il n'a aucun Neural Engine : l'encodeur — la moitié coûteuse du modèle — se rabat donc sur le processeur ou sur un GPU dédié, de l'autre côté d'un bus. Le résultat est souvent plusieurs fois plus lent sur le même fichier.

Si vous êtes sur un Mac Intel, la transcription reste parfaitement utilisable ; c'est simplement quelque chose que vous lancez pour y revenir plus tard, au lieu de le regarder. Aucun logiciel ne comble cet écart, parce que l'écart est une puce.

2. Le fait que l'application utilise ou non le Neural Engine #

Deux applications sur le même Mac de la série M peuvent différer d'un facteur important, parce que l'usage du Neural Engine n'est pas automatique.

Le modèle doit être compilé au préalable au format de Core ML pour que l'encodeur puisse s'y exécuter. Les applications qui livrent un encodeur Core ML aux côtés des poids empruntent la voie rapide ; celles qui ne le font pas exécutent tout sur le GPU ou le processeur et laissent beaucoup de performance inutilisée.

Cela ne se voit pas de l'extérieur, mais cela se sent : si une application de transcription locale est nettement plus rapide qu'une autre sur votre machine, c'est généralement la raison.

3. La taille du modèle #

Les tailles de Whisper diffèrent d'environ 3× en nombre de paramètres à chaque palier, et le temps suit la même échelle. Passer de Base à Large représente environ vingt fois plus de paramètres — sur un fichier long, c'est la différence entre un café et un après-midi.

Si une application choisit par défaut un grand modèle, ou si vous en avez sélectionné un parce que plus gros semblait meilleur, cela peut à soi seul expliquer l'attente. Le gain de précision est bien plus faible que ne le suggère l'écart de taille, et pour de la parole propre il est souvent imperceptible.

4. La quantité de silence que vous payez à transcrire #

Un enregistrement de deux heures pour une réunion de quatre-vingt-dix minutes contient trente minutes de rien. Sans détection d'activité vocale, le modèle traite tout — en décodant le silence au même coût que la parole, et en produisant au passage du texte répété et inutile.

Les applications qui exécutent d'abord une VAD sautent entièrement ces plages. Sur des enregistrements comportant beaucoup de blanc, l'économie n'est pas marginale.

Ce qui accélère réellement les choses #

Par ordre d'effet :

  1. Utilisez un modèle plus petit. Base suffit pour la plupart des paroles propres, et il est bien plus rapide que Large.
  2. Utilisez une application dotée d'un encodeur Core ML si vous êtes sur Apple Silicon.
  3. Coupez les blancs, ou utilisez un outil qui détecte d'abord la parole.
  4. Fermez tout ce qui entre en concurrence. La transcription utilisera tous les cœurs qu'elle peut obtenir. Un export vidéo en arrière-plan divise votre débit par deux.
  5. Branchez le portable. Sur batterie, macOS bride le travail soutenu ; le mode Économie d'énergie le fait de façon agressive.

Ce qui n'accélère rien #

Plus de RAM, sauf si vous étiez en train de swapper — l'empreinte mémoire de travail est plus faible qu'on ne le croit.

Une connexion internet plus rapide. Il n'y a aucune étape réseau dans la transcription locale. Si votre vitesse dépend de votre connexion, le travail ne se fait pas sur votre machine.

Relancer. Si un traitement est lent, le relancer reprend le même travail depuis zéro.

Un ordre de grandeur #

Sur un Mac Apple Silicon avec un modèle Base et un encodeur Core ML, la transcription tourne plusieurs fois plus vite que le temps réel — un enregistrement d'une heure se termine en quelques minutes. Notre propre mesure sur un fichier de deux heures était de moins de trois minutes de bout en bout.

Sur un Mac Intel, attendez-vous à ce que cela prenne une fraction notable de la durée de l'enregistrement. Cela vaut toujours le coup, c'est toujours gratuit, mais ce n'est pas quelque chose à regarder.

Si vous êtes très loin de ces plages sur Apple Silicon, les causes probables sont, dans l'ordre : un grand modèle, une application qui n'utilise pas le Neural Engine, ou beaucoup d'autres tâches qui se disputent la machine.

En bref #

Apple Silicon contre Intel est le facteur principal et aucun logiciel n'y remédie. Ensuite : utilisez un modèle plus petit, utilisez une application qui compile l'encodeur pour le Neural Engine, sautez le silence au lieu de le transcrire, et ne lancez pas la transcription à côté d'un export vidéo sur batterie.

Obtenir Offline Transcription

Transcrivez vos fichiers audio et vidéo entièrement sur votre Mac. Rien n'est envoyé en ligne, aucun compte n'est requis et il n'y a pas de compteur à la minute.

macOS 13.0 or higher · iOS 16.4 or higher