Anleitung

Welches Whisper-Modell brauchen Sie tatsächlich?

Tiny, Base, Small, Medium, Large. Größer ist genauer und viel langsamer, und bei vielen Aufnahmen ist der Unterschied kleiner, als das Marketing nahelegt.

Jede lokale Transkriptions-App führt irgendeine Fassung von OpenAIs Whisper aus, und die meisten betonen, welche Modellgrößen sie unterstützen. Größere Modelle sind tatsächlich genauer. Sie sind auch dramatisch langsamer und viel größer auf der Festplatte, und der Genauigkeitsunterschied hängt weit mehr von Ihrer Aufnahme ab als vom Modell.

So denken Sie darüber nach, ohne reflexhaft das Größte im Angebot zu nehmen.

Die Größen #

Whisper gibt es in fünf Hauptgrößen. Die Zahlen zählen weniger als die Form der Kurve:

Modell Parameter Ungefähr auf der Festplatte
Tiny 39 Millionen ~75 MB
Base 74 Millionen ~140 MB
Small 244 Millionen ~470 MB
Medium 769 Millionen ~1,5 GB
Large 1,5 Milliarden ~3 GB

Jeder Schritt nach oben ist ungefähr dreimal so groß wie der darunter und braucht entsprechend länger. Von Small auf Large sind es etwa sechsmal so viele Parameter — bei einer langen Aufnahme ist das der Unterschied zwischen einen Kaffee kochen und Mittagessen gehen.

Die Genauigkeitskurve steigt bei Weitem nicht so schnell. Sie klettert steil von Tiny bis Small und flacht dann ab.

Was Ihre Genauigkeit tatsächlich entscheidet #

Das ist der Teil, der untergeht. Die Qualität Ihrer Aufnahme zählt mehr als die Modellgröße.

Eine saubere Aufnahme — eine sprechende Person, ordentliches Mikrofon, ruhiger Raum, Standardakzent — wird mit Small gut transkribiert. Dieselbe Datei durch Large zu schicken bringt Ihnen eine Handvoll korrigierter Wörter, meist Eigennamen.

Was Transkription wirklich zerstört, ist:

  • Hintergrundgeräusch. Ein Café, eine Klimaanlage, Verkehr.
  • Überlappende Sprache. Zwei Personen, die gleichzeitig reden, sind für jedes Modell schwierig.
  • Abstand zum Mikrofon. Audio, das quer über einen Besprechungstisch aufgenommen wurde.
  • Starke oder seltenere Akzente, besonders in einer Sprache, von der das Modell beim Training weniger gesehen hat.
  • Fachvokabular, Namen und Abkürzungen. Keine Modellgröße repariert einen ungewöhnlichen Nachnamen.
  • Andere Sprachen als Englisch. Whispers Trainingsdaten sind stark englischlastig, der Abstand zwischen den Modellgrößen ist bei anderen Sprachen also viel größer.

Wenn Ihr Audio mehrere davon aufweist, ist ein größeres Modell echtes Geld wert. Wenn es keines davon aufweist, bezahlen Sie für einen Rundungsfehler.

Ein praktischer Weg zur Wahl #

Tiny — Rohentwürfe und Durchsuchbarkeit. Gut genug, um zu finden, welchen Teil einer zweistündigen Aufnahme Sie brauchen. Nicht gut genug zum Veröffentlichen.

Base — Sprachmemos, Notizen an sich selbst, sauberes Audio mit einer sprechenden Person, bei dem Sie das Ergebnis lesen und wissen, was Sie gemeint haben.

Small — Die vernünftige Voreinstellung für die meiste Arbeit. Interviews mit einem ordentlichen Mikrofon, Podcast-Folgen, Vorlesungsaufzeichnungen, Besprechungsaudio, bei dem die Leute nah am Mikrofon sind. Hier flacht die Kurve für saubere englische Sprache ab.

Medium und Large — Schwieriges Audio, nicht-englische Sprachen oder alles, was Sie veröffentlichen, ohne es vollständig zu lesen. Auch die richtige Wahl, wenn Ihre Zeit mehr wert ist als das Warten und ein Transkript noch einmal zu lesen Sie mehr kostet als die zusätzliche Rechenzeit.

Testen Sie es einfach #

Die ehrliche Antwort ist, dass niemand es Ihnen aus einer Beschreibung Ihrer Aufnahmen sagen kann, weil die obigen Variablen zusammenwirken.

Nehmen Sie Ihre schlechteste Datei — die verrauschte, die mit dem schwierigen Akzent, die, von der Sie schon wissen, dass sie ein Problem ist — und lassen Sie sie durch alle Modellgrößen laufen, die Ihnen zur Verfügung stehen. Vergleichen Sie die Transkripte. Dieser eine Test sagt Ihnen mehr als jede Benchmark-Tabelle, weil er Ihr Mikrofon, Ihren Raum und Ihr Thema verwendet.

Wenn das kleine Modell Ihre schwierigste Datei bewältigt, bewältigt es alles andere auch, und Sie haben sich gerade mehrere Gigabyte und viel Warten gespart.

Wo diese App steht #

Ganz offen: Offline Transcription liefert Tiny, Base und Small mit. Medium und Large sind nicht enthalten.

Das deckt den Großteil alltäglicher Transkription ab — saubere Interviews, Podcasts, Vorlesungen, Besprechungen, Sprachmemos — und hält die App klein und schnell, auch auf dem iPhone. Wenn Sie regelmäßig mit schwierigem Audio oder nicht-englischen Aufnahmen arbeiten, bei denen die großen Modelle ihr Geld wirklich verdienen, passt eine App besser, die sie anbietet, und unser MacWhisper-Vergleich sagt das direkt.

Die App ist kostenlos herunterzuladen, der obige Test kostet Sie also nichts außer der Zeit, ihn durchzuführen.

Eine Sache, bei der es überhaupt nicht um die Modellgröße geht #

Welches Modell Sie auch verwenden, wo es läuft, ist eine eigene Frage. Whisper ist ein offenes Modell, und es kann auf Ihrem eigenen Rechner oder auf dem Server von jemand anderem laufen. Ein Cloud-Transkriptionsdienst führt wahrscheinlich Large aus — und hält zugleich eine Kopie Ihrer Aufnahme.

Small lokal auszuführen und Large im Rechenzentrum eines anderen auszuführen sind keine Punkte auf derselben Skala. Wenn die Aufnahme vertraulich ist, kommt diese Entscheidung zuerst und die Modellgröße danach. Unsere Anleitung zum Prüfen, ob eine App wirklich offline ist beschreibt, wie Sie das in beide Richtungen überprüfen.

Offline Transcription herunterladen

Transkribieren Sie Audio und Video vollständig auf Ihrem eigenen Mac. Nichts wird hochgeladen, es gibt kein Konto und keine Abrechnung pro Minute.

macOS 13.0 or higher · iOS 16.4 or higher