Руководство
Какая модель Whisper вам на самом деле нужна?
Tiny, Base, Small, Medium, Large. Больше — значит точнее и намного медленнее, а для многих записей разница меньше, чем внушает маркетинг.
Любое приложение локальной транскрибации работает на той или иной версии Whisper от OpenAI, и большинство отдельно подчёркивает, какие размеры моделей поддерживает. Более крупные модели действительно точнее. Они же радикально медленнее и заметно больше на диске, а разрыв в точности зависит куда сильнее от вашей записи, чем от модели.
Вот как об этом думать, не хватая рефлекторно самое крупное из предложенного.
Размеры #
У Whisper пять основных размеров. Числа тут менее важны, чем форма кривой:
| Модель | Параметров | Примерно на диске |
|---|---|---|
| Tiny | 39 миллионов | ~75 МБ |
| Base | 74 миллиона | ~140 МБ |
| Small | 244 миллиона | ~470 МБ |
| Medium | 769 миллионов | ~1,5 ГБ |
| Large | 1,5 миллиарда | ~3 ГБ |
Каждый шаг вверх примерно втрое больше предыдущего и работает соответственно дольше. Переход от Small к Large — это примерно в шесть раз больше параметров; на длинной записи это разница между «сварить кофе» и «сходить на обед».
Кривая точности растёт далеко не так быстро. Она круто поднимается от Tiny до Small, а затем выполаживается.
Что на самом деле определяет вашу точность #
Именно это обычно теряется из виду. Качество вашей записи важнее размера модели.
Чистая запись — один говорящий, приличный микрофон, тихая комната, стандартное произношение — хорошо расшифруется на Small. Прогон того же файла через Large даст горстку исправленных слов, в основном имён собственных.
По-настоящему ломают транскрибацию вот что:
- Фоновый шум. Кафе, кондиционер, транспорт.
- Наложение речи. Двое говорящих одновременно — сложность для любой модели.
- Расстояние до микрофона. Звук, записанный через стол переговорной.
- Сильный или менее распространённый акцент, особенно на языке, которого модель видела меньше при обучении.
- Профессиональная лексика, имена и аббревиатуры. Необычную фамилию не исправит никакой размер модели.
- Языки, кроме английского. Обучающие данные Whisper сильно смещены в сторону английского, поэтому для других языков разрыв между размерами моделей заметно шире.
Если в вашем аудио сразу несколько пунктов из списка, более крупная модель стоит реальных денег. Если ни одного — вы платите за погрешность округления.
Практический способ выбрать #
Tiny — черновики и поиск. Хватит, чтобы найти нужный кусок в двухчасовой записи. Не хватит, чтобы публиковать.
Base — голосовые заметки, записки самому себе, чистое аудио с одним говорящим, где вы прочтёте результат и сами поймёте, что имели в виду.
Small — разумный выбор по умолчанию для большинства задач. Интервью на приличный микрофон, выпуски подкастов, записи лекций, аудио совещаний, где люди сидят близко к микрофону. Здесь кривая для чистой английской речи и выполаживается.
Medium и Large — трудное аудио, языки кроме английского или всё, что вы будете публиковать, не прочитав целиком. А также верный выбор, если ваше время дороже ожидания и перечитывание транскрипта обходится вам дороже дополнительной обработки.
Просто проверьте #
Честный ответ: по описанию ваших записей вам никто этого не скажет, потому что перечисленные факторы взаимодействуют.
Возьмите худший свой файл — шумный, с трудным акцентом, тот, про который вы и так знаете, что он проблемный, — и прогоните его через все доступные вам размеры моделей. Сравните транскрипты. Одна эта проверка скажет вам больше, чем любая таблица бенчмарков, потому что в ней задействованы ваш микрофон, ваше помещение и ваша тематика.
Если маленькая модель справляется с вашим самым трудным файлом, она справится и со всем остальным, — а вы только что сэкономили несколько гигабайт и массу ожидания.
Где в этом мы #
Скажем прямо: Offline Transcription поставляется с Tiny, Base и Small. Medium и Large в него не входят.
Это покрывает большую часть повседневной транскрибации — чистые интервью, подкасты, лекции, совещания, голосовые заметки — и оставляет приложение небольшим и быстрым, в том числе на iPhone. Если вы регулярно работаете с трудным аудио или с записями не на английском, где крупные модели действительно отрабатывают своё, приложение, которое их предлагает, подойдёт вам лучше, — и наше сравнение с MacWhisper говорит об этом прямо.
Приложение можно скачать бесплатно, так что описанная проверка не стоит вам ничего, кроме времени на неё.
Одна вещь, которая к размеру модели вообще не относится #
Какую бы модель вы ни выбрали, где она работает — отдельный вопрос. Whisper — открытая модель, и запускать её можно как на вашем компьютере, так и на чьём-то сервере. Облачный сервис транскрибации, вероятно, использует Large — и заодно хранит копию вашей записи.
Запуск Small локально и запуск Large в чужом дата-центре — не точки на одной шкале. Если запись конфиденциальна, это решение принимается первым, а размер модели — вторым. Как проверить это в любом случае, описано в нашем руководстве о том, действительно ли приложение работает офлайн.
Скачать Offline Transcription
Транскрибируйте аудио и видео целиком на своём Mac. Ничего не загружается в облако, аккаунт не нужен, поминутной тарификации нет.