Руководство
Транскрипт получился неточным — вот что действительно это исправляет
Первым делом люди хватаются за модель побольше. Это наименее действенное из доступных изменений, а самое действенное — микрофон, который у вас уже есть.
Когда транскрипт возвращается с кучей ошибок, первое желание — обвинить инструмент и пойти искать получше. Иногда это верно. Обычно же проблема выше по цепочке, и её решение бесплатно.
Вот что действительно влияет на точность, по силе эффекта.
1. Расстояние до микрофона (с огромным отрывом) #
Качество распознавания речи зависит от соотношения голоса и всего остального. Расстояние разрушает это соотношение быстрее чего бы то ни было: звуковое давление падает с расстоянием, а шум помещения остаётся прежним, поэтому каждый шаг назад делает речь тише относительно кондиционера, транспорта за окном и кофемашины.
Телефон в полуметре ото рта говорящего даёт транскрипт кардинально лучше, чем тот же телефон в двух метрах, — при том же приложении и той же модели. Это не мелочь: это разница между транскриптом, который вы поправите за пять минут, и тем, который придётся перепечатывать.
Если вы можете изменить ровно одну вещь, меняйте эту.
2. Где лежит диктофон #
Связанный, но отдельный пункт, и именно здесь всё идёт не так с записями совещаний.
Устройство посреди стола равноудалено от всех, а значит — далеко ото всех и близко к столешнице, которая передаёт в микрофон каждое постукивание, шорох и стук чашки. Лучше: поднимите записывающее устройство над поверхностью и направьте на того, кто говорит больше всех.
Для лекции или доклада: если в зале есть звукоусиление или официальная запись, этот источник лучше всего, что можно поймать со зрительского места.
3. Задавайте язык явно #
Автоматическое определение языка анализирует начало файла. Если первые тридцать секунд — это шум помещения, музыка или чья-то реплика на языке, отличном от остальной записи, определение может остановиться на неверном языке и остаться неверным до конца файла.
Симптом безошибочно узнаваемый и сбивающий с толку: транскрипт на языке, на котором никто не говорил, или вкрапления такого текста. Если язык вам известен, задайте его, а не позволяйте инструменту гадать. В Offline Transcription можно задержать нажатие на кнопке «Транскрибировать» у файла и выбрать его язык — это особенно важно, когда у вас несколько записей на разных языках.
4. Не записывайте с чрезмерным сжатием #
Ниже примерно 64 кбит/с сжатие с потерями убирает высокочастотные детали, по которым различаются похожие согласные, — разница между «пятнадцать» и «пятьдесят» живёт именно там. Ни один инструмент транскрибации не вернёт информацию, которую выбросил кодировщик.
Записывайте без сжатия или на обычном битрейте. Если вам передали файл с низким битрейтом, это ваш потолок точности, и никакая настройка его не изменит.
5. Уберите тишину #
Долгие отрезки без речи не нейтральны. Whisper порождает текст для всего, что ему дают, и на тишине он начинает повторяться, иногда на целые страницы.
Как следует эту задачу решает детектор речевой активности: он просто не показывает модели тихие участки. Если его нет, обрежьте запись до транскрибации.
6. И только потом, может быть, модель побольше #
Этот пункт последний не случайно.
Размер модели действительно повышает точность, и прирост реален, но меньше, чем ожидают, — и стоит немало времени и места на диске. Что важнее, модель побольше не устраняет ни одну из проблем выше. Далёкую, шумную, пережатую запись она расшифрует чуть лучше — и всё равно плохо.
Честная формулировка: размер модели — это множитель к качеству вашего звука. Умножая плохой звук, вы получаете чуть менее плохой результат. Компромиссы разобраны в нашем руководстве по выбору модели.
Что не помогает вообще #
Прогнать тот же файл ещё раз. Сэмплирование не полностью детерминировано, так что ошибки могут немного отличаться. Это разброс, а не улучшение.
Поднять громкость. Усиление тихой записи ровно так же усиливает шум помещения. Соотношение — то, что важно, — не меняется.
Шумоподавление, как правило. Агрессивное шумоподавление вносит артефакты, которые сбивают модель не меньше, чем шум. Мягкий фильтр высоких частот, убирающий низкочастотный гул, может немного помочь. Тяжёлая обработка обычно вредит.
Платить больше за минуту. Облачные сервисы используют то же семейство моделей. Цена — не точность.
Как выглядит хороший результат #
Даже когда всё сделано правильно, автоматическая транскрибация не идеальна, и ни один инструмент её такой не сделает. Готовьтесь к тому, что с какой-то долей ошибок останутся: незнакомые имена собственные, профессиональный жаргон, быстро произнесённые числа и моменты, когда двое говорят одновременно.
Поэтому рабочий процесс важен не меньше точности: пользуйтесь режимом сегментов с таймкодами, чтобы прослушать аудио за любой строкой, в которой сомневаетесь, и проверяйте те части, на которые собираетесь опираться. Быстрый способ это делать описан в нашем руководстве по интервью.
Коротко #
Поднесите микрофон ближе. Снимите диктофон со стола и направьте на говорящего. Задавайте язык явно, а не доверяйте автоопределению. Не записывайте на низких битрейтах. Обрежьте тишину или используйте её детекцию. И только потом думайте о размере модели — самом слабом из шести рычагов.
Скачать Offline Transcription
Транскрибируйте аудио и видео целиком на своём Mac. Ничего не загружается в облако, аккаунт не нужен, поминутной тарификации нет.