Руководство
Что делать с записью, где говорят несколько человек
Автоматические метки говорящих — самая перехваленная функция в транскрибации. Вот что эта технология делает на самом деле и как всё-таки получить точный транскрипт с несколькими говорящими.
«Автоматическое определение говорящих» есть в списке функций у большинства продуктов для транскрибации. Технология настоящая, иногда действительно полезная и куда менее надёжная, чем подразумевает маркетинг.
Если вы расшифровываете совещание, панельную дискуссию или групповое интервью, стоит понимать, что вы получаете на самом деле.
Что делает диаризация говорящих #
Диаризация — отдельный от транскрибации шаг. Она не распознаёт слова, а группирует аудио по характеристикам голоса — высоте, тембру, темпу — и решает: «этот отрезок звучит как тот же человек, что и вон тот». Затем она помечает кластеры как «Говорящий 1», «Говорящий 2» и так далее.
Из этого описания следуют две вещи, и они объясняют почти все претензии к этой функции.
Она не знает, кто есть кто. Она выдаёт «Говорящего 1», а не «доктора Чена». Присвоение имён — всегда человеческий шаг; инструмент, показывающий настоящие имена, либо берёт метаданные платформы, которая знала, у кого включён микрофон, либо получил их от вас.
Она работает по сходству голосов, а не по смыслу. Двое с похожими голосами сливаются в одну метку. Один человек, чей голос меняется — отклонился от микрофона, разгорячился, подключился по телефону, — распадается на двоих.
Когда это работает, а когда нет #
Более-менее надёжно: двое, различимые голоса, по микрофону на каждого или один общий вблизи, реплики по очереди без большого наложения. Правильно записанный подкаст на двоих — почти лучший случай.
Ненадёжно: четверо и больше. Переговорная с одним диктофоном посередине. Любой, кто на громкой связи. Похожие голоса — это реальный и неудобный вид сбоя, и он непропорционально сильно бьёт по группам людей одного пола и близкого возраста, то есть по большинству совещаний.
Практически безнадёжно: перебивания. Когда двое говорят одновременно, в звуке есть оба, и алгоритму приходится выбрать одного. Именно здесь реплики приписываются не тому человеку — и именно в этот момент спора или переговоров вам больше всего нужна точность.
Сбой, который важен #
Ошибка транскрибации обычно очевидна. Вы читаете бессмысленное предложение и идёте проверять.
Ошибка в приписывании реплики невидима. Предложение верное, грамотное — и приписано не тому человеку. Ничто в нём не выглядит неправильным. Если вы строите на нём цитату, протокол совещания или юридическую записку, ошибка расходится дальше молча.
Из-за этой асимметрии я не стал бы строить рабочий процесс, зависящий от правильности автоматических меток.
Что делать вместо этого #
Если платформа знала, кто говорит, используйте это #
Это единственный случай, где есть по-настоящему лучший ответ. Zoom, Teams и Google Meet знают, у кого включён микрофон, поэтому их собственные транскрипты могут помечать говорящих по метаданным, а не гадать по звуку. Если точность приписывания в приоритете, а совещание записывалось в облаке на тарифе с транскрибацией, это самый надёжный доступный источник. Компромиссы разобраны в нашем руководстве по записям совещаний.
Записывайте так, чтобы проблема была меньше #
- По микрофону на человека, если запись важна. Раздельные дорожки делают приписывание тривиальным и полностью снимают вопрос диаризации.
- Круглый стол, где участников просят не перебивать друг друга, даёт куда лучший транскрипт, чем тот, где перебивают. Сказать об этом в начале записываемого совещания — нормально и всем помогает.
- Попросите людей представляться в первый раз, когда они берут слово, — «Прия, я скажу», — это даст вам опору в транскрипте.
Расставляйте метки сами, по мере надобности #
Для большинства задач весь транскрипт размечать не нужно. Нужно, чтобы правильно были размечены те шесть фрагментов, которые вы будете цитировать или по которым будете действовать.
Практический метод: работайте в режиме сегментов с таймкодами, найдите важные фрагменты, проиграйте аудио для этих строк и впишите имя, когда убедились. Вы всё равно слушаете эти моменты, чтобы проверить слова. Разметка не стоит ничего сверх того и остаётся единственным по-настоящему точным методом.
Опирайтесь на структуру, а не на метки #
Для многих задач по совещаниям транскрипт с таймкодами и без меток говорящих вполне пригоден: вы ищете решения и поручения, а не составляете пьесу. Не тратьте полдня на исправление меток, которые вам никогда не были нужны.
Наша позиция #
Offline Transcription не делает автоматического определения говорящих. Скажем прямо почему: семейство Whisper диаризацию не выполняет, добавить её — значит добавить вторую модель с описанной выше надёжностью, а выпускать метки, которые ошибаются незаметно, для той работы, которой заняты наши пользователи, хуже, чем не выпускать меток вовсе.
Что приложение действительно даёт — это процесс, делающий ручную разметку быстрой: у каждого сегмента есть таймкоды, и вы можете прослушать аудио за любой строкой, чтобы убедиться, кто это сказал, прежде чем написать рядом имя.
Если автоматические метки для вас обязательны, это законный повод выбрать другой инструмент, и я лучше скажу об этом прямо, чем сделаю вид, что это не так.
Коротко #
Диаризация группирует голоса; людей она не знает. Она неплоха для двух различимых говорящих и ненадёжна для групп, похожих голосов и перебиваний — а её ошибки невидимы, в отличие от ошибок транскрибации. Пишите раздельные дорожки, если это важно, используйте метаданные платформы, если они есть, а в остальном размечайте на слух те несколько фрагментов, которыми действительно пользуетесь, — по ходу дела.
Скачать Offline Transcription
Транскрибируйте аудио и видео целиком на своём Mac. Ничего не загружается в облако, аккаунт не нужен, поминутной тарификации нет.