Руководство

Что делать с записью, где говорят несколько человек

Автоматические метки говорящих — самая перехваленная функция в транскрибации. Вот что эта технология делает на самом деле и как всё-таки получить точный транскрипт с несколькими говорящими.

«Автоматическое определение говорящих» есть в списке функций у большинства продуктов для транскрибации. Технология настоящая, иногда действительно полезная и куда менее надёжная, чем подразумевает маркетинг.

Если вы расшифровываете совещание, панельную дискуссию или групповое интервью, стоит понимать, что вы получаете на самом деле.

Что делает диаризация говорящих #

Диаризация — отдельный от транскрибации шаг. Она не распознаёт слова, а группирует аудио по характеристикам голоса — высоте, тембру, темпу — и решает: «этот отрезок звучит как тот же человек, что и вон тот». Затем она помечает кластеры как «Говорящий 1», «Говорящий 2» и так далее.

Из этого описания следуют две вещи, и они объясняют почти все претензии к этой функции.

Она не знает, кто есть кто. Она выдаёт «Говорящего 1», а не «доктора Чена». Присвоение имён — всегда человеческий шаг; инструмент, показывающий настоящие имена, либо берёт метаданные платформы, которая знала, у кого включён микрофон, либо получил их от вас.

Она работает по сходству голосов, а не по смыслу. Двое с похожими голосами сливаются в одну метку. Один человек, чей голос меняется — отклонился от микрофона, разгорячился, подключился по телефону, — распадается на двоих.

Когда это работает, а когда нет #

Более-менее надёжно: двое, различимые голоса, по микрофону на каждого или один общий вблизи, реплики по очереди без большого наложения. Правильно записанный подкаст на двоих — почти лучший случай.

Ненадёжно: четверо и больше. Переговорная с одним диктофоном посередине. Любой, кто на громкой связи. Похожие голоса — это реальный и неудобный вид сбоя, и он непропорционально сильно бьёт по группам людей одного пола и близкого возраста, то есть по большинству совещаний.

Практически безнадёжно: перебивания. Когда двое говорят одновременно, в звуке есть оба, и алгоритму приходится выбрать одного. Именно здесь реплики приписываются не тому человеку — и именно в этот момент спора или переговоров вам больше всего нужна точность.

Сбой, который важен #

Ошибка транскрибации обычно очевидна. Вы читаете бессмысленное предложение и идёте проверять.

Ошибка в приписывании реплики невидима. Предложение верное, грамотное — и приписано не тому человеку. Ничто в нём не выглядит неправильным. Если вы строите на нём цитату, протокол совещания или юридическую записку, ошибка расходится дальше молча.

Из-за этой асимметрии я не стал бы строить рабочий процесс, зависящий от правильности автоматических меток.

Что делать вместо этого #

Если платформа знала, кто говорит, используйте это #

Это единственный случай, где есть по-настоящему лучший ответ. Zoom, Teams и Google Meet знают, у кого включён микрофон, поэтому их собственные транскрипты могут помечать говорящих по метаданным, а не гадать по звуку. Если точность приписывания в приоритете, а совещание записывалось в облаке на тарифе с транскрибацией, это самый надёжный доступный источник. Компромиссы разобраны в нашем руководстве по записям совещаний.

Записывайте так, чтобы проблема была меньше #

  • По микрофону на человека, если запись важна. Раздельные дорожки делают приписывание тривиальным и полностью снимают вопрос диаризации.
  • Круглый стол, где участников просят не перебивать друг друга, даёт куда лучший транскрипт, чем тот, где перебивают. Сказать об этом в начале записываемого совещания — нормально и всем помогает.
  • Попросите людей представляться в первый раз, когда они берут слово, — «Прия, я скажу», — это даст вам опору в транскрипте.

Расставляйте метки сами, по мере надобности #

Для большинства задач весь транскрипт размечать не нужно. Нужно, чтобы правильно были размечены те шесть фрагментов, которые вы будете цитировать или по которым будете действовать.

Практический метод: работайте в режиме сегментов с таймкодами, найдите важные фрагменты, проиграйте аудио для этих строк и впишите имя, когда убедились. Вы всё равно слушаете эти моменты, чтобы проверить слова. Разметка не стоит ничего сверх того и остаётся единственным по-настоящему точным методом.

Опирайтесь на структуру, а не на метки #

Для многих задач по совещаниям транскрипт с таймкодами и без меток говорящих вполне пригоден: вы ищете решения и поручения, а не составляете пьесу. Не тратьте полдня на исправление меток, которые вам никогда не были нужны.

Наша позиция #

Offline Transcription не делает автоматического определения говорящих. Скажем прямо почему: семейство Whisper диаризацию не выполняет, добавить её — значит добавить вторую модель с описанной выше надёжностью, а выпускать метки, которые ошибаются незаметно, для той работы, которой заняты наши пользователи, хуже, чем не выпускать меток вовсе.

Что приложение действительно даёт — это процесс, делающий ручную разметку быстрой: у каждого сегмента есть таймкоды, и вы можете прослушать аудио за любой строкой, чтобы убедиться, кто это сказал, прежде чем написать рядом имя.

Если автоматические метки для вас обязательны, это законный повод выбрать другой инструмент, и я лучше скажу об этом прямо, чем сделаю вид, что это не так.

Коротко #

Диаризация группирует голоса; людей она не знает. Она неплоха для двух различимых говорящих и ненадёжна для групп, похожих голосов и перебиваний — а её ошибки невидимы, в отличие от ошибок транскрибации. Пишите раздельные дорожки, если это важно, используйте метаданные платформы, если они есть, а в остальном размечайте на слух те несколько фрагментов, которыми действительно пользуетесь, — по ходу дела.

Скачать Offline Transcription

Транскрибируйте аудио и видео целиком на своём Mac. Ничего не загружается в облако, аккаунт не нужен, поминутной тарификации нет.

macOS 13.0 or higher · iOS 16.4 or higher