指南

如何处理有多位说话人的录音

自动说话人标注是转录领域被吹得最过头的功能。下面说说这项技术实际能做什么,以及无论如何怎样拿到一份准确的多人文稿。

"自动说话人识别"出现在大多数转录产品的功能清单上。它是真实存在的技术,有时也确实有用,但远没有营销说得那么可靠。

如果你要转录一场会议、一次圆桌讨论或一次小组访谈,值得知道你拿到的究竟是什么。

说话人分离在做什么 #

说话人分离是独立于转录之外的一步。它不识别词语,而是按嗓音特征——音高、音色、节奏——对音频聚类,判断"这一段听上去和那一段是同一个人"。然后把这些聚类标为说话人 1、说话人 2,依此类推。

从这个描述可以推出两件事,而它们几乎解释了关于该功能的所有抱怨。

**它不知道谁是谁。**它产出的是"说话人 1",不是"陈博士"。分配姓名永远是人来做的一步;显示真实姓名的工具,要么用的是某个知道谁取消了静音的平台的元数据,要么就是你自己告诉它的。

**它依据的是嗓音相似度,不是含义。**两个嗓音相近的人会被并成一个标签。一个嗓音发生变化的人——身体离开麦克风、情绪激动起来、改用电话接入——会被拆成两个。

什么时候管用,什么时候不管用 #

**还算可靠:**两个人,嗓音有明显差别,各自一支麦克风或共用一支近距离麦克风,轮流发言、少有重叠。一档录制规范的双人播客接近最理想的情况。

**不可靠:**四人或更多。会议室中间只放一台录音设备。任何用免提接入的人。相近的嗓音——这是一种真实而尴尬的失败模式,并且对同性别、年龄相仿的人群影响格外大,而大多数会议正是如此。

**基本没戏:**抢话。两个人同时说话时,音频里两个人都有,而聚类必须选一个。这恰恰是文稿会被归错人的地方——也恰恰是在争论或谈判中你最希望准确的那一刻。

真正要紧的那种失败 #

转录错误通常很明显。你读到一句不通的话,就会去查证。

说话人归属的错误则是隐形的。句子是正确的、通顺的,只是归到了错的人头上。它看上去哪里都没问题。如果你在此基础上写引语、写会议记录或写法律笔记,错误会悄无声息地传播下去。

正是这种不对称,让我不会去建立一套依赖自动标注正确的工作流程。

应该怎么做 #

如果平台知道谁在说话,就用它 #

这是唯一一种确实有更好答案的情况。Zoom、Teams 和 Google Meet 知道谁取消了静音,所以它们自己的文稿可以依据元数据来标注说话人,而不必从音频去猜。如果准确归属是首要目标,而会议又是在包含转录的套餐下进行云端录制的,那就是可获得的最可靠来源。我们的会议录音指南讲了其中的取舍。

用能让问题变小的方式录制 #

  • 如果这份录音很重要,就每人一支麦克风。分轨让归属变得轻而易举,也彻底免去了说话人分离。
  • 事先请大家不要抢话的圆桌讨论,产出的文稿远好过大家抢话的那种。在一场要录音的会议开始时说明这一点很常见,也对所有人都有帮助。
  • 让大家第一次发言时报一下自己的名字——"我是 Priya"——这样文稿里就有了锚点。

在用到的时候自己标注 #

大多数工作并不需要整份文稿都有标注。你需要的是你打算引用或据以行动的那六段被正确地标注出来。

实际做法是:在带时间戳的分段视图里工作,找到重要的段落,播放那几行的音频,一边确认一边把名字写上去。反正你为了核对字句也要听这些片段。顺手标注不增加任何成本,而且这是唯一真正准确的方法。

用结构代替标注 #

对于很多会议类工作,一份有时间戳、没有说话人标注的文稿完全够用——你要找的是决定和待办事项,不是在编一个剧本。别花一个下午去修你根本不需要的标注。

我们的立场 #

Offline Transcription 不做自动说话人识别。直白地说明原因:Whisper 系列本身不做说话人分离,加上它意味着引入第二个模型,其可靠性就是上文描述的那样,而交付一种以隐形方式出错的标注,对我们用户所做的这类工作来说,比不提供标注更糟。

它确实提供的,是让手动标注变快的工作流程:每个片段都带有自己的时间戳,你可以播放任意一行背后的音频,先确认是谁说的,再在旁边写下名字。

如果自动标注对你是硬性要求,那是使用别的工具的正当理由,我宁愿明说,也不愿假装不是这样。

简短版本 #

说话人分离对嗓音聚类,它并不认识人。它在两位嗓音有别的说话人身上表现尚可,在多人、相近嗓音和抢话的情况下不可靠——而且它的错误是隐形的,转录错误则不是。如果这件事重要就分轨录制,有平台元数据就用平台元数据,否则就靠耳朵,在用到的时候把你实际会用上的那几段标注好。

获取 Offline Transcription

音频和视频全程在你自己的 Mac 上转录。不上传任何内容,无需账户,也没有按分钟计费。

macOS 13.0 or higher · iOS 16.4 or higher