指南

转录不准确——真正能解决问题的是这些

大家第一反应都是换更大的模型。它其实是所有可选改动里最不管用的一个,而你手上已经有的麦克风才是最管用的那个。

当转录文稿返回来满是错误时,人的本能是怪工具,然后去找一个更好的。有时候这没错。但通常问题出在上游,而解决办法是免费的。

下面是真正能改变准确度的因素,按效果排序。

1. 麦克风距离(影响远超其他) #

语音识别的表现取决于人声与其他一切声音的比例。距离对这个比例的破坏比任何因素都快:声压随距离衰减,而房间里的噪声保持不变,所以你每退一步,语音相对于空调声、车流声和咖啡机声就更轻一分。

同样的应用、同样的模型,一部放在离说话人嘴边 45 厘米处的手机,产出的文稿会比放在两米开外的同一部手机好得多。这不是微小的差别——这是"花五分钟修一下"和"整段重打"之间的差别。

如果你只能改一件事,就改这个。

2. 录音设备放在哪里 #

与上一条相关但不相同,而这正是会议录音出问题的地方。

放在桌子正中间的设备与每个人的距离相等,也就意味着它离每个人都远,却离桌面很近——桌面会把每一次敲击、挪动和放咖啡杯的声音直接传进麦克风。更好的做法:把录音设备从桌面抬高,并让它朝向说话最多的那个人。

如果是讲座或演讲,而场地有扩声系统或官方录音,那个音源会好过你在座位上能录到的任何东西。

3. 明确指定语言 #

自动语言识别取的是文件开头的一段样本。如果前三十秒是环境噪声、音乐,或者有人说的语言与录音其余部分不同,识别就可能落到错误的语言上,并且整个文件都一直错下去。

症状很好辨认,也很让人困惑:一份用谁都没说过的语言写成的文稿,或者时不时冒出这样的段落。如果你知道语言,就把它设好,别让工具去猜。在 Offline Transcription 里,你可以长按某个文件的转录按钮来选择它的语言,当你手上有多份不同语言的录音时,这一点最为要紧。

4. 不要用过度压缩的方式录音 #

在大约 64 kbps 以下,有损压缩会去掉用来区分相似辅音的高频细节——"fifteen"和"fifty"之间的区别就藏在那儿。编码器丢掉的信息,没有任何转录工具能补回来。

请用无压缩或正常码率录制。如果别人交给你的就是一个低码率文件,那就是你准确度的上限,改任何设置都没用。

5. 去掉静音 #

长时间没有语音的片段并非无害。Whisper 会为交给它的任何东西生成文字,而面对静音它会不断重复自己,有时能重复出好几页。

语音活动检测能从根本上解决这个问题——它根本不会把静音部分送给模型。做不到的话,就在转录前把录音裁一下。

6. 然后,也许,换个更大的模型 #

它排在最后是有原因的。

模型规模确实能提升准确度,提升也是真实存在的,但比人们预期的小——而且要付出大量时间和磁盘空间。更重要的是,更大的模型解决不了上面任何一个问题。它会把一段远距离、嘈杂、过度压缩的录音转得稍微好一点,然后依旧很糟。

实话实说:模型规模是作用在你音频质量上的一个乘数。糟糕的音频乘一乘,得到的是没那么糟的结果。我们关于选择模型的指南讲了其中的取舍。

完全没用的做法 #

**把同一个文件再跑一遍。**采样并非完全确定的,所以你可能得到略有不同的错误。那是波动,不是改进。

**把音量调大。**放大一段轻的录音,同时也等比例放大了房间噪声。真正重要的那个比例没有任何变化。

**降噪,多数情况下如此。**激进的降噪会引入伪影,它对模型的干扰不亚于原来的噪声。用温和的高通滤波去掉低频隆隆声可能略有帮助。重度处理通常有害。

**每分钟花更多钱。**云服务跑的是同一族模型。价格不等于准确度。

理想状态是什么样 #

即使每一项都做对了,自动转录也不是完美的,也没有工具能让它完美。以下这些仍会以一定比例出错:不熟悉的专有名词、专业术语、快速说出的数字,以及两个人抢话的时刻。

正因如此,工作流程和准确度同样重要:使用带时间戳的分段视图,这样你对哪一行有疑问就可以播放它背后的音频,并且核对你打算依赖的那些部分。我们的访谈指南介绍了一种快速做到这一点的方法。

简短版本 #

把麦克风移近。把录音设备从桌面抬起来,朝向说话的人。明确指定语言,而不是相信自动识别。不要用低码率录音。裁掉或检测静音。做完这些之后,再去考虑模型规模——它是这六项中最小的那个杠杆。

获取 Offline Transcription

音频和视频全程在你自己的 Mac 上转录。不上传任何内容,无需账户,也没有按分钟计费。

macOS 13.0 or higher · iOS 16.4 or higher