指南
如何转录一场你需要准确引用的访谈
自动转录如今已经好到可以拿来干活,但仍然没好到可以闭着眼睛引用。差的那一步是一遍核对,只需几分钟,而不是几小时。
自动转录以一种很具体的方式改变了访谈工作。它没有免去你核对引语的必要。它免去的是为了找到这些引语而把九十分钟对话逐字打出来的必要。
这是个不小的变化,而它只有在你保留核对这一步时才成立。下面这套方法的前提是:文稿是音频的可搜索索引,而不是一份成品文档。
录制之前 #
这里的两个决定,比你事后做的任何事都更省时间。
**把录音设备放在对方身边,而不是你身边。**文稿不可用最常见的原因,就是一部平放在咖啡馆桌面上、夹在两人之间的手机,把浓缩咖啡机录得和采访对象一样响。把手机靠在什么东西上立起来、朝向对方、距离一米左右,效果会好得多。外接麦克风还要更好,但很少有必要。
开头出声说清楚谁是谁。"今天 30 号,我在和陈博士谈试验结果。"十秒钟,而它会进入文稿,成为一个你可以搜索的开头。如果你要录很多访谈,这就是"一堆叫 New Recording 47 的文件"和"一份存档"之间的区别。
开始转录 #
操作本身很简单。真正值得有意识去做的决定,是音频去了哪里。
大多数转录服务会把你的录音上传到服务器。对于访谈,这是个实际问题,而不是哲学问题:
- 如果你答应过消息源保密,那么把录音发给第三方这件事,别人问起时你应当能够准确说明。
- 如果采访对象谈到的内容受保密协议、医疗隐私或伦理审查约束,"我们把它上传到了一家保留 30 天的美国服务"可能违反你同意过的条款。
- 如果你在外场没有信号,基于上传的工具根本用不了。
本地转录绕开了这一切:文件从磁盘读取,在你的机器上转录,从不发往任何地方。如果你想亲自验证这个说法,而不是听信任何人的一面之词——包括我们的——我们写了三种你自己动手测试的方法。
用 Offline Transcription 时,把录音放进去,如果不是英语就设好语言,然后转录。九十分钟的访谈在 Apple Silicon 上要几分钟。
核对这一遍 #
这是真正重要、也是大家会跳过的部分。
你不是在通篇校对文稿。你是在核实你打算发表的那些具体句子,外加已知容易聚集错误的那些位置。
**逐条对照音频核对你打算使用的每一句引语。**不是它周围的那一段——是引号里面的字。如果这句引语要署着某人的名字见报,这一步没有商量余地。
这四件事要全篇都查:
- **人名与机构名。**Whisper 会很有把握地把一个不熟悉的姓氏写成一个发音相近的常用词,而且完全不会给出任何"我不确定"的信号。
- 数字。"Fifteen"和"fifty"相差一个音素,也相差一个事实错误。快速说话时的"million"和"billion"同理。
- 否定词。"我们没有考虑过那个"和"我们考虑过那个"只差一个很短、说话时很容易被吞掉的词。这是会让人吃官司的那类错误。
- **抢话。**两个人同时说话的地方,文稿会把他们混在一起,一整句话甚至可能被完全归到错的人头上。
**让这件事变快的机械技巧:**在一个每行都带有自己时间戳的分段视图里工作,只播放那一行对应的音频,而不是去拖波形。这样核对十二条引语就是十二次点击,而不是在九十分钟里翻找十二次。在我们的应用里,"分段"视图正是这么做的——选中一行,按播放,只听到那一行。
说话人标注 #
基于 Whisper 构建的东西,没有一个能可靠地识别说话人。提供这项功能的工具跑的是另一个说话人分离模型,结果在安静房间里两个人的情况下还不错,在热闹场合四个人的情况下就很差。
对于常规的两人访谈,实际的做法是在用到的时候自己改:你知道哪个声音是你的,而等你去摘引语时,反正也在听那些片段。不要建立一套依赖自动标注正确的工作流程。
让文稿以后仍然有用 #
两个习惯,成本都很低:
**导出时带上时间戳,不要只导文字。**纯文本是你写稿时用的;带时间戳的导出,是半年后事实核查找上门时让你重新定位那个瞬间的东西。如果你想在表格里排序或筛选,CSV 很适合。
**保留音频。**文稿是衍生产物。万一某句引语引发争议,证据是录音,不是文稿。
简短版本 #
靠近采访对象录音,并出声报出访谈信息。在本地转录,这样录音仍然是你的,而且没信号也能用。然后逐条对照音频核实你打算发表的每一句引语,并全篇检查人名、数字、否定词和抢话。使用带逐行播放的分段视图,核对就只要几分钟。
文稿是对所说内容的一份快速索引。你的引语,仍然出自录音。
获取 Offline Transcription
音频和视频全程在你自己的 Mac 上转录。不上传任何内容,无需账户,也没有按分钟计费。