指南

你到底需要哪个 Whisper 模型?

Tiny、Base、Small、Medium、Large。越大越准确,也慢得多,而对很多录音来说,这个差距比营销说的要小。

每个本地转录应用跑的都是某个版本的 OpenAI Whisper,而大多数都会强调自己支持哪些模型规模。更大的模型确实更准确。它们同时也慢得多、占磁盘大得多,而准确度的差距更多取决于你的录音,而不是模型。

下面讲讲怎样思考这件事,而不是条件反射地买清单上最大的那个。

各个规模 #

Whisper 主要有五种规模。数字本身不如曲线的形状重要:

模型 参数量 磁盘占用约为
Tiny 3900 万 ~75 MB
Base 7400 万 ~140 MB
Small 2.44 亿 ~470 MB
Medium 7.69 亿 ~1.5 GB
Large 15 亿 ~3 GB

每往上一级,体积大约是下一级的三倍,运行时间也相应变长。从 Small 到 Large 是大约六倍的参数量——在一段长录音上,这是"冲杯咖啡"和"出去吃个午饭"之间的差别。

准确度曲线的上升远没有那么快。它从 Tiny 到 Small 陡峭攀升,然后就趋于平缓。

真正决定你准确度的因素 #

这一点常被忽略。你录音的质量比模型规模更重要。

一段干净的录音——单个说话人、像样的麦克风、安静的房间、标准口音——用 Small 就能转得很好。把同一个文件推给 Large,你能多得到寥寥几个被纠正的词,多半是专有名词。

真正会让转录崩掉的是这些:

  • **背景噪声。**咖啡馆、空调、车流。
  • **重叠的语音。**两个人同时说话,对每个模型来说都很难。
  • **离麦克风的距离。**隔着会议桌录下的音频。
  • 浓重或较少见的口音,尤其是在模型训练时接触较少的语言里。
  • 专业词汇、人名和缩写。任何模型规模都修不好一个不常见的姓氏。
  • **英语之外的语言。**Whisper 的训练数据严重偏向英语,所以对其他语言而言,模型规模之间的差距要大得多。

如果你的音频占了其中好几条,更大的模型值这个钱。如果一条都不占,你花钱买的是一个舍入误差。

一种实用的选法 #

Tiny —— 粗略草稿和可搜索性。足以让你找到两小时录音中你需要的那一段。不足以拿去发布。

Base —— 语音备忘录、给自己的记录,以及干净的单人音频,反正结果你会自己读,也知道自己当时想说什么。

Small —— 大多数工作的合理默认值。用像样麦克风录的访谈、播客单集、课堂录音,以及大家离麦克风较近的会议音频。对于干净的英语语音,曲线就是在这里趋平的。

Medium 和 Large —— 难处理的音频、非英语语言,或者任何你不打算通读就要发布的内容。如果你的时间比等待更值钱,而重读一遍文稿的代价高于多花的处理时间,它们也是正确的选择。

直接测一下 #

老实说,没人能仅凭对你录音的描述给出答案,因为上面那些变量彼此交织。

拿你最糟的那个文件——嘈杂的那个、口音难懂的那个、你早就知道有问题的那个——用你手头能用的各个模型规模都跑一遍。对比结果。这一次测试告诉你的东西,比任何基准表格都多,因为它用的是你的麦克风、你的房间和你的题材。

如果小模型能搞定你最难的文件,那它就能搞定其余一切,而你刚刚省下了好几 GB 和大量等待时间。

这个应用处在什么位置 #

直说:Offline Transcription 提供 Tiny、Base 和 Small。它不包含 Medium 或 Large。

这覆盖了日常转录的大多数场景——干净的访谈、播客、讲座、会议、语音备忘录——同时让应用保持小巧和快速,在 iPhone 上也是如此。如果你经常处理难对付的音频或非英语录音,而大模型确实物有所值,那么提供它们的应用更适合你,我们的 MacWhisper 对比也是这么直说的。

这个应用可以免费下载,所以上面那个测试除了跑一遍的时间之外不花你任何东西。

有一件事和模型规模完全无关 #

无论你用哪个模型,它在哪里运行是另一个问题。Whisper 是一个开放模型,既可以在你自己的机器上运行,也可以在别人的服务器上运行。一家云转录服务用的多半是 Large——同时也留着一份你录音的副本。

在本地运行 Small 和在别人的数据中心运行 Large,并不是同一把尺子上的两个刻度。如果录音涉及机密,那这个决定优先,模型规模其次。我们关于检查一个应用是否真的离线的指南讲了两种情况下如何验证。

获取 Offline Transcription

音频和视频全程在你自己的 Mac 上转录。不上传任何内容,无需账户,也没有按分钟计费。

macOS 13.0 or higher · iOS 16.4 or higher