가이드
실제로 필요한 Whisper 모델은 무엇일까
Tiny, Base, Small, Medium, Large. 클수록 정확하고 훨씬 느리며, 많은 녹음에서 그 차이는 마케팅이 암시하는 것보다 작습니다.
로컬 텍스트 변환 앱은 모두 OpenAI Whisper의 어떤 버전을 돌리고 있고, 대부분 어떤 모델 크기를 지원하는지를 강조합니다. 큰 모델은 실제로 더 정확합니다. 동시에 훨씬 느리고 디스크에서 훨씬 크며, 정확도 차이는 모델보다 녹음 상태에 훨씬 더 좌우됩니다.
반사적으로 가장 큰 것을 고르지 않고 판단하는 방법을 정리했습니다.
크기 #
Whisper에는 주요 크기가 다섯 가지 있습니다. 숫자 자체보다 곡선의 모양이 중요합니다.
| 모델 | 파라미터 | 디스크 용량 대략 |
|---|---|---|
| Tiny | 3,900만 | 약 75 MB |
| Base | 7,400만 | 약 140 MB |
| Small | 2억 4,400만 | 약 470 MB |
| Medium | 7억 6,900만 | 약 1.5 GB |
| Large | 15억 | 약 3 GB |
한 단계 올라갈 때마다 바로 아래보다 대략 세 배 커지고, 실행 시간도 그만큼 길어집니다. Small에서 Large로 가면 파라미터가 약 여섯 배가 되는데, 긴 녹음에서는 커피 한 잔 내리는 시간과 점심 먹으러 다녀오는 시간의 차이입니다.
정확도 곡선은 그만큼 빠르게 오르지 않습니다. Tiny에서 Small까지는 가파르게 오르다가 평평해집니다.
정확도를 실제로 결정하는 것 #
여기가 놓치기 쉬운 부분입니다. 모델 크기보다 녹음의 품질이 더 중요합니다.
깨끗한 녹음, 즉 화자 한 명, 괜찮은 마이크, 조용한 방, 표준적인 억양이라면 Small에서도 잘 변환됩니다. 같은 파일을 Large로 밀어 넣어 봐야 몇 단어, 그것도 대부분 고유명사가 고쳐질 뿐입니다.
텍스트 변환을 정말로 망가뜨리는 것은 이런 것들입니다.
- 배경 소음. 카페, 에어컨, 차 소리 같은 것들입니다.
- 겹치는 말. 두 사람이 동시에 말하는 것은 어떤 모델에게도 어렵습니다.
- 마이크와의 거리. 회의실 탁자 건너편에서 녹음된 오디오입니다.
- 강한 억양이나 덜 흔한 억양. 모델이 학습 중에 덜 접한 언어라면 특히 그렇습니다.
- 전문 용어, 이름, 약어. 낯선 성은 어떤 모델 크기로도 해결되지 않습니다.
- 영어가 아닌 언어. Whisper의 학습 데이터는 영어에 크게 치우쳐 있어서, 다른 언어에서는 모델 크기 사이의 격차가 훨씬 큽니다.
오디오에 이 중 여러 가지가 해당한다면 큰 모델은 값을 합니다. 하나도 해당하지 않는다면 반올림 오차에 돈을 내는 셈입니다.
실용적인 선택 방법 #
Tiny — 초벌 원고와 검색 용도입니다. 두 시간짜리 녹음에서 필요한 부분을 찾기에는 충분합니다. 공개하기에는 부족합니다.
Base — 음성 메모, 스스로에게 남기는 메모, 결과를 직접 읽고 무슨 뜻이었는지 아는 깨끗한 단독 화자 오디오입니다.
Small — 대부분의 작업에 합리적인 기본값입니다. 괜찮은 마이크로 진행한 인터뷰, 팟캐스트 에피소드, 강의 녹음, 사람들이 마이크 가까이 있는 회의 오디오입니다. 깨끗한 영어 발화에서 곡선이 평평해지는 지점이 여기입니다.
Medium과 Large — 어려운 오디오, 영어가 아닌 언어, 또는 전체를 읽어 보지 않고 공개할 것들입니다. 기다리는 시간보다 자기 시간이 더 값지고, 변환된 텍스트를 다시 읽는 비용이 추가 처리 시간보다 크다면 이쪽이 맞습니다.
그냥 직접 시험해 보세요 #
솔직한 답은, 녹음에 대한 설명만으로는 아무도 답해 줄 수 없다는 것입니다. 위의 변수들이 서로 얽히기 때문입니다.
가장 나쁜 파일, 즉 시끄럽거나, 억양이 어렵거나, 이미 문제라는 걸 아는 파일을 골라 쓸 수 있는 모델 크기마다 돌려 보세요. 그리고 결과를 비교하세요. 그 한 번의 시험이 어떤 벤치마크 표보다 많은 것을 알려 줍니다. 여러분의 마이크, 여러분의 공간, 여러분의 주제를 쓰기 때문입니다.
작은 모델이 가장 어려운 파일을 감당한다면 나머지도 감당할 것이고, 방금 몇 기가바이트와 많은 대기 시간을 아낀 것입니다.
이 앱의 위치 #
솔직하게 말하면, Offline Transcription은 Tiny, Base, Small을 제공합니다. Medium이나 Large는 포함하지 않습니다.
이것으로 일상적인 텍스트 변환의 대부분, 즉 깨끗한 인터뷰, 팟캐스트, 강의, 회의, 음성 메모가 해결되고, iPhone을 포함해 앱을 작고 빠르게 유지할 수 있습니다. 큰 모델이 제값을 하는 어려운 오디오나 비영어 녹음을 일상적으로 다룬다면 그 모델을 제공하는 앱이 더 잘 맞고, 저희 MacWhisper 비교에서도 그렇게 분명히 말하고 있습니다.
앱은 무료로 내려받을 수 있으니, 위의 시험에는 돌리는 시간 말고는 아무 비용이 들지 않습니다.
모델 크기와 전혀 관계없는 것 한 가지 #
어떤 모델을 쓰든 어디에서 돌아가느냐는 별개의 문제입니다. Whisper는 공개된 모델이고, 내 컴퓨터에서 돌릴 수도 있고 누군가의 서버에서 돌릴 수도 있습니다. 클라우드 텍스트 변환 서비스는 아마 Large를 돌리고 있을 것이며, 동시에 여러분의 녹음 사본을 보관하고 있을 것입니다.
로컬에서 Small을 돌리는 것과 남의 데이터센터에서 Large를 돌리는 것은 같은 척도 위의 점이 아닙니다. 녹음이 기밀이라면 그 결정이 먼저이고 모델 크기는 그다음입니다. 어느 쪽이든 확인하는 방법은 앱이 정말 오프라인인지 확인하기 가이드에서 다룹니다.
Offline Transcription 받기
오디오와 영상을 온전히 내 Mac에서 텍스트로 변환합니다. 업로드되는 것이 없고, 계정도 없으며, 분당 요금도 없습니다.