가이드

Mac에서 텍스트 변환이 느린 이유

같은 앱을 돌려도 같은 녹음이 어떤 Mac에서는 2분, 어떤 Mac에서는 40분이 걸립니다. 그 차이의 대부분은 네 가지로 설명됩니다.

로컬 텍스트 변환 속도는 편차가 아주 크고, Mac이 얼마나 최신인지나 얼마를 주고 샀는지에 비례하지도 않습니다. 같은 앱으로 같은 한 시간짜리 녹음을 돌려도 어떤 기기에서는 3분, 다른 기기에서는 30분이 걸릴 수 있습니다.

거의 전부가 네 가지로 설명됩니다.

1. Apple Silicon이냐 Intel이냐 #

가장 큰 요인이고, 작은 차이가 아닙니다.

텍스트 변환은 행렬 연산이 지배합니다. Apple Silicon에는 여기에 특히 잘 맞는 것이 둘 있습니다. 바로 그 연산을 위해 만들어진 Neural Engine, 그리고 모델 가중치를 CPU와 GPU 메모리 사이로 오가며 복사할 필요가 없게 해 주는 통합 메모리입니다.

Intel Mac에는 둘 다 없습니다. Neural Engine이 아예 없으므로 모델에서 비용이 큰 절반인 인코더가 CPU나 버스 너머의 별도 GPU로 넘어갑니다. 같은 파일에서 흔히 몇 배 느려집니다.

Intel Mac을 쓰고 있어도 텍스트 변환은 충분히 쓸 만합니다. 다만 지켜보는 것이 아니라 시작해 두고 나중에 돌아오는 작업이 됩니다. 소프트웨어로는 그 격차를 메울 수 없습니다. 격차의 정체가 실리콘이기 때문입니다.

2. 앱이 Neural Engine을 쓰기는 하는가 #

같은 M 시리즈 Mac에서도 두 앱의 속도가 크게 다를 수 있습니다. Neural Engine을 쓰는 것이 자동이 아니기 때문입니다.

인코더가 거기서 돌아가려면 모델을 미리 Core ML의 형식으로 컴파일해 두어야 합니다. 가중치와 함께 Core ML 인코더를 배포하는 앱은 빠른 경로를 타고, 그러지 않는 앱은 모든 것을 GPU나 CPU에서 돌리며 성능을 많이 남겨 둡니다.

밖에서는 볼 수 없지만 체감할 수는 있습니다. 내 컴퓨터에서 어떤 로컬 텍스트 변환 앱이 다른 앱보다 확연히 빠르다면 보통 이것이 이유입니다.

3. 모델 크기 #

Whisper의 크기는 단계마다 파라미터가 대략 3배씩 차이 나고, 시간도 그에 따라 커집니다. Base에서 Large로 가면 파라미터가 약 20배가 되고, 긴 파일에서는 커피 한 잔과 오후 한나절의 차이가 됩니다.

앱이 큰 모델을 기본값으로 쓰거나, 클수록 좋아 보여서 그것을 골랐다면 그것만으로 대기 시간이 설명될 수 있습니다. 정확도 향상은 크기 차이가 암시하는 것보다 훨씬 작고, 깨끗한 발화에서는 체감되지 않는 경우가 많습니다.

4. 무음을 변환하느라 얼마나 치르고 있는가 #

90분짜리 회의를 두 시간 녹음했다면 그 안에 아무것도 없는 30분이 들어 있습니다. 음성 활동 감지가 없으면 모델이 그것까지 전부 처리하면서, 무음을 말소리와 같은 비용으로 디코딩하고 그 과정에서 반복된 쓰레기 텍스트를 만들어 냅니다.

VAD를 먼저 돌리는 앱은 그런 구간을 통째로 건너뜁니다. 빈 구간이 많은 녹음에서는 결코 미미한 절약이 아닙니다.

실제로 빨라지는 방법 #

효과가 큰 순서입니다.

  1. 더 작은 모델을 쓰세요. 깨끗한 발화에는 Base로 충분하고, Large보다 몇 배 빠릅니다.
  2. Apple Silicon을 쓴다면 Core ML 인코더가 있는 앱을 쓰세요.
  3. 빈 구간을 잘라내거나, 말소리를 먼저 감지하는 도구를 쓰세요.
  4. 경쟁하는 다른 작업을 닫으세요. 텍스트 변환은 쓸 수 있는 코어를 전부 씁니다. 백그라운드의 영상 내보내기 하나가 처리량을 반으로 줄입니다.
  5. 노트북을 전원에 연결하세요. 배터리로 돌아갈 때 macOS는 지속적인 작업의 속도를 제한하고, 저전력 모드에서는 더 강하게 제한합니다.

빨라지지 않는 것 #

RAM 늘리기. 스와핑이 일어나고 있던 경우가 아니라면 그렇습니다. 실제 작업 집합은 사람들이 생각하는 것보다 작습니다.

더 빠른 인터넷. 로컬 텍스트 변환에는 네트워크 단계가 없습니다. 속도가 회선에 좌우된다면 그 작업은 내 컴퓨터에서 이루어지고 있지 않은 것입니다.

다시 시작하기. 실행이 느릴 때 다시 시작하면 같은 작업을 처음부터 하게 됩니다.

대략적인 기준 #

Base 모델과 Core ML 인코더를 쓰는 Apple Silicon Mac에서는 텍스트 변환이 실시간보다 몇 배 빠르게 돌아가고, 한 시간짜리 녹음이 몇 분이면 끝납니다. 저희가 두 시간짜리 파일로 측정했을 때는 처음부터 끝까지 3분이 채 걸리지 않았습니다.

Intel Mac에서는 녹음 길이의 상당 부분에 해당하는 시간이 걸린다고 보면 됩니다. 여전히 할 만하고 여전히 무료지만, 지켜볼 작업은 아닙니다.

Apple Silicon에서 이 범위를 크게 벗어난다면 원인은 순서대로 이렇습니다. 큰 모델, Neural Engine을 쓰지 않는 앱, 또는 기기를 두고 경쟁하는 다른 작업이 많은 경우입니다.

요약 #

Apple Silicon이냐 Intel이냐가 가장 큰 요인이고 소프트웨어로는 해결할 수 없습니다. 그다음으로는 더 작은 모델을 쓰고, 인코더를 Neural Engine용으로 컴파일해 두는 앱을 쓰고, 무음을 변환하는 대신 건너뛰고, 배터리로 영상 내보내기와 동시에 돌리지 마세요.

Offline Transcription 받기

오디오와 영상을 온전히 내 Mac에서 텍스트로 변환합니다. 업로드되는 것이 없고, 계정도 없으며, 분당 요금도 없습니다.

macOS 13.0 or higher · iOS 16.4 or higher