가이드
변환된 텍스트가 부정확할 때 실제로 효과가 있는 것들
사람들은 먼저 더 큰 모델부터 찾습니다. 하지만 그것은 선택지 중 효과가 가장 작고, 이미 가지고 있는 마이크가 효과가 가장 큽니다.
변환된 텍스트에 오류가 가득하면 도구를 탓하며 더 나은 것을 찾게 됩니다. 그 판단이 맞을 때도 있습니다. 하지만 대개 문제는 그 앞 단계에 있고, 해결책은 공짜입니다.
정확도를 실제로 움직이는 것들을 효과가 큰 순서대로 정리했습니다.
1. 마이크와의 거리 (압도적으로 가장 큽니다) #
음성 인식 성능은 목소리와 나머지 모든 소리의 비율에 따라 나빠집니다. 거리는 그 비율을 무엇보다 빠르게 망가뜨립니다. 음압은 거리에 따라 줄어드는 반면 방의 소음은 그대로이므로, 한 걸음 물러설 때마다 에어컨, 차 소리, 커피 머신 소리에 비해 말소리가 작아집니다.
화자의 입에서 45센티미터 떨어진 휴대폰은, 같은 앱과 같은 모델을 쓰더라도 2미터 떨어진 같은 휴대폰보다 훨씬 나은 텍스트를 만들어 냅니다. 작은 차이가 아닙니다. 5분이면 고칠 수 있는 텍스트와 다시 타이핑해야 하는 텍스트의 차이입니다.
딱 하나만 바꿀 수 있다면 이것을 바꾸세요.
2. 녹음기가 놓인 자리 #
관련은 있지만 다른 이야기이고, 회의 녹음이 어긋나는 지점입니다.
탁자 한가운데 놓인 기기는 모두에게서 같은 거리에 있고, 그 말은 모두에게서 멀고 탁자에는 가깝다는 뜻입니다. 탁자는 두드리는 소리, 부스럭거림, 커피잔 소리를 그대로 마이크로 전달합니다. 더 나은 방법은 녹음기를 표면에서 띄우고, 가장 많이 말하는 사람 쪽으로 향하게 하는 것입니다.
강의나 발표라면, 방에 PA 시스템이나 공식 녹음이 있을 경우 그쪽 신호가 자리에서 담을 수 있는 어떤 것보다 낫습니다.
3. 언어를 직접 지정하기 #
자동 언어 감지는 파일의 앞부분을 표본으로 삼습니다. 처음 30초가 방 소음이거나, 음악이거나, 녹음의 나머지와 다른 언어를 쓰는 사람이라면, 감지가 엉뚱한 언어로 정해지고 파일 전체에 걸쳐 계속 틀릴 수 있습니다.
증상은 분명하면서도 당황스럽습니다. 아무도 말하지 않은 언어로 된 텍스트, 또는 그런 구간이 섞여 나옵니다. 언어를 알고 있다면 도구의 추측에 맡기지 말고 지정하세요. Offline Transcription에서는 파일의 텍스트 변환 버튼을 길게 눌러 언어를 고를 수 있는데, 서로 다른 언어의 녹음이 여러 개 있을 때 특히 유용합니다.
4. 과도하게 압축해서 녹음하지 않기 #
대략 64 kbps 아래에서는 손실 압축이 비슷한 자음을 구분해 주는 고주파 세부를 없앱니다. "fifteen"과 "fifty"를 가르는 차이가 바로 그 대역에 있습니다. 인코더가 버린 정보는 어떤 텍스트 변환 도구도 되살릴 수 없습니다.
무압축으로 녹음하거나 일반적인 비트레이트를 쓰세요. 낮은 비트레이트의 파일을 건네받았다면 그것이 정확도의 상한이고, 어떤 설정으로도 바뀌지 않습니다.
5. 무음 구간 잘라내기 #
말소리가 없는 긴 구간은 중립적이지 않습니다. Whisper는 주어진 것이 무엇이든 텍스트를 생성하므로, 무음이 주어지면 같은 말을 반복하고, 때로는 몇 페이지씩 이어집니다.
음성 활동 감지는 무음 부분을 아예 모델에 보여 주지 않는 방식으로 이 문제를 제대로 해결합니다. 그것이 안 된다면 텍스트로 변환하기 전에 녹음을 잘라 두세요.
6. 그다음에야, 어쩌면, 더 큰 모델 #
이것이 목록의 마지막인 데는 이유가 있습니다.
모델 크기는 정확도를 실제로 높여 주고 그 향상은 진짜지만, 사람들의 기대보다는 작습니다. 그러면서 시간과 디스크를 많이 씁니다. 더 중요한 것은, 큰 모델이 위의 어떤 문제도 해결하지 못한다는 점입니다. 멀리서 담긴, 시끄럽고, 과하게 압축된 녹음을 조금 더 낫게 변환할 뿐, 여전히 나쁩니다.
솔직하게 말하면 모델 크기는 오디오 품질에 곱해지는 계수입니다. 나쁜 오디오에 곱하면 조금 덜 나쁜 결과가 나옵니다. 모델 고르기 가이드에서 이 절충을 다룹니다.
전혀 도움이 되지 않는 것 #
같은 파일을 다시 돌리기. 샘플링이 완전히 결정적이지는 않아서 오류가 조금 달라질 수는 있습니다. 그것은 향상이 아니라 편차입니다.
볼륨 키우기. 조용한 녹음을 증폭하면 방 소음도 똑같이 증폭됩니다. 정작 중요한 비율은 그대로입니다.
노이즈 제거, 대개는. 강한 잡음 제거는 잡음만큼이나 모델을 혼란스럽게 하는 인공적인 소리를 만듭니다. 저주파 울림을 없애는 완만한 하이패스 필터는 조금 도움이 될 수 있습니다. 무거운 처리는 대개 해가 됩니다.
분당 요금을 더 내기. 클라우드 서비스도 같은 계열의 모델을 돌립니다. 가격은 정확도가 아닙니다.
좋은 결과란 어떤 것인가 #
모든 것을 제대로 해도 자동 텍스트 변환은 완벽하지 않고, 어떤 도구도 완벽하게 만들어 주지 않습니다. 다음은 일정 비율로 계속 틀린다고 보면 됩니다. 낯선 고유명사, 전문 용어, 빠르게 말한 숫자, 그리고 두 사람이 겹쳐 말하는 순간입니다.
그래서 정확도만큼이나 작업 방식이 중요합니다. 타임스탬프가 있는 구간 보기를 써서 의심스러운 줄 뒤의 오디오를 바로 재생하고, 실제로 근거로 삼을 부분을 확인하세요. 인터뷰 가이드에 그 빠른 방법이 나와 있습니다.
요약 #
마이크를 더 가까이 두세요. 녹음기를 탁자에서 띄우고 화자 쪽으로 향하게 하세요. 감지를 믿는 대신 언어를 직접 지정하세요. 낮은 비트레이트로 녹음하지 마세요. 무음을 잘라내거나 감지하게 하세요. 모델 크기는 그 뒤에 생각할 문제이고, 여섯 가지 중 지렛대가 가장 작습니다.
Offline Transcription 받기
오디오와 영상을 온전히 내 Mac에서 텍스트로 변환합니다. 업로드되는 것이 없고, 계정도 없으며, 분당 요금도 없습니다.