가이드
정확히 인용해야 하는 인터뷰를 텍스트로 변환하는 법
자동 텍스트 변환은 이제 작업의 바탕으로 삼을 만큼 좋아졌지만, 확인 없이 인용할 만큼 좋지는 않습니다. 그 차이를 메우는 확인 작업은 몇 시간이 아니라 몇 분이면 됩니다.
자동 텍스트 변환은 인터뷰 작업을 특정한 방식으로 바꿔 놓았습니다. 인용을 확인할 필요를 없앤 것이 아닙니다. 인용할 대목을 찾으려고 90분짜리 대화를 통째로 타이핑할 필요를 없앴습니다.
큰 변화이고, 확인 단계를 유지할 때만 성립합니다. 아래는 변환된 텍스트를 완성된 문서가 아니라 오디오의 검색 가능한 색인으로 보는 작업 방법입니다.
녹음하기 전에 #
여기서 내리는 두 가지 결정이 이후에 하는 어떤 일보다 시간을 아껴 줍니다.
녹음기를 나 말고 상대방 가까이에 두세요. 쓸 수 없는 텍스트가 나오는 가장 흔한 원인은 두 사람 사이 카페 탁자 위에 납작하게 놓인 휴대폰이 에스프레소 머신 소리를 인터뷰 대상의 목소리와 같은 크기로 담는 것입니다. 무언가에 기대어 세워 두고 상대방 쪽을 향하게 한, 1미터쯤 떨어진 휴대폰이 훨씬 낫습니다. 외장 마이크는 더 낫지만 꼭 필요한 경우는 드뭅니다.
시작할 때 누가 누구인지 소리 내어 말하세요. "30일이고, 시험 결과에 대해 첸 박사와 이야기합니다." 10초면 되고, 검색할 수 있는 머리말로 텍스트에 남습니다. 인터뷰를 많이 녹음한다면, 이것이 New Recording 47 같은 이름의 파일 폴더와 제대로 된 아카이브를 가르는 차이입니다.
텍스트로 변환하기 #
방법 자체는 단순합니다. 의식적으로 결정할 가치가 있는 것은 오디오가 어디로 가느냐입니다.
대부분의 텍스트 변환 서비스는 녹음을 서버에 업로드합니다. 인터뷰에서는 이것이 철학적 질문이 아니라 실제적인 질문입니다.
- 취재원에게 비밀 유지를 약속했다면, 녹음을 제3자에게 보내는 일은 질문받았을 때 정확히 설명할 수 있어야 하는 사안입니다.
- 대상자가 NDA, 의료 정보 보호, 연구윤리 승인의 적용을 받는 내용을 이야기한다면, "30일간 보관하는 미국 서비스에 업로드했습니다"라는 사실이 여러분이 동의한 조건을 위반할 수 있습니다.
- 신호가 없는 현장에 있다면 업로드 기반 도구는 아예 동작하지 않습니다.
로컬 텍스트 변환은 이 모두를 비켜 갑니다. 파일은 디스크에서 읽히고, 내 컴퓨터에서 변환되며, 어디로도 전송되지 않습니다. 저희 말을 포함해 누구의 말도 그대로 믿지 않고 직접 확인하고 싶다면, 직접 시험해 보는 세 가지 방법을 정리해 두었습니다.
Offline Transcription에서는 녹음을 끌어다 놓고, 영어가 아니라면 언어를 지정한 뒤 변환하면 됩니다. 90분짜리 인터뷰는 Apple Silicon에서 몇 분이면 끝납니다.
확인 작업 #
여기가 중요한 부분이고, 사람들이 건너뛰는 부분입니다.
변환된 텍스트를 교정하는 것이 아닙니다. 실제로 발행할 문장들과, 오류가 몰리기 쉬운 것으로 알려진 자리를 검증하는 것입니다.
쓰려는 인용은 하나도 빠짐없이 오디오와 대조하세요. 그 주변 문단이 아니라 따옴표 안의 단어들을 확인해야 합니다. 누군가의 이름과 함께 인쇄되는 인용이라면 타협의 여지가 없습니다.
다음 네 가지는 전체에서 확인하세요.
- 이름과 기관명. Whisper는 낯선 성을 그와 비슷하게 들리는 흔한 단어로 자신 있게 바꿔 놓습니다. 확신이 없다는 신호도 전혀 주지 않습니다.
- 숫자. "fifteen"과 "fifty"는 음소 하나 차이이자 사실관계 오류 하나 차이입니다. 빠른 말에서는 "million"과 "billion"도 마찬가지입니다.
- 부정문. "우리는 그것을 고려하지 않았다"와 "우리는 그것을 고려했다"는 말할 때 삼켜지기 쉬운 짧은 단어 하나로 갈립니다. 소송으로 이어지는 오류가 바로 이것입니다.
- 말 겹침. 두 사람이 동시에 말하는 곳에서는 텍스트가 둘을 뒤섞고, 한 문장이 통째로 엉뚱한 사람에게 귀속될 수 있습니다.
이 작업을 빠르게 만드는 요령: 모든 줄에 각자의 타임스탬프가 붙은 구간 보기에서 작업하고, 파형을 훑는 대신 그 줄만 오디오로 재생하세요. 그러면 인용 열두 개를 확인하는 데 90분을 열두 번 뒤지는 대신 클릭 열두 번이면 됩니다. 저희 앱의 구간 보기가 정확히 이 일을 합니다. 줄을 선택하고 재생을 누르면 그 줄만 들립니다.
화자 표시 #
Whisper를 기반으로 한 것 중 화자 식별을 안정적으로 해내는 것은 없습니다. 그 기능을 제공하는 도구는 별도의 화자 분리 모델을 돌리는 것이고, 결과는 조용한 방의 두 사람에게는 쓸 만하고 활기찬 방의 네 사람에게는 좋지 않습니다.
두 사람이 하는 일반적인 인터뷰라면, 쓰는 시점에 직접 고치는 것이 현실적입니다. 어느 목소리가 자기 것인지 알고 있고, 인용을 뽑을 때쯤이면 어차피 그 대목을 듣고 있을 테니까요. 자동 표시가 정확하다는 전제 위에 작업 방식을 세우지 마세요.
나중에도 쓸모 있게 남기기 #
습관 두 가지이고, 둘 다 비용이 거의 없습니다.
텍스트만이 아니라 타임스탬프와 함께 내보내세요. 글을 쓸 때 보는 것은 일반 텍스트지만, 여섯 달 뒤 사실 확인 요청이 돌아왔을 때 그 순간을 다시 찾게 해 주는 것은 타임스탬프가 있는 내보내기입니다. 스프레드시트에서 정렬하거나 걸러 내고 싶다면 CSV가 좋습니다.
오디오를 보관하세요. 변환된 텍스트는 파생물입니다. 인용이 다투어질 때 증거가 되는 것은 녹음이지 텍스트가 아닙니다.
요약 #
인터뷰 대상 가까이에서 녹음하고, 시작할 때 소리 내어 상황을 밝히세요. 로컬에서 변환해 녹음이 계속 내 것으로 남고 신호 없이도 동작하게 하세요. 그런 다음 발행하려는 인용은 모두 오디오와 대조하고, 이름과 숫자와 부정문과 말 겹침은 전체에서 확인하세요. 줄 단위 재생이 되는 구간 보기를 쓰면 확인이 몇 분이면 끝납니다.
변환된 텍스트는 무슨 말이 오갔는지 빠르게 찾는 색인입니다. 인용은 여전히 녹음에서 나옵니다.
Offline Transcription 받기
오디오와 영상을 온전히 내 Mac에서 텍스트로 변환합니다. 업로드되는 것이 없고, 계정도 없으며, 분당 요금도 없습니다.