가이드

정확히 인용해야 하는 인터뷰를 텍스트로 변환하는 법

자동 텍스트 변환은 이제 작업의 바탕으로 삼을 만큼 좋아졌지만, 확인 없이 인용할 만큼 좋지는 않습니다. 그 차이를 메우는 확인 작업은 몇 시간이 아니라 몇 분이면 됩니다.

자동 텍스트 변환은 인터뷰 작업을 특정한 방식으로 바꿔 놓았습니다. 인용을 확인할 필요를 없앤 것이 아닙니다. 인용할 대목을 찾으려고 90분짜리 대화를 통째로 타이핑할 필요를 없앴습니다.

큰 변화이고, 확인 단계를 유지할 때만 성립합니다. 아래는 변환된 텍스트를 완성된 문서가 아니라 오디오의 검색 가능한 색인으로 보는 작업 방법입니다.

녹음하기 전에 #

여기서 내리는 두 가지 결정이 이후에 하는 어떤 일보다 시간을 아껴 줍니다.

녹음기를 나 말고 상대방 가까이에 두세요. 쓸 수 없는 텍스트가 나오는 가장 흔한 원인은 두 사람 사이 카페 탁자 위에 납작하게 놓인 휴대폰이 에스프레소 머신 소리를 인터뷰 대상의 목소리와 같은 크기로 담는 것입니다. 무언가에 기대어 세워 두고 상대방 쪽을 향하게 한, 1미터쯤 떨어진 휴대폰이 훨씬 낫습니다. 외장 마이크는 더 낫지만 꼭 필요한 경우는 드뭅니다.

시작할 때 누가 누구인지 소리 내어 말하세요. "30일이고, 시험 결과에 대해 첸 박사와 이야기합니다." 10초면 되고, 검색할 수 있는 머리말로 텍스트에 남습니다. 인터뷰를 많이 녹음한다면, 이것이 New Recording 47 같은 이름의 파일 폴더와 제대로 된 아카이브를 가르는 차이입니다.

텍스트로 변환하기 #

방법 자체는 단순합니다. 의식적으로 결정할 가치가 있는 것은 오디오가 어디로 가느냐입니다.

대부분의 텍스트 변환 서비스는 녹음을 서버에 업로드합니다. 인터뷰에서는 이것이 철학적 질문이 아니라 실제적인 질문입니다.

  • 취재원에게 비밀 유지를 약속했다면, 녹음을 제3자에게 보내는 일은 질문받았을 때 정확히 설명할 수 있어야 하는 사안입니다.
  • 대상자가 NDA, 의료 정보 보호, 연구윤리 승인의 적용을 받는 내용을 이야기한다면, "30일간 보관하는 미국 서비스에 업로드했습니다"라는 사실이 여러분이 동의한 조건을 위반할 수 있습니다.
  • 신호가 없는 현장에 있다면 업로드 기반 도구는 아예 동작하지 않습니다.

로컬 텍스트 변환은 이 모두를 비켜 갑니다. 파일은 디스크에서 읽히고, 내 컴퓨터에서 변환되며, 어디로도 전송되지 않습니다. 저희 말을 포함해 누구의 말도 그대로 믿지 않고 직접 확인하고 싶다면, 직접 시험해 보는 세 가지 방법을 정리해 두었습니다.

Offline Transcription에서는 녹음을 끌어다 놓고, 영어가 아니라면 언어를 지정한 뒤 변환하면 됩니다. 90분짜리 인터뷰는 Apple Silicon에서 몇 분이면 끝납니다.

확인 작업 #

여기가 중요한 부분이고, 사람들이 건너뛰는 부분입니다.

변환된 텍스트를 교정하는 것이 아닙니다. 실제로 발행할 문장들과, 오류가 몰리기 쉬운 것으로 알려진 자리를 검증하는 것입니다.

쓰려는 인용은 하나도 빠짐없이 오디오와 대조하세요. 그 주변 문단이 아니라 따옴표 안의 단어들을 확인해야 합니다. 누군가의 이름과 함께 인쇄되는 인용이라면 타협의 여지가 없습니다.

다음 네 가지는 전체에서 확인하세요.

  1. 이름과 기관명. Whisper는 낯선 성을 그와 비슷하게 들리는 흔한 단어로 자신 있게 바꿔 놓습니다. 확신이 없다는 신호도 전혀 주지 않습니다.
  2. 숫자. "fifteen"과 "fifty"는 음소 하나 차이이자 사실관계 오류 하나 차이입니다. 빠른 말에서는 "million"과 "billion"도 마찬가지입니다.
  3. 부정문. "우리는 그것을 고려하지 않았다"와 "우리는 그것을 고려했다"는 말할 때 삼켜지기 쉬운 짧은 단어 하나로 갈립니다. 소송으로 이어지는 오류가 바로 이것입니다.
  4. 말 겹침. 두 사람이 동시에 말하는 곳에서는 텍스트가 둘을 뒤섞고, 한 문장이 통째로 엉뚱한 사람에게 귀속될 수 있습니다.

이 작업을 빠르게 만드는 요령: 모든 줄에 각자의 타임스탬프가 붙은 구간 보기에서 작업하고, 파형을 훑는 대신 그 줄만 오디오로 재생하세요. 그러면 인용 열두 개를 확인하는 데 90분을 열두 번 뒤지는 대신 클릭 열두 번이면 됩니다. 저희 앱의 구간 보기가 정확히 이 일을 합니다. 줄을 선택하고 재생을 누르면 그 줄만 들립니다.

화자 표시 #

Whisper를 기반으로 한 것 중 화자 식별을 안정적으로 해내는 것은 없습니다. 그 기능을 제공하는 도구는 별도의 화자 분리 모델을 돌리는 것이고, 결과는 조용한 방의 두 사람에게는 쓸 만하고 활기찬 방의 네 사람에게는 좋지 않습니다.

두 사람이 하는 일반적인 인터뷰라면, 쓰는 시점에 직접 고치는 것이 현실적입니다. 어느 목소리가 자기 것인지 알고 있고, 인용을 뽑을 때쯤이면 어차피 그 대목을 듣고 있을 테니까요. 자동 표시가 정확하다는 전제 위에 작업 방식을 세우지 마세요.

나중에도 쓸모 있게 남기기 #

습관 두 가지이고, 둘 다 비용이 거의 없습니다.

텍스트만이 아니라 타임스탬프와 함께 내보내세요. 글을 쓸 때 보는 것은 일반 텍스트지만, 여섯 달 뒤 사실 확인 요청이 돌아왔을 때 그 순간을 다시 찾게 해 주는 것은 타임스탬프가 있는 내보내기입니다. 스프레드시트에서 정렬하거나 걸러 내고 싶다면 CSV가 좋습니다.

오디오를 보관하세요. 변환된 텍스트는 파생물입니다. 인용이 다투어질 때 증거가 되는 것은 녹음이지 텍스트가 아닙니다.

요약 #

인터뷰 대상 가까이에서 녹음하고, 시작할 때 소리 내어 상황을 밝히세요. 로컬에서 변환해 녹음이 계속 내 것으로 남고 신호 없이도 동작하게 하세요. 그런 다음 발행하려는 인용은 모두 오디오와 대조하고, 이름과 숫자와 부정문과 말 겹침은 전체에서 확인하세요. 줄 단위 재생이 되는 구간 보기를 쓰면 확인이 몇 분이면 끝납니다.

변환된 텍스트는 무슨 말이 오갔는지 빠르게 찾는 색인입니다. 인용은 여전히 녹음에서 나옵니다.

Offline Transcription 받기

오디오와 영상을 온전히 내 Mac에서 텍스트로 변환합니다. 업로드되는 것이 없고, 계정도 없으며, 분당 요금도 없습니다.

macOS 13.0 or higher · iOS 16.4 or higher