Hướng dẫn
Cách xử lý một bản ghi có nhiều người nói
Nhãn người nói tự động là tính năng bị thổi phồng nhiều nhất trong lĩnh vực chép lời. Đây là những gì công nghệ này thật sự làm được, và cách vẫn có được bản chép lời nhiều người nói chính xác.
"Nhận dạng người nói tự động" xuất hiện trong danh sách tính năng của hầu hết sản phẩm chép lời. Đó là công nghệ có thật, đôi khi thật sự hữu ích, và kém tin cậy hơn nhiều so với những gì quảng cáo ám chỉ.
Nếu bạn đang chép lời một cuộc họp, một buổi tọa đàm hay một cuộc phỏng vấn nhóm, bạn nên biết mình thật sự nhận được gì.
Phân tách người nói làm gì #
Phân tách người nói là một bước tách biệt với việc chép lời. Thay vì nhận ra từ ngữ, nó gom cụm phần âm thanh theo đặc trưng giọng — cao độ, âm sắc, nhịp điệu — rồi quyết định "đoạn này nghe giống cùng một người với đoạn kia". Sau đó nó gán nhãn cho các cụm là Người nói 1, Người nói 2, và cứ thế.
Từ mô tả đó suy ra hai điều, và chúng giải thích gần như mọi lời phàn nàn về tính năng này.
Nó không biết ai là ai. Nó tạo ra "Người nói 1", không phải "Tiến sĩ Chen". Gán tên luôn là một bước do con người làm; công cụ hiển thị tên thật thì hoặc là đang dùng siêu dữ liệu từ một nền tảng biết ai đang bật mic, hoặc là bạn đã tự nhập tên.
Nó dựa trên độ giống nhau của giọng, không phải ý nghĩa. Hai người có giọng giống nhau sẽ nhập thành một nhãn. Một người có giọng thay đổi — ngả người ra xa micro, nói hăng lên, tham gia qua điện thoại — sẽ bị tách thành hai.
Khi nào nó chạy được, khi nào không #
Tương đối đáng tin: hai người, giọng khác biệt, mỗi người một micro hoặc chung một micro ở gần, nói luân phiên mà ít chồng lời. Một podcast hai người được ghi đúng cách là gần với trường hợp tốt nhất.
Thiếu tin cậy: từ bốn người trở lên. Một phòng họp với một thiết bị ghi đặt ở giữa. Bất cứ ai dùng loa ngoài. Những giọng giống nhau — đây là kiểu hỏng có thật và khó xử, và nó ảnh hưởng nhiều hơn tới các nhóm người cùng giới và tuổi tác tương đương, tức là phần lớn các cuộc họp.
Về cơ bản là vô vọng: nói chồng lời. Khi hai người nói cùng lúc, phần âm thanh chứa cả hai, và việc gom cụm buộc phải chọn một. Đây chính là chỗ bản chép lời bị gán nhầm người — và cũng đúng là khoảnh khắc trong một cuộc tranh luận hay đàm phán mà bạn muốn chính xác nhất.
Kiểu hỏng đáng lo #
Một lỗi trong việc chép lời thường rất dễ thấy. Bạn đọc một câu vô nghĩa rồi đi kiểm tra lại.
Một lỗi trong việc gán người nói thì vô hình. Câu văn vẫn đúng, vẫn chỉnh chu, và được gán cho nhầm người. Chẳng có gì ở đó trông có vẻ sai. Nếu bạn dựng một câu trích dẫn, một biên bản họp hay một ghi chú pháp lý trên đó, sai lầm sẽ lan đi trong im lặng.
Chính sự bất đối xứng đó là lý do tôi sẽ không xây một quy trình phụ thuộc vào việc nhãn tự động phải đúng.
Nên làm gì thay vào đó #
Nếu nền tảng đã biết ai đang nói, hãy dùng thứ đó #
Đây là trường hợp duy nhất có câu trả lời thật sự tốt hơn. Zoom, Teams và Google Meet biết ai đang bật mic, nên bản chép lời của chính chúng có thể gán nhãn người nói từ siêu dữ liệu thay vì đoán từ âm thanh. Nếu việc gán đúng người là ưu tiên và cuộc họp đã được ghi trên đám mây với gói có kèm chép lời, đó là nguồn đáng tin cậy nhất hiện có. Hướng dẫn về bản ghi cuộc họp của chúng tôi nói về những đánh đổi ở đây.
Ghi âm sao cho vấn đề nhỏ đi #
- Mỗi người một micro nếu bản ghi thật sự quan trọng. Các track riêng khiến việc gán người trở nên đơn giản và loại bỏ hoàn toàn nhu cầu phân tách người nói.
- Một cuộc trao đổi bàn tròn nơi mọi người được đề nghị không nói chồng lời cho ra bản chép lời tốt hơn hẳn so với khi họ nói chồng. Nói điều này ở đầu một cuộc họp có ghi âm là chuyện bình thường và có lợi cho tất cả mọi người.
- Đề nghị mọi người tự giới thiệu ở lần đầu họ phát biểu — "Priya đây" — điều đó cho bạn một điểm neo trong bản chép lời.
Tự gán nhãn, ngay tại thời điểm sử dụng #
Với phần lớn công việc, bạn không cần gán nhãn cho cả bản chép lời. Bạn cần sáu đoạn mà bạn sẽ trích dẫn hoặc hành động dựa trên đó được gán nhãn đúng.
Cách thực tế: làm việc ở chế độ xem theo đoạn có dấu thời gian, tìm những đoạn quan trọng, phát âm thanh cho những dòng đó, và ghi tên vào khi bạn xác nhận được. Dù sao bạn cũng đang nghe những khoảnh khắc ấy để kiểm tra câu chữ. Gán nhãn chúng chẳng tốn thêm gì và là cách duy nhất thật sự chính xác.
Dùng cấu trúc thay vì nhãn #
Với rất nhiều công việc liên quan đến họp hành, một bản chép lời có dấu thời gian mà không có nhãn người nói vẫn dùng tốt — bạn đang tìm các quyết định và đầu việc, chứ không dựng một kịch bản sân khấu. Đừng bỏ cả buổi chiều sửa những cái nhãn mà bạn chưa bao giờ cần.
Quan điểm của chúng tôi #
Offline Transcription không có nhận dạng người nói tự động. Nói thẳng lý do: họ mô hình Whisper không làm phân tách người nói, thêm tính năng đó nghĩa là thêm một mô hình thứ hai với những đặc tính tin cậy như đã mô tả ở trên, và việc xuất ra những cái nhãn sai theo cách vô hình còn tệ hơn cho loại công việc mà người dùng của chúng tôi làm so với việc không có nhãn nào cả.
Thứ ứng dụng có cung cấp là quy trình giúp việc gán nhãn thủ công diễn ra nhanh: mỗi đoạn đều mang dấu thời gian của nó, và bạn có thể phát âm thanh phía sau bất kỳ dòng nào để xác nhận ai đã nói trước khi ghi tên vào cạnh đó.
Nếu nhãn tự động là yêu cầu bắt buộc với bạn, đó là lý do chính đáng để dùng công cụ khác, và tôi thà nói thẳng như vậy còn hơn giả vờ ngược lại.
Tóm lại #
Phân tách người nói gom cụm giọng nói; nó không biết con người. Nó tạm ổn với hai người có giọng khác biệt và thiếu tin cậy với nhóm đông, giọng giống nhau và những chỗ nói chồng lời — và lỗi của nó vô hình theo cách mà lỗi chép lời thì không. Hãy ghi thành các track riêng nếu chuyện đó quan trọng, dùng siêu dữ liệu của nền tảng nếu bạn có, còn không thì hãy gán nhãn cho một nhúm đoạn mà bạn thật sự dùng, bằng tai, ngay tại thời điểm sử dụng.
Tải Offline Transcription
Chuyển âm thanh và video thành văn bản hoàn toàn trên chính chiếc Mac của bạn. Không có gì được tải lên, không cần tài khoản, không tính phí theo phút.