Hướng dẫn
Vì sao việc chép lời chậm trên chiếc Mac của bạn
Cùng một bản ghi có thể mất hai phút hoặc bốn mươi phút trên những chiếc Mac khác nhau chạy cùng một ứng dụng. Bốn thứ giải thích gần như toàn bộ khác biệt đó.
Tốc độ chép lời ngay trên máy chênh lệch cực kỳ lớn, và không tỉ lệ với việc chiếc Mac của bạn mới đến đâu hay bạn đã trả bao nhiêu tiền cho nó. Cùng một bản ghi dài một tiếng có thể mất ba phút trên máy này và nửa tiếng trên máy khác, với cùng một ứng dụng.
Bốn thứ chiếm gần như toàn bộ khác biệt đó.
1. Apple Silicon so với Intel #
Đây là yếu tố lớn nhất, và nó không phải một khác biệt nhỏ.
Việc chép lời chủ yếu là phép toán ma trận. Apple Silicon có hai thứ hợp với việc đó một cách rất cụ thể: một Neural Engine được làm ra đúng cho loại phép toán này, và bộ nhớ hợp nhất, nên trọng số của mô hình không phải chép qua chép lại giữa bộ nhớ CPU và bộ nhớ GPU.
Máy Mac chạy Intel không có thứ nào trong hai thứ đó. Nó hoàn toàn không có Neural Engine, nên bộ mã hóa — nửa tốn kém của mô hình — phải quay về chạy trên CPU hoặc trên một GPU rời qua đường bus. Kết quả thường là chậm hơn vài lần trên cùng một tệp.
Nếu bạn đang dùng máy Mac Intel, việc chép lời vẫn hoàn toàn dùng được; chỉ là bạn khởi động nó rồi quay lại sau, chứ không ngồi nhìn. Không phần mềm nào khép được khoảng cách đó, vì khoảng cách đó nằm ở một miếng silicon.
2. Ứng dụng có dùng Neural Engine hay không #
Hai ứng dụng trên cùng một chiếc Mac dòng M có thể chênh nhau nhiều lần, vì việc dùng Neural Engine không tự động diễn ra.
Mô hình phải được biên dịch sẵn sang định dạng của Core ML thì bộ mã hóa mới chạy được ở đó. Những ứng dụng đóng gói sẵn một bộ mã hóa Core ML cùng với trọng số sẽ đi vào đường nhanh; những ứng dụng không làm vậy sẽ chạy mọi thứ trên GPU hoặc CPU và bỏ phí rất nhiều hiệu năng.
Bạn không nhìn thấy điều này từ bên ngoài, nhưng bạn cảm nhận được: nếu một ứng dụng chép lời chạy trên máy nhanh hơn hẳn một ứng dụng khác trên chính máy của bạn, đây thường là lý do.
3. Kích thước mô hình #
Các kích thước của Whisper chênh nhau khoảng 3× số tham số ở mỗi bậc, và thời gian tăng theo đó. Đi từ Base lên Large là khoảng hai mươi lần số tham số — với một tệp dài, đó là khác biệt giữa một tách cà phê và cả một buổi chiều.
Nếu một ứng dụng mặc định chọn mô hình lớn, hoặc bạn đã chọn một mô hình như vậy vì nghe có vẻ lớn thì tốt hơn, thì chỉ riêng điều đó đã đủ giải thích thời gian chờ. Phần độ chính xác tăng thêm nhỏ hơn nhiều so với những gì khác biệt kích thước gợi ý, và với tiếng nói sạch thì thường không nhận ra được.
4. Bạn đang trả tiền để chép lời bao nhiêu phần im lặng #
Một bản ghi hai tiếng cho một cuộc họp chín mươi phút chứa ba mươi phút chẳng có gì. Không có phát hiện hoạt động giọng nói, mô hình xử lý toàn bộ chỗ đó — giải mã sự im lặng với đúng cái giá của việc giải mã tiếng nói, và trong lúc đó sinh ra văn bản rác lặp đi lặp lại.
Những ứng dụng chạy VAD trước sẽ bỏ qua hẳn các đoạn đó. Với những bản ghi có nhiều khoảng lặng, đây không phải khoản tiết kiệm bên lề.
Điều gì thật sự làm nó nhanh hơn #
Xếp theo mức độ hiệu quả:
- Dùng mô hình nhỏ hơn. Base là đủ cho phần lớn tiếng nói sạch, và nó nhanh hơn Large nhiều lần.
- Dùng ứng dụng có bộ mã hóa Core ML nếu bạn đang dùng Apple Silicon.
- Cắt bớt khoảng lặng, hoặc dùng công cụ phát hiện tiếng nói trước.
- Đóng những gì đang tranh giành tài nguyên. Việc chép lời sẽ dùng mọi nhân mà nó lấy được. Một tác vụ xuất video chạy nền sẽ làm thông lượng của bạn giảm một nửa.
- Cắm sạc máy. Khi chạy pin, macOS bóp hiệu năng với các tác vụ kéo dài; Chế độ nguồn điện thấp còn bóp mạnh hơn.
Điều gì không làm nó nhanh hơn #
Thêm RAM, trừ khi bạn đang bị tráo trang bộ nhớ — phần bộ nhớ thật sự cần nhỏ hơn mọi người vẫn tưởng.
Internet nhanh hơn. Không có bước mạng nào trong việc chép lời ngay trên máy. Nếu tốc độ của bạn phụ thuộc vào đường truyền, thì công việc không diễn ra trên máy của bạn.
Khởi động lại. Nếu một lượt chạy chậm, khởi động lại chỉ bắt đầu đúng công việc đó từ con số không.
Một mức kỳ vọng đại khái #
Trên máy Mac Apple Silicon với mô hình Base và bộ mã hóa Core ML, việc chép lời chạy nhanh hơn thời gian thực vài lần — một bản ghi dài một tiếng xong trong vài phút. Phép đo của chính chúng tôi trên một tệp hai tiếng là dưới ba phút, tính từ đầu đến cuối.
Trên máy Mac Intel, hãy chuẩn bị tinh thần rằng nó sẽ mất một phần đáng kể so với độ dài bản ghi. Vẫn đáng làm, vẫn miễn phí, chỉ là không phải thứ để ngồi nhìn.
Nếu bạn ở rất xa những khoảng đó trên Apple Silicon, các nguyên nhân có khả năng nhất, theo thứ tự, là: một mô hình lớn, một ứng dụng không dùng Neural Engine, hoặc rất nhiều việc khác đang tranh giành cỗ máy.
Tóm lại #
Apple Silicon so với Intel là yếu tố lớn nhất và bạn không sửa được nó bằng phần mềm. Sau đó: dùng mô hình nhỏ hơn, dùng ứng dụng biên dịch bộ mã hóa cho Neural Engine, bỏ qua im lặng thay vì chép lời nó, và đừng chạy nó song song với một tác vụ xuất video khi đang dùng pin.
Tải Offline Transcription
Chuyển âm thanh và video thành văn bản hoàn toàn trên chính chiếc Mac của bạn. Không có gì được tải lên, không cần tài khoản, không tính phí theo phút.