Bài viết
Làm sạch và chuẩn bị âm thanh cho podcast
Một bản ghi giọng thô thường cần ba thứ trước khi sẵn sàng đăng: một mức độ to nhất quán, một định dạng và bitrate mà các nền tảng phát trực tuyến mong đợi, và một đánh giá trung thực về điều mà việc khử nhiễu thực sự làm được. Bài viết này nói về các bước đó bằng audio-volume, vocal-remover và audio-converter, tất cả chạy cục bộ trong trình duyệt.
Độ to so với đỉnh: vì sao LUFS quan trọng hơn mức đỉnh
Mức đỉnh đo mẫu to nhất duy nhất trong một tệp âm thanh. Độ to, biểu thị bằng LUFS (Loudness Units relative to Full Scale), đo năng lượng cảm nhận theo thời gian. Một podcast ghi ở đỉnh -3 dBFS vẫn có thể nghe nhỏ nếu phần lớn tín hiệu nằm thấp hơn nhiều. Các nền tảng phát trực tuyến và thư mục podcast chuẩn hóa âm thanh về một độ to mục tiêu khi phát, thường -14 LUFS cho dịch vụ nhạc và -16 LUFS cho lời nói, nên nộp ở một mức rất khác nghĩa là nền tảng sẽ tăng hoặc giảm âm thanh của bạn dù sao đi nữa. Nhắm tới độ to tích hợp -16 LUFS cho bạn một tệp hoàn chỉnh khớp mặc định của nền tảng, nhất quán với các chương trình khác, và chừa một chút khoảng trống trước trần số ở 0 dBFS. Đỉnh thực, vốn tính cả các vượt mức giữa các mẫu, thường được giữ dưới -1 dBTP. Nhắm hai con số này cùng nhau cho kết quả sạch hơn so với chỉ đuổi theo một mục tiêu đỉnh.

Gain và chuẩn hóa với audio-volume
audio-volume cho bạn điều chỉnh gain của một tệp bằng decibel hoặc áp chuẩn hóa độ to. Nếu một bản ghi liên tục nhỏ, thêm gain bằng dB nâng toàn bộ tín hiệu lên một lượng cố định. Rủi ro là clipping: nếu một đỉnh nào đó đã sát 0 dBFS, một độ lệch gain dương sẽ đẩy nó vượt qua, đưa vào méo số. Hãy kiểm tra dạng sóng trước khi áp gain, và giữ đỉnh thực dưới -1 dBFS sau điều chỉnh. Chuẩn hóa độ to dùng một cách tiếp cận khác. Công cụ chạy bộ lọc loudnorm của FFmpeg ở mục tiêu mặc định -24 LUFS độ to tích hợp, thay vì các mục tiêu to hơn mà một số nền tảng podcast khuyến nghị. Loudnorm một-lượt là một quá trình động, không phải một độ lệch gain phẳng: nó theo dõi độ to theo thời gian và điều chỉnh tín hiệu để hội tụ về mục tiêu, điều này có thể hoạt động hơi giống nén dải động nhẹ trên một bản ghi không nhất quán. Với một bản ghi giọng có biến động mức lớn giữa các câu, một compressor hoặc limiter chuyên dụng áp trước chuẩn hóa vẫn cho kết quả được kiểm soát hơn, nhưng các bước đó nằm ngoài điều audio-volume xử lý.
Khử kênh trung tâm làm được và không làm được gì
vocal-remover áp một kỹ thuật khử kênh trung tâm. Trong một tệp stereo, một tín hiệu xuất hiện giống hệt ở cả kênh trái và phải ở cùng mức và pha được gọi là pan trung tâm. Trừ kênh phải khỏi kênh trái loại bỏ bất cứ thứ gì nằm ở vị trí trung tâm đó, để lại chủ yếu nội dung pan ra hai bên. Đây là điều tạo ra hiệu ứng karaoke trên một bản nhạc được master thương mại nơi giọng chính thường pan trung tâm. Nó không phát hiện hay tách giọng bằng bất kỳ mô hình lời nói nào. Nó không loại bỏ tiếng ồn nền, vọng phòng, tiếng ù điều hòa, hay tiếng giao thông. Nó không tách giọng podcast của bạn khỏi âm xung quanh trong một bản ghi đơn kênh hoặc mono, nơi không có khác biệt pha để khai thác. Kết quả cũng làm suy giảm bề rộng stereo của nội dung được giữ lại. Với một bản ghi podcast thực hiện trong một phòng ồn, khử kênh trung tâm là công cụ sai. Xử lý âm học, một micro định hướng, hoặc một gate plugin trong một trình biên tập âm thanh chuyên dụng là các lựa chọn thực tế cho tiếng ồn nền.

Xuất để phân phối: định dạng, bitrate và mono so với stereo
Hầu hết thư mục podcast chấp nhận MP3 và AAC. MP3 là lựa chọn tương thích nhất; mọi trình phát và nền tảng đều hỗ trợ nó. AAC ở cùng bitrate hiệu quả hơn một chút nhưng đòi hỏi một vùng chứa được hỗ trợ như .m4a. Với một podcast một giọng, MP3 mono 64 kbps nói chung là đủ: lời nói chiếm một dải tần hẹp, và mono loại bỏ mọi dư thừa kênh. Nếu chương trình của bạn có nhạc, hiệu ứng âm thanh, hoặc nhiều người dẫn được pan để tạo hiệu ứng, stereo 128 kbps cho thêm khoảng trống. Vượt quá 128 kbps cho lời nói không cho cải thiện nghe được và tăng kích thước tệp, ảnh hưởng thời gian tải xuống cho người nghe trên kết nối chậm. Một tập 60 phút ở mono 64 kbps khoảng 28 MB; ở stereo 128 kbps khoảng 56 MB. Trộn xuống mono trước khi xuất cũng giảm một nửa dữ liệu so với stereo ở cùng bitrate. audio-converter xử lý việc chọn định dạng và bitrate. Đặt tốc độ lấy mẫu ở 44.1 kHz cho tương thích; 48 kHz là một quy ước video và không bắt buộc cho phân phối chỉ âm thanh.
Làm cục bộ: không tệp nào rời khỏi thiết bị
audio-volume, vocal-remover và audio-converter đều chạy trong trình duyệt bằng WebAssembly. Việc xử lý âm thanh diễn ra bên trong bộ nhớ của trình duyệt; tệp được đọc từ đĩa cục bộ của bạn, xử lý hoàn toàn trên thiết bị của bạn, và đầu ra được cung cấp như một bản tải xuống cục bộ. Không có gì được gửi tới máy chủ nào. Điều này quan trọng cho việc sản xuất podcast khi nội dung nhạy cảm, một phỏng vấn ghi trước khi công bố, một cuộc trò chuyện đang trong thời gian cấm tiết lộ, hoặc đơn giản một bản ghi bạn không muốn để trên một máy chủ bên thứ ba. Cùng ràng buộc áp dụng cho các giới hạn: các công cụ làm điều mà phần triển khai của chúng hỗ trợ, không hơn. audio-volume áp gain và chuẩn hóa độ to. vocal-remover áp khử kênh trung tâm. audio-converter chuyển định dạng và bitrate. Mỗi công cụ làm một việc xác định, và đầu ra là bất cứ thứ gì phần cứng cục bộ của bạn có thể tính.
Công cụ trong bài viết này
- Âm lượngTăng, giảm hoặc chuẩn hóa âm lượng tệp âm thanh trong trình duyệt. Không tải lên.
- Xóa giọng hát (karaoke)Giảm giọng hát ở giữa để tạo bản karaoke, trong trình duyệt. Không tải lên.
- Chuyển đổi âm thanhChuyển âm thanh sang MP3, WAV hoặc AAC ngay trong trình duyệt. Không tải lên.
- Ghép tệp âm thanhNối nhiều tệp âm thanh (MP3, WAV, M4A, OGG…) thành một. Kéo để sắp xếp. Không tải lên.
Câu hỏi thường gặp
-16 LUFS là gì và vì sao nó là mục tiêu podcast?
-16 LUFS là mức độ to tích hợp mà hầu hết ứng dụng và thư mục podcast chuẩn hóa về khi phát. Nộp ở -16 LUFS nghĩa là tập của bạn phát lại ở xấp xỉ mức bạn dự định mà không bị nền tảng áp các điều chỉnh tự động lớn. Giá trị này đến từ chuẩn ITU-R BS.1770 cho độ to phát sóng, được Apple Podcasts và Spotify điều chỉnh cho nội dung lời nói.
vocal-remover có loại bỏ tiếng ồn nền khỏi bản ghi podcast của tôi không?
Không. vocal-remover áp khử kênh trung tâm, vốn trừ tín hiệu giống hệt ở cả hai kênh stereo. Tiếng ồn nền trong một bản ghi podcast không pan trung tâm theo cách mà việc khử có thể nhắm tới, và các bản ghi mono không có khác biệt kênh để khai thác chút nào. Để giảm tiếng ồn nền, dùng xử lý âm học, một micro định hướng, hoặc một noise gate hay công cụ sửa chữa phổ chuyên dụng trong một trình biên tập âm thanh.
Tôi nên xuất podcast ở mono hay stereo?
Với một bản ghi một giọng, mono ở MP3 64 kbps là lựa chọn chuẩn. Nó giảm một nửa kích thước tệp so với stereo ở cùng bitrate và không có nhược điểm nghe được cho lời nói. Dùng stereo nếu tập của bạn có nhạc, nhiều người dẫn được pan có chủ đích, hoặc thiết kế âm thanh phụ thuộc vào sự tách kênh.