아티클
팟캐스트용 오디오 정리 및 준비
원시 음성 녹음은 보통 게시하기 전 세 가지가 필요합니다. 일관된 음량 수준, 스트리밍 플랫폼이 기대하는 형식과 비트레이트, 그리고 노이즈 제거가 실제로 무엇을 할 수 있는지에 대한 솔직한 평가입니다. 이 글에서는 브라우저에서 로컬로 실행되는 audio-volume, vocal-remover, audio-converter를 사용하여 이러한 단계를 다룹니다.
음량 vs 피크: LUFS가 피크 수준보다 중요한 이유
피크 수준은 오디오 파일에서 가장 큰 단일 샘플을 측정합니다. LUFS(풀 스케일 대비 음량 단위)로 표현되는 음량은 시간에 따른 지각되는 에너지를 측정합니다. -3 dBFS 피크로 녹음된 팟캐스트도 대부분의 신호가 훨씬 낮은 곳에 있으면 조용하게 들릴 수 있습니다. 스트리밍 플랫폼과 팟캐스트 디렉토리는 재생 시 오디오를 목표 음량으로 정규화하는데, 일반적으로 음악 서비스는 -14 LUFS, 음성 콘텐츠는 -16 LUFS입니다. 따라서 매우 다른 수준으로 제출하면 플랫폼이 어차피 오디오를 올리거나 낮춥니다. -16 LUFS 통합 음량을 목표로 하면 플랫폼 기본값과 일치하고 다른 프로그램과 일관성을 유지하며 0 dBFS의 디지털 한계 전에 약간의 헤드룸을 남긴 완성된 파일이 됩니다. 샘플 간 오버를 고려하는 진정한 피크는 일반적으로 -1 dBTP 이하로 유지됩니다. 이 두 수치를 함께 목표로 하면 피크 목표만 쫓는 것보다 더 깨끗한 결과를 얻습니다.

audio-volume으로 게인 및 정규화
audio-volume은 파일의 게인을 데시벨로 조정하거나 음량 정규화를 적용할 수 있습니다. 녹음이 지속적으로 조용한 경우, dB로 게인을 추가하면 전체 신호가 고정된 양만큼 올라갑니다. 위험은 클리핑입니다. 어느 피크가 이미 0 dBFS에 가까이 있으면 양의 게인 오프셋이 그것을 넘어 디지털 왜곡을 도입합니다. 게인을 적용하기 전에 파형을 확인하고 조정 후 진정한 피크를 -1 dBFS 이하로 유지하세요. 음량 정규화는 다른 접근법을 취합니다. 이 도구는 일부 팟캐스트 플랫폼이 권장하는 더 큰 목표 대신, FFmpeg의 loudnorm 필터를 기본값인 통합 음량 -24 LUFS로 실행합니다. 단일 패스 loudnorm은 고정된 게인 오프셋이 아니라 동적인 처리 과정입니다. 시간에 따라 음량을 추적하며 목표값에 수렴하도록 신호를 조정하는데, 이는 일관성이 없는 녹음에서는 가벼운 다이나믹 레인지 압축처럼 동작할 수 있습니다. 문장 사이에 큰 음량 변동이 있는 음성 녹음의 경우, 정규화 전에 적용된 전용 컴프레서나 리미터가 여전히 더 제어된 결과를 제공하지만, 그 단계들은 audio-volume이 처리하는 범위를 벗어납니다.
센터 채널 취소가 할 수 있는 것과 없는 것
vocal-remover는 센터 채널 취소 기법을 적용합니다. 스테레오 파일에서 같은 수준과 위상으로 왼쪽과 오른쪽 채널 모두에 동일하게 나타나는 신호를 센터 패닝되었다고 합니다. 오른쪽 채널에서 왼쪽 채널을 빼면 그 센터 위치에 있는 모든 것이 제거되어 주로 옆으로 패닝된 콘텐츠가 남습니다. 리드 보컬이 일반적으로 센터 패닝된 상업적으로 마스터된 음악 트랙에서 가라오케 효과를 만드는 것이 이 방식입니다. 음성 모델을 사용하여 목소리를 감지하거나 분리하지 않습니다. 배경 소음, 실내 잔향, 공조기 소음, 교통 소음을 제거하지 않습니다. 팟캐스트 음성을 단일 채널이나 모노 녹음의 주변 소리에서 분리하지 않습니다. 위상 차이가 없기 때문입니다. 결과는 또한 보존된 콘텐츠의 스테레오 폭을 저하시킵니다. 시끄러운 환경에서 녹음된 팟캐스트 트랙의 경우 센터 채널 취소는 잘못된 도구입니다. 음향 처리, 지향성 마이크, 또는 전용 오디오 편집기의 게이트 플러그인이 배경 소음의 실용적인 선택지입니다.

배포를 위한 내보내기: 형식, 비트레이트, 모노 vs 스테레오
대부분의 팟캐스트 디렉토리는 MP3와 AAC를 허용합니다. MP3는 가장 호환성이 높은 선택입니다. 모든 플레이어와 플랫폼이 지원합니다. 같은 비트레이트에서 AAC가 약간 더 효율적이지만 .m4a 같은 지원되는 컨테이너가 필요합니다. 단일 음성 팟캐스트의 경우 일반적으로 64 kbps 모노 MP3로 충분합니다. 음성은 좁은 주파수 범위를 차지하고 모노는 채널 중복성을 제거합니다. 프로그램에 음악, 효과음, 또는 효과를 위해 패닝된 여러 진행자가 있다면 128 kbps 스테레오가 추가 헤드룸을 제공합니다. 음성에 대해 128 kbps 이상을 사용해도 청취 가능한 개선이 없으며 파일 크기만 증가하여 느린 연결을 사용하는 청취자의 다운로드 시간에 영향을 미칩니다. 64 kbps 모노에서 60분 에피소드는 약 28 MB입니다. 128 kbps 스테레오에서는 약 56 MB입니다. 내보내기 전 모노로 믹스다운하면 같은 비트레이트에서 스테레오에 비해 데이터를 절반으로 줄입니다. audio-converter가 형식과 비트레이트 선택을 처리합니다. 호환성을 위해 샘플 레이트를 44.1 kHz로 설정하세요. 48 kHz는 동영상 관행이며 오디오 전용 배포에 필요하지 않습니다.
로컬에서 처리하기: 파일이 기기를 벗어나지 않음
audio-volume, vocal-remover, audio-converter는 모두 WebAssembly를 사용하여 브라우저에서 실행됩니다. 오디오 처리는 브라우저 메모리 내에서 이루어집니다. 파일은 로컬 디스크에서 읽히고 기기에서 완전히 처리되며 출력이 로컬 다운로드로 제공됩니다. 어떤 서버로도 전송되지 않습니다. 이는 콘텐츠가 민감한 경우 팟캐스트 제작에 중요합니다. 게시 전 녹음된 인터뷰, 엠바고 중인 대화, 또는 단순히 제3자 서버에 올리고 싶지 않은 녹음이 해당됩니다. 같은 제약이 한계에도 적용됩니다. 도구는 구현이 지원하는 것을 수행하며 그 이상은 하지 않습니다. audio-volume은 게인과 음량 정규화를 적용합니다. vocal-remover는 센터 채널 취소를 적용합니다. audio-converter는 형식과 비트레이트를 변환합니다. 각 도구는 하나의 정해진 작업을 수행하며 출력은 로컬 하드웨어가 계산할 수 있는 것입니다.
이 아티클의 도구
자주 묻는 질문
-16 LUFS란 무엇이고 왜 팟캐스트 목표인가요?
-16 LUFS는 대부분의 팟캐스트 앱과 디렉토리가 재생 시 정규화하는 통합 음량 수준입니다. -16 LUFS로 제출하면 플랫폼이 대규모 자동 보정을 적용하지 않고 에피소드가 의도한 수준으로 재생됩니다. 이 값은 방송 음량에 대한 ITU-R BS.1770 표준에서 나왔으며 Apple Podcasts와 Spotify가 음성 콘텐츠에 맞게 적용했습니다.
vocal-remover가 팟캐스트 녹음에서 배경 소음을 제거할 수 있나요?
아니요. vocal-remover는 두 스테레오 채널에서 동일한 신호를 빼는 센터 채널 취소를 적용합니다. 팟캐스트 녹음의 배경 소음은 취소가 타겟팅할 수 있는 방식으로 센터 패닝되지 않으며, 모노 녹음에는 활용할 채널 차이가 전혀 없습니다. 배경 소음 감소를 위해서는 음향 처리, 지향성 마이크, 또는 오디오 편집기에서 전용 노이즈 게이트나 스펙트럼 수리 도구를 사용하세요.
팟캐스트를 모노로 내보내야 할까요, 스테레오로 내보내야 할까요?
단일 음성 녹음의 경우 64 kbps MP3 모노가 표준 선택입니다. 같은 비트레이트에서 스테레오에 비해 파일 크기를 절반으로 줄이며 음성에 대해 청취 가능한 단점이 없습니다. 에피소드에 음악이 있거나 의도적으로 패닝된 여러 진행자가 있거나 채널 분리에 의존하는 사운드 디자인이 있다면 스테레오를 사용하세요.