Artículo
Limpiar y preparar audio para un podcast
Una grabación de voz en bruto normalmente necesita tres cosas antes de estar lista para publicar: un nivel de volumen consistente, un formato y una tasa de bits que las plataformas de streaming esperan, y una valoración honesta de lo que la eliminación de ruido puede realmente conseguir. Este artículo cubre esos pasos usando audio-volume, vocal-remover y audio-converter, todos ejecutándose localmente en el navegador.
Volumen frente a pico: por qué LUFS importa más que el nivel de pico
El nivel de pico mide la muestra más alta de un archivo de audio. El volumen, expresado en LUFS (Loudness Units relative to Full Scale), mide la energía percibida a lo largo del tiempo. Un podcast grabado a -3 dBFS de pico puede seguir sonando silencioso si la mayor parte de la señal se mantiene mucho más baja. Las plataformas de streaming y los directorios de podcasts normalizan el audio a un volumen objetivo durante la reproducción, típicamente -14 LUFS para servicios de música y -16 LUFS para palabra hablada, por lo que enviar a un nivel muy diferente significa que la plataforma subirá o bajará tu audio de todos modos. Apuntar a -16 LUFS de volumen integrado te da un archivo terminado que coincide con el predeterminado de la plataforma, se mantiene consistente con otros programas y deja algo de margen antes del techo digital en 0 dBFS. El pico real, que tiene en cuenta los picos entre muestras, normalmente se mantiene por debajo de -1 dBTP. Apuntar a estos dos números juntos da un resultado más limpio que perseguir un objetivo de pico solo.

Ganancia y normalización con audio-volume
audio-volume permite ajustar la ganancia de un archivo en decibelios o aplicar normalización de volumen. Si una grabación está consistentemente silenciosa, añadir ganancia en dB sube toda la señal una cantidad fija. El riesgo es la saturación: si algún pico ya está cerca de 0 dBFS, un desplazamiento de ganancia positivo lo superará, introduciendo distorsión digital. Comprueba la forma de onda antes de aplicar ganancia y mantén el pico real por debajo de -1 dBFS tras el ajuste. La normalización de volumen adopta un enfoque diferente. La herramienta ejecuta el filtro loudnorm de FFmpeg con su objetivo predeterminado de -24 LUFS de volumen integrado, en lugar de los objetivos más altos que recomiendan algunas plataformas de podcast. El loudnorm de una sola pasada es un proceso dinámico, no un desplazamiento de ganancia fijo: sigue el volumen a lo largo del tiempo y ajusta la señal para converger en el objetivo, lo que puede comportarse un poco como una compresión de rango dinámico ligera en una grabación irregular. Para una grabación de voz con grandes variaciones de nivel entre frases, un compresor o limitador dedicado aplicado antes de la normalización sigue dando un resultado más controlado, pero esos pasos quedan fuera de lo que audio-volume gestiona.
Qué puede y qué no puede hacer la cancelación del canal central
vocal-remover aplica una técnica de cancelación del canal central. En un archivo estéreo, una señal que aparece idénticamente en los canales izquierdo y derecho al mismo nivel y fase se dice que está panoramizada al centro. Restar el canal derecho del izquierdo elimina todo lo que está en esa posición central, dejando principalmente el contenido panoramizado a los lados. Esto es lo que crea el efecto karaoke en una pista musical masterizada comercialmente donde las voces principales normalmente están panoramizadas al centro. No detecta ni separa voces usando ningún modelo de habla. No elimina el ruido de fondo, la reverberación de sala, el zumbido de climatización ni el tráfico. No aísla tu voz de podcast del sonido ambiental en una grabación monocanal o mono, donde no hay diferencia de fase que explotar. El resultado también degrada la amplitud estéreo del contenido retenido. Para una pista de podcast grabada en una sala ruidosa, la cancelación del canal central es la herramienta equivocada. El tratamiento acústico, un micrófono direccional o un plugin de gate en un editor de audio dedicado son las opciones prácticas para el ruido de fondo.

Exportar para distribución: formato, tasa de bits y mono frente a estéreo
La mayoría de los directorios de podcasts aceptan MP3 y AAC. MP3 es la opción más compatible; todos los reproductores y plataformas lo admiten. AAC a la misma tasa de bits es ligeramente más eficiente pero requiere un contenedor compatible como .m4a. Para un podcast de una sola voz, 64 kbps mono MP3 es generalmente suficiente: el habla ocupa un rango de frecuencias estrecho y el mono elimina cualquier redundancia de canal. Si tu programa tiene música, efectos de sonido o múltiples presentadores panoramizados por efecto, 128 kbps estéreo da el margen adicional. Superar los 128 kbps para el habla no da ninguna mejora audible y aumenta el tamaño del archivo, lo que afecta al tiempo de descarga para los oyentes con conexiones lentas. Un episodio de 60 minutos a 64 kbps mono ocupa alrededor de 28 MB; a 128 kbps estéreo son aproximadamente 56 MB. Mezclar a mono antes de exportar también reduce a la mitad los datos en comparación con estéreo a la misma tasa de bits. audio-converter gestiona la selección de formato y tasa de bits. Establece la frecuencia de muestreo en 44,1 kHz para compatibilidad; 48 kHz es una convención de vídeo y no es necesario para distribución solo de audio.
Hacerlo localmente: ningún archivo sale de tu dispositivo
audio-volume, vocal-remover y audio-converter se ejecutan todos en el navegador usando WebAssembly. El procesamiento de audio ocurre dentro de la memoria del navegador; el archivo se lee desde tu disco local, se procesa completamente en tu dispositivo y la salida se ofrece como descarga local. No se envía nada a ningún servidor. Esto importa para la producción de podcasts cuando el contenido es sensible, una entrevista grabada antes de publicar, una conversación bajo embargo, o simplemente una grabación que no quieres en un servidor de terceros. La misma restricción se aplica a las limitaciones: las herramientas hacen lo que su implementación admite, no más. audio-volume aplica ganancia y normalización de volumen. vocal-remover aplica cancelación del canal central. audio-converter convierte el formato y la tasa de bits. Cada herramienta hace una cosa definida, y la salida es lo que tu hardware local puede calcular.
Herramientas en este artículo
- Volumen de audioSube, baja o normaliza el volumen de un audio en tu navegador. Sin subir nada.
- Quitar voz (karaoke)Reduce la voz centrada para crear una pista de karaoke, en tu navegador. Sin subir nada.
- Convertidor de audioConvierte audio a MP3, WAV o AAC directamente en tu navegador. Sin subida.
- Combinar archivos de audioConcatena múltiples archivos de audio (MP3, WAV, M4A, OGG…) en uno. Arrastra para reordenar. Sin subida.
Preguntas frecuentes
¿Qué son -16 LUFS y por qué es el objetivo para podcasts?
-16 LUFS es el nivel de volumen integrado al que la mayoría de las aplicaciones y directorios de podcasts normalizan durante la reproducción. Enviar a -16 LUFS significa que tu episodio se reproduce aproximadamente al nivel que pretendías sin que la plataforma aplique grandes correcciones automáticas. El valor proviene del estándar ITU-R BS.1770 para el volumen de emisión, adaptado por Apple Podcasts y Spotify para el contenido de palabra hablada.
¿Puede vocal-remover eliminar el ruido de fondo de mi grabación de podcast?
No. vocal-remover aplica cancelación del canal central, que resta la señal idéntica en ambos canales estéreo. El ruido de fondo en una grabación de podcast no está panoramizado al centro de una manera que la cancelación pueda apuntar, y las grabaciones mono no tienen ninguna diferencia de canal que explotar. Para la reducción de ruido de fondo, usa tratamiento acústico, un micrófono direccional o una herramienta dedicada de gate de ruido o reparación espectral en un editor de audio.
¿Debo exportar mi podcast en mono o estéreo?
Para una grabación de una sola voz, mono a 64 kbps MP3 es la opción estándar. Reduce a la mitad el tamaño del archivo en comparación con estéreo a la misma tasa de bits y no tiene ninguna desventaja audible para el habla. Usa estéreo si tu episodio tiene música, múltiples presentadores deliberadamente panoramizados o diseño de sonido que depende de la separación de canales.