लेख
पॉडकास्ट के लिए ऑडियो साफ़ और तैयार करना
एक कच्ची आवाज़ रिकॉर्डिंग को प्रकाशित होने से पहले आमतौर पर तीन चीज़ें चाहिए: एक एकसमान तीव्रता (loudness) स्तर, एक फ़ॉर्मैट और bitrate जिसकी स्ट्रीमिंग प्लेटफ़ॉर्म अपेक्षा करते हैं, और इस बारे में एक ईमानदार आकलन कि शोर-हटाना वास्तव में क्या दे सकता है। यह लेख उन कदमों को audio-volume, vocal-remover और audio-converter का उपयोग कर देखता है, सभी ब्राउज़र में स्थानीय रूप से चलते हुए।
तीव्रता बनाम शिखर: LUFS शिखर स्तर से अधिक क्यों मायने रखता है
शिखर स्तर एक ऑडियो फ़ाइल में सबसे ऊँचे अकेले नमूने को मापता है। तीव्रता, LUFS (Loudness Units relative to Full Scale) में व्यक्त, समय के साथ अनुभूत ऊर्जा को मापती है। -3 dBFS शिखर पर रिकॉर्ड किया एक पॉडकास्ट फिर भी धीमा सुनाई दे सकता है यदि अधिकांश संकेत बहुत नीचे बैठा हो। स्ट्रीमिंग प्लेटफ़ॉर्म और पॉडकास्ट निर्देशिकाएँ प्लेबैक पर ऑडियो को एक लक्ष्य तीव्रता पर सामान्यीकृत करती हैं, आमतौर पर संगीत सेवाओं के लिए -14 LUFS और बोले गए शब्द के लिए -16 LUFS, इसलिए बहुत अलग स्तर पर जमा करने का अर्थ है कि प्लेटफ़ॉर्म वैसे भी आपके ऑडियो को ऊपर या नीचे करेगा। -16 LUFS एकीकृत तीव्रता का लक्ष्य रखना आपको एक तैयार फ़ाइल देता है जो प्लेटफ़ॉर्म डिफ़ॉल्ट से मेल खाती है, अन्य शो के साथ एकसमान रहती है, और 0 dBFS पर डिजिटल छत से पहले थोड़ी जगह छोड़ती है। सच्चा शिखर (true peak), जो नमूनों-के-बीच वाले अतिरेक का हिसाब रखता है, आमतौर पर -1 dBTP से नीचे रखा जाता है। इन दो संख्याओं को साथ लक्षित करना केवल एक शिखर लक्ष्य के पीछे भागने से साफ़ परिणाम देता है।

audio-volume के साथ gain और सामान्यीकरण
audio-volume आपको किसी फ़ाइल का gain डेसिबल में समायोजित करने या तीव्रता सामान्यीकरण लगाने देता है। यदि कोई रिकॉर्डिंग लगातार धीमी है, dB में gain जोड़ना पूरे संकेत को एक निश्चित मात्रा से ऊपर उठाता है। जोखिम clipping है: यदि कोई शिखर पहले से 0 dBFS के पास बैठा हो, एक धनात्मक gain उसे ऊपर धकेल देगा, डिजिटल विकृति लाते हुए। gain लगाने से पहले तरंगरूप जाँचें, और समायोजन के बाद सच्चा शिखर -1 dBFS से नीचे रखें। तीव्रता सामान्यीकरण एक अलग तरीक़ा अपनाता है। टूल FFmpeg के loudnorm फ़िल्टर को उसके डिफ़ॉल्ट लक्ष्य -24 LUFS एकीकृत तीव्रता पर चलाता है, न कि उन ज़्यादा तेज़ लक्ष्यों पर जो कुछ पॉडकास्ट प्लेटफ़ॉर्म सुझाते हैं। एकल-पास loudnorm एक गतिशील प्रक्रिया है, कोई स्थिर gain ऑफ़सेट नहीं: यह समय के साथ तीव्रता को ट्रैक करता है और संकेत को लक्ष्य पर पहुँचाने के लिए समायोजित करता है, जो किसी असंगत रिकॉर्डिंग पर हल्के dynamic-range compression जैसा व्यवहार कर सकता है। वाक्यों के बीच बड़े स्तर-झूले वाली एक आवाज़ रिकॉर्डिंग के लिए, सामान्यीकरण से पहले लगाया एक dedicated compressor या limiter अब भी अधिक नियंत्रित परिणाम देता है, पर वे कदम audio-volume जो संभालता है उससे बाहर हैं।
center-channel cancellation क्या कर सकता है और क्या नहीं
vocal-remover एक center-channel cancellation तकनीक लगाता है। एक stereo फ़ाइल में, एक संकेत जो बाएँ और दाएँ दोनों चैनलों में समान स्तर और phase पर एक जैसा दिखता है, center-panned कहलाता है। बाएँ से दायाँ चैनल घटाना उस केंद्रीय स्थिति में बैठी किसी भी चीज़ को हटा देता है, मुख्यतः किनारों पर pan की गई सामग्री छोड़ते हुए। यही वह है जो एक व्यावसायिक रूप से master किए संगीत ट्रैक पर karaoke प्रभाव बनाता है जहाँ मुख्य गायन आमतौर पर center-panned होता है। यह किसी भी भाषण मॉडल का उपयोग कर आवाज़ें पहचानता या अलग नहीं करता। यह पृष्ठभूमि शोर, कमरे की प्रतिध्वनि, HVAC गुंजार, या यातायात नहीं हटाता। यह एक एकल-चैनल या mono रिकॉर्डिंग में आपकी पॉडकास्ट आवाज़ को परिवेशी ध्वनि से अलग नहीं करता, जहाँ शोषण के लिए कोई phase अंतर नहीं होता। परिणाम बची रखी सामग्री की stereo चौड़ाई भी घटाता है। एक शोरगुल वाले कमरे में रिकॉर्ड किए पॉडकास्ट ट्रैक के लिए, center-channel cancellation ग़लत टूल है। ध्वनिक उपचार, एक दिशात्मक माइक्रोफ़ोन, या एक समर्पित ऑडियो संपादक में एक gate plugin पृष्ठभूमि शोर के लिए व्यावहारिक विकल्प हैं।

वितरण के लिए निर्यात: फ़ॉर्मैट, bitrate और mono बनाम stereo
अधिकांश पॉडकास्ट निर्देशिकाएँ MP3 और AAC स्वीकार करती हैं। MP3 सबसे संगत चुनाव है; हर प्लेयर और प्लेटफ़ॉर्म इसका समर्थन करता है। समान bitrate पर AAC थोड़ा अधिक कुशल है पर एक समर्थित कंटेनर जैसे .m4a माँगता है। एक अकेली-आवाज़ पॉडकास्ट के लिए, 64 kbps mono MP3 आमतौर पर पर्याप्त है: भाषण एक संकीर्ण आवृत्ति सीमा घेरता है, और mono किसी भी चैनल अतिरेक को हटाता है। यदि आपके शो में संगीत, ध्वनि-प्रभाव, या प्रभाव के लिए pan किए कई मेज़बान हों, 128 kbps stereo अतिरिक्त जगह देता है। भाषण के लिए 128 kbps से ऊपर जाना कोई सुनाई देने वाला सुधार नहीं देता और फ़ाइल आकार बढ़ाता है, जो धीमे कनेक्शन वाले श्रोताओं के लिए डाउनलोड समय पर असर डालता है। 64 kbps mono पर एक 60-मिनट एपिसोड लगभग 28 MB है; 128 kbps stereo पर लगभग 56 MB। निर्यात से पहले mono में मिलाना भी समान bitrate पर stereo की तुलना में डेटा आधा कर देता है। audio-converter फ़ॉर्मैट और bitrate चयन संभालता है। संगति के लिए नमूना दर 44.1 kHz सेट करें; 48 kHz एक वीडियो परंपरा है और केवल-ऑडियो वितरण के लिए ज़रूरी नहीं।
स्थानीय रूप से करना: कोई फ़ाइल आपका डिवाइस नहीं छोड़ती
audio-volume, vocal-remover और audio-converter सभी ब्राउज़र में WebAssembly का उपयोग कर चलते हैं। ऑडियो प्रसंस्करण ब्राउज़र की मेमोरी के भीतर होता है; फ़ाइल आपकी स्थानीय डिस्क से पढ़ी जाती है, पूरी तरह आपके डिवाइस पर संसाधित होती है, और आउटपुट एक स्थानीय डाउनलोड के रूप में दिया जाता है। कुछ भी किसी सर्वर को नहीं भेजा जाता। यह पॉडकास्ट निर्माण के लिए तब मायने रखता है जब सामग्री संवेदनशील हो, प्रकाशन से पहले रिकॉर्ड किया एक साक्षात्कार, एक प्रतिबंध-काल वाली बातचीत, या बस एक रिकॉर्डिंग जिसे आप किसी तीसरे-पक्ष के सर्वर पर नहीं चाहते। वही बाधा सीमाओं पर लागू होती है: टूल वही करते हैं जो उनका कार्यान्वयन समर्थन करता है, उससे अधिक नहीं। audio-volume gain और तीव्रता सामान्यीकरण लगाता है। vocal-remover center-channel cancellation लगाता है। audio-converter फ़ॉर्मैट और bitrate बदलता है। हर टूल एक निर्धारित काम करता है, और आउटपुट वही है जो आपका स्थानीय हार्डवेयर गणना कर सकता है।
इस लेख में उल्लेखित टूल्स
- ऑडियो वॉल्यूमअपने ब्राउज़र में किसी ऑडियो फ़ाइल की आवाज़ बढ़ाएँ, घटाएँ या नॉर्मलाइज़ करें। कोई अपलोड नहीं।
- वोकल रिमूवर (कराओके)अपने ब्राउज़र में कराओके ट्रैक बनाने के लिए सेंटर्ड वोकल कम करें। कोई अपलोड नहीं।
- ऑडियो कनवर्टरसीधे ब्राउज़र में ऑडियो को MP3, WAV या AAC में बदलें। कोई अपलोड नहीं।
- ऑडियो फ़ाइलें मर्ज करेंकई ऑडियो फ़ाइलें (MP3, WAV, M4A, OGG…) को एक में जोड़ें। क्रम बदलने के लिए खींचें। कोई अपलोड नहीं।
अक्सर पूछे जाने वाले सवाल
-16 LUFS क्या है और यह पॉडकास्ट लक्ष्य क्यों है?
-16 LUFS वह एकीकृत तीव्रता स्तर है जिस पर अधिकांश पॉडकास्ट ऐप और निर्देशिकाएँ प्लेबैक पर सामान्यीकृत करती हैं। -16 LUFS पर जमा करने का अर्थ है कि आपका एपिसोड लगभग उसी स्तर पर बजता है जो आपने चाहा था, बिना प्लेटफ़ॉर्म के बड़े स्वचालित सुधार लगाए। यह मान प्रसारण तीव्रता के लिए ITU-R BS.1770 मानक से आता है, जिसे Apple Podcasts और Spotify ने बोले गए शब्द की सामग्री के लिए अनुकूलित किया।
क्या vocal-remover मेरी पॉडकास्ट रिकॉर्डिंग से पृष्ठभूमि शोर हटा सकता है?
नहीं। vocal-remover center-channel cancellation लगाता है, जो उस संकेत को घटाता है जो दोनों stereo चैनलों में एक जैसा है। एक पॉडकास्ट रिकॉर्डिंग में पृष्ठभूमि शोर इस तरह center-panned नहीं होता कि cancellation उसे लक्षित कर सके, और mono रिकॉर्डिंग में शोषण के लिए कोई चैनल अंतर ही नहीं होता। पृष्ठभूमि शोर कम करने के लिए, ध्वनिक उपचार, एक दिशात्मक माइक्रोफ़ोन, या एक ऑडियो संपादक में एक समर्पित noise gate या spectral repair टूल उपयोग करें।
क्या मुझे अपना पॉडकास्ट mono में निर्यात करना चाहिए या stereo में?
एक अकेली-आवाज़ रिकॉर्डिंग के लिए, 64 kbps MP3 पर mono मानक चुनाव है। यह समान bitrate पर stereo की तुलना में फ़ाइल आकार आधा करता है और भाषण के लिए कोई सुनाई देने वाली कमी नहीं रखता। stereo उपयोग करें यदि आपके एपिसोड में संगीत, जानबूझकर pan किए कई मेज़बान, या ध्वनि-डिज़ाइन हो जो चैनल पृथक्करण पर निर्भर करता है।