लेख
ट्रांसक्रिप्शन के लिए ऑडियो धीमा करना
तेज़ वक्ता, अपरिचित लहजे, और कई अतिव्यापी आवाज़ें वे तीन मुख्य कारण हैं जिनसे एक ट्रांसक्रिप्शन अटकता है। रिकॉर्डिंग धीमी करना जो कहा गया उसे पकड़ने का समय देता है। पेच यह है कि सरल प्लेबैक-धीमापन हर आवाज़ की पिच भी गिरा देता है, जो भाषण को आसान के बजाय कठिन बना देता है। यह लेख सरल गति-कमी और पिच बचाने वाले time-stretching के बीच अंतर समझाता है, और वास्तव में मदद करने वाली व्यावहारिक सीमाएँ देखता है।
धीमा करना क्यों मदद करता है
मानव भाषण एक छोटी खिड़की में बहुत जानकारी ले जाता है। एक तेज़ वक्ता 200 शब्द प्रति मिनट या अधिक दे सकता है, और उस दर पर, कान के पास अगला अक्षर आने से पहले अलग-अलग ध्वनि-अंश सुलझाने का कम समय होता है। ऑडियो धीमा करना मस्तिष्क को प्रति अक्षर अधिक प्रसंस्करण समय देता है, जो तीन स्थितियों में सबसे अधिक मायने रखता है: एक अपरिचित लहजे वाला वक्ता जिसकी ध्वनि-मैपिंग आपकी अपेक्षा से भिन्न है; एक सघन तकनीकी अंश जहाँ हर शब्द अर्थ रखता है और एक भी ग़लत सुनना एक ग़लत शब्द पैदा करता है; और दो या अधिक अतिव्यापी आवाज़ों वाली रिकॉर्डिंग जहाँ कान को एक साथ अलग धाराएँ ट्रैक करनी होती हैं। तीनों में, लक्ष्य कुछ ऐसा सुनना नहीं जो था ही नहीं, बल्कि जो पहले से रिकॉर्ड था उसे सटीक सुनने के लिए ख़ुद को पर्याप्त समय देना है। एक 0.75x प्लेबैक दर अक्सर एक लहजे या एक सघन अंश के लिए पर्याप्त होती है। एक 0.5x दर एक छोटे भाग के लिए उपयोगी है जहाँ पहले कुछ प्रयासों में शब्द नहीं सुलझे।

गति और पिच: सरल धीमापन काम क्यों नहीं करता
ऑडियो धीमा करने का सबसे सरल तरीक़ा नमूनों को रिकॉर्ड की गई दर से कम दर पर बजाना है। पुराने टेप रिकॉर्डर इसी तरह धीमा करते थे: टेप को धीमे घुमाएँ और अवधि तथा पिच दोनों साथ गिरते हैं। 0.75x पर, आवाज़ें लगभग एक minor third गिरती हैं। 0.5x पर, वे एक पूरा octave गिरती हैं। परिणाम वह परिचित धीमी, गहरी विकृति है जो भाषण को अस्वाभाविक और, विरोधाभासी रूप से, समझने में कठिन बनाती है क्योंकि स्वरों को अलग करने वाली formant आवृत्तियाँ सब नीचे खिसक गई हैं। सही तरीक़ा time-stretching है: ऑडियो की अवधि बदलना बिना आवृत्तियाँ बदले। हर आवाज़ की पिच वही रहती है; केवल अक्षरों के आने की दर बदलती है। यही तरीक़ा audio-speed टूल और अधिकांश समर्पित ट्रांसक्रिप्शन सॉफ़्टवेयर उपयोग करते हैं। अनुभूत परिणाम यह है कि एक धीमी रिकॉर्डिंग वही वक्ता धीमी गति से बोलते हुए सी लगती है, जो ठीक वही है जो आपको चाहिए जब लक्ष्य सटीक ट्रांसक्रिप्शन हो।
time-stretching कैसे काम करता है: atempo तरीक़ा
व्यावहारिक ऑडियो टूल में time-stretching के लिए सबसे व्यापक रूप से उपयोग किया एल्गोरिद्म phase vocoding पर आधारित है, और ffmpeg में इसका आम कार्यान्वयन atempo फ़िल्टर है। इनपुट ऑडियो को छोटे अतिव्यापी फ़्रेम में बाँटा जाता है, आमतौर पर हर 20 से 40 मिलीसेकंड। एल्गोरिद्म आसन्न फ़्रेम के बीच phase संबंधों का विश्लेषण करता है, फिर एक संशोधित दर पर नए फ़्रेम संश्लेषित करता है जबकि phases समायोजित करता है ताकि क्रमागत फ़्रेम सही ढंग से पंक्तिबद्ध हों। परिणाम एक सतत आउटपुट संकेत है जिसकी अवधि बदल गई है पर जिसकी आवृत्ति सामग्री नहीं। चूँकि फ़्रेम मानव आवाज़ के विशिष्ट पिच-काल के सापेक्ष छोटे हैं, भाषण की मूल आवृत्ति खिंचाव के पार बची रहती है। एल्गोरिद्म का एक दुष्प्रभाव यह है कि तेज़ क्षणिक ध्वनियाँ, जैसे किसी व्यंजन की चटक, बड़े खिंचाव पर थोड़ी धुँधली हो सकती हैं, क्योंकि फ़्रेम-अतिव्यापी संश्लेषण थोड़ी मात्रा में औसत लाता है। यह कार्यान्वयन का दोष नहीं; यह overlap-add परिवार के एल्गोरिद्म का एक अंतर्निहित गुण है।

व्यावहारिक गति सीमाएँ और गुणवत्ता की हद
ट्रांसक्रिप्शन कार्य के लिए, दो गति मान अधिकांश व्यावहारिक ज़रूरतें समेटते हैं। 0.75x पर, भाषण अपनी मूल अवधि के 133% तक खींचा जाता है। व्यंजन समूह और तेज़ स्वर-संक्रमण अलग करना आसान हो जाता है, और बदलाव इतना छोटा है कि एल्गोरिद्म बहुत कम अनुभूत artefact लाता है। अधिकांश श्रोता वाक्य की स्वाभाविक लय खोए बिना इस दर पर भाषण का अनुसरण कर सकते हैं। 0.5x पर, ऑडियो अपनी मूल लंबाई का दोगुना खींचा जाता है। यह एक अकेले वाक्य या एक छोटे कठिन अंश के लिए उपयोगी है, पर कई मिनटों तक लगातार सुनने के लिए बहुत धीमा है; शब्द सुलझने से पहले एकाग्रता गिर जाती है। 0.5x से नीचे, आउटपुट की गुणवत्ता स्पष्ट रूप से ख़राब होती है। overlap-add संश्लेषण निरंतर स्वरों पर एक फड़फड़ाहट या phasiness लाने लगता है, और व्यंजन तथा स्वर के बीच के समय-संकेत जो लय ले जाते हैं विकृत हो जाते हैं। ffmpeg में atempo फ़िल्टर एक अकेले पास के लिए 0.5x की न्यूनतम सीमा थोपता है, जो इस गुणवत्ता हद को दर्शाता है। 0.5x से नीचे के मान दो पास जोड़ने की माँग करते हैं, और artefact स्तर तदनुसार बढ़ता है। लगभग हर ट्रांसक्रिप्शन उपयोग-मामले के लिए, 0.75x पर या छोटे खंडों के लिए अधिकतम 0.5x पर रहना साफ़, उपयोगी आउटपुट देता है।
audio-speed टूल से स्थानीय रूप से करना
इस साइट का audio-speed टूल पूरी तरह ब्राउज़र में WebAssembly में संकलित ffmpeg का उपयोग कर चलता है। आप अपनी ऑडियो फ़ाइल पृष्ठ पर छोड़ते हैं, गति गुणक सेट करते हैं, और प्रसंस्करण आपके डिवाइस पर होता है। रिकॉर्डिंग किसी भी क्षण आपकी मशीन नहीं छोड़ती: कोई अपलोड नहीं, कोई सर्वर नहीं, कोई तीसरे-पक्ष की सेवा नहीं। यह रिकॉर्ड की गई बातचीत, साक्षात्कार, चिकित्सकीय डिक्टेशन, क़ानूनी कार्यवाही, और किसी भी अन्य संदर्भ के लिए मायने रखता है जहाँ ऑडियो की सामग्री संवेदनशील है। टूल ffmpeg द्वारा संभाले गए आम ऑडियो फ़ॉर्मैट स्वीकार करता है, जिनमें MP3, WAV, M4A, OGG और FLAC शामिल हैं। आउटपुट आपकी चुनी गति पर एक डाउनलोड योग्य फ़ाइल है। चूँकि प्रसंस्करण स्थानीय रूप से चलता है, लगने वाला समय फ़ाइल की लंबाई और आपके डिवाइस की गति पर निर्भर करता है। कुछ मिनट का ऑडियो एक आधुनिक लैपटॉप पर आमतौर पर एक मिनट से काफ़ी कम में संसाधित होता है। टूल इस लेख में वर्णित वही atempo फ़िल्टर उपयोग करता है, इसलिए ऊपर वर्णित गुणवत्ता विशेषताएँ सीधे उस पर लागू होती हैं जो आप आउटपुट में सुनेंगे।
इस लेख में उल्लेखित टूल्स
अक्सर पूछे जाने वाले सवाल
क्या ऑडियो धीमा करना पिच भी बदल देगा?
यह तरीक़े पर निर्भर है। सरल प्लेबैक-दर कमी पिच बदल देती है: 0.5x पर, आवाज़ें एक पूरा octave गिरती हैं। audio-speed टूल time-stretching (atempo फ़िल्टर) उपयोग करता है जो अवधि बदलता है बिना पिच बदले, इसलिए आवाज़ें अपनी मूल आवृत्ति पर रहती हैं।
वह सबसे धीमी गति क्या है जो फिर भी साफ़ सुनाई दे?
0.75x पर आउटपुट अधिकांश रिकॉर्डिंग के लिए साफ़ है। 0.5x पर यह छोटे अंशों के लिए स्वीकार्य है। 0.5x से नीचे, overlap-add एल्गोरिद्म निरंतर स्वरों और व्यंजन-संक्रमणों पर सुनाई देने वाले artefact लाने लगता है। ट्रांसक्रिप्शन कार्य के लिए, 0.5x पर या उससे ऊपर रहना सबसे अच्छे परिणाम देता है।
जब मैं audio-speed टूल उपयोग करता हूँ तो क्या फ़ाइल अपलोड होती है?
नहीं। audio-speed टूल पूरी तरह ब्राउज़र में चलता है। फ़ाइल आपके डिवाइस पर WebAssembly का उपयोग कर स्थानीय रूप से संसाधित होती है। कुछ भी किसी सर्वर को नहीं भेजा जाता, इसलिए आपकी रिकॉर्डिंग की सामग्री निजी रहती है।