कोई अपलोड नहीं, 100% स्थानीय, कोई खाता नहीं

ऑडियो ट्रांसक्राइब, आपके ब्राउज़र में स्पीच से टेक्स्ट

रिकॉर्डिंग ड्रॉप करें और टेक्स्ट ट्रांसक्रिप्ट पाएं। यह इस साइट से एक बार डाउनलोड किए छोटे Whisper मॉडल के साथ आपकी डिवाइस पर चलता है; आपका ऑडियो कभी अपलोड नहीं होता।

ऑडियो ट्रांसक्राइब · स्पीच से टेक्स्ट कैसे काम करता है

Audio Transcribe Whisper की मदद से रिकॉर्डिंग को टेक्स्ट में बदलता है, यह एक स्पीच रिकग्निशन मॉडल है जो Transformers.js के ज़रिए पूरी तरह आपके ब्राउज़र टैब के अंदर चलता है। पहली बार जब आप इसे चलाते हैं, आपका ब्राउज़र इस साइट से मॉडल और उसे चलाने के लिए ज़रूरी WebAssembly इंजन (कुल मिलाकर लगभग 68 MB) डाउनलोड करता है, फिर उन्हें कैश कर लेता है; इसके बाद हर ट्रांसक्रिप्शन आपके डिवाइस पर होता है, बिना किसी सर्वर के और बिना किसी ऑडियो के आपकी मशीन से बाहर गए। यह इस साइट के OCR और ऑडियो टूल जैसा ही ट्रेड-ऑफ़ है: असली वन-टाइम डाउनलोड, असली ऑफ़लाइन प्रोसेसिंग के लिए, न कि सिर्फ़ एक मार्केटिंग दावा।

यहाँ इस्तेमाल किया गया मॉडल whisper-tiny.en है: सबसे छोटा, क्वांटाइज़्ड, केवल अंग्रेज़ी वाला Whisper वेरिएंट। यह ब्राउज़र टैब में चलने लायक तेज़ है और एक उपयोगी पहला ड्राफ़्ट देता है, पर यह कोई प्रोफ़ेशनल ट्रांसक्रिप्शन सेवा नहीं है। खास नामों, तकनीकी शब्दावली, गहरे एक्सेंट, बैकग्राउंड शोर और एक साथ बोलने वाले कई लोगों पर गलतियों की उम्मीद रखें। लगभग 30 सेकंड से लंबी रिकॉर्डिंग को ओवरलैपिंग चंक में प्रोसेस किया जाता है ताकि पूरी फ़ाइल का ट्रांसक्रिप्शन हो सके, पर एक घंटे के इंटरव्यू में असली कंप्यूटिंग समय लगता है क्योंकि यह सब डेटा सेंटर की बजाय आपके अपने डिवाइस पर चलता है।

ऑडियो ट्रांसक्राइब · स्पीच से टेक्स्ट: चरण दर चरण उपयोग विधि

  1. एक ऑडियो फ़ाइल ड्रॉप करें (MP3, WAV, M4A, OGG या इस साइट के Voice Recorder से बनी WebM रिकॉर्डिंग)।
  2. अगर यह आपके डिवाइस पर पहला ट्रांसक्रिप्शन है, तो वन-टाइम इंजन और मॉडल डाउनलोड (लगभग 68 MB) का इंतज़ार करें।
  3. आउटपुट फॉर्मैट के रूप में सादा टेक्स्ट (.txt) या टाइमस्टैंप वाली सबटाइटल (.srt) चुनें।
  4. ट्रांसक्राइब दबाएँ और Whisper को रिकॉर्डिंग को आपके ब्राउज़र टैब में पूरी तरह प्रोसेस करने दें।
  5. टेक्स्ट को इनलाइन कॉपी करें या तैयार होने पर .txt/.srt फ़ाइल डाउनलोड करें।

सामान्य उपयोग के मामले

  • फ़ोन पर रिकॉर्ड किए गए वॉइस मेमो का एक रफ़ लिखित ड्राफ़्ट पाना, हाथ से ठीक करने से पहले।
  • किसी छोटे रिकॉर्ड किए गए इंटरव्यू को क्लाउड ट्रांसक्रिप्शन सेवा पर अपलोड किए बिना सर्च करने योग्य टेक्स्ट में बदलना।
  • किसी छोटे क्लिप के लिए शुरुआती .srt सबटाइटल फ़ाइल बनाना, जिसे बाद में ठीक किया जाए।
  • इस साइट के Voice Recorder से एक जल्दी वॉइस नोट रिकॉर्ड करना, फिर उसी ब्राउज़र टैब में उसे ट्रांसक्राइब करना।
  • जब सटीकता बिल्कुल परफ़ेक्ट होना ज़रूरी न हो, तब किसी लेक्चर या मीटिंग रिकॉर्डिंग का पहला ट्रांसक्रिप्ट पाना।

अक्सर पूछे जाने वाले प्रश्न

ट्रांसक्रिप्शन कितना सटीक है?

यह काफ़ी हद तक ऑडियो क्वालिटी पर निर्भर करता है। माइक्रोफ़ोन के पास रिकॉर्ड की गई साफ़, एक ही बोलने वाले की अंग्रेज़ी रिकॉर्डिंग, जिसमें बैकग्राउंड शोर कम हो, ठीक-ठाक ट्रांसक्राइब होती है। एक्सेंट, एक साथ बोलना, बैकग्राउंड म्यूज़िक या शोर, और खास शब्दावली (नाम, जार्गन, संक्षिप्त रूप) सभी गलतियाँ बढ़ाते हैं। यह एक छोटा, क्वांटाइज़्ड मॉडल है जिसे इसलिए चुना गया है ताकि यह ब्राउज़र टैब में चल सके, न कि सबसे बड़ा Whisper मॉडल, इसलिए आउटपुट को समीक्षा और सुधार के लिए एक उपयोगी ड्राफ़्ट मानें, अंतिम ट्रांसक्रिप्ट नहीं।

क्या यह अंग्रेज़ी के अलावा दूसरी भाषाओं के साथ काम करता है?

नहीं। यह टूल whisper-tiny.en इस्तेमाल करता है, जो केवल अंग्रेज़ी वाला Whisper वेरिएंट है, इसे इसलिए चुना गया क्योंकि यह छोटा है और मल्टीलिंगुअल tiny मॉडल के मुकाबले अंग्रेज़ी पर ज़्यादा सटीक है। दूसरी भाषाओं के ऑडियो पर खराब या बेतुके नतीजे मिलेंगे। फ़िलहाल दूसरी भाषाओं का सपोर्ट उपलब्ध नहीं है।

इसे काम करने से पहले कुछ डाउनलोड करने की ज़रूरत क्यों पड़ती है?

स्पीच रिकग्निशन मॉडल और उसे चलाने वाला WebAssembly इंजन (कुल मिलाकर लगभग 68 MB) पेज में पहले से बने हुए नहीं होते; इन्हें इस साइट से एक बार फ़ेच किया जाता है और आपके ब्राउज़र द्वारा कैश कर लिया जाता है, ठीक वैसे ही जैसे OCR टूल एक लैंग्वेज मॉडल डाउनलोड करता है। उस पहले डाउनलोड के बाद, ट्रांसक्रिप्शन पूरी तरह ऑफ़लाइन चलता है। किसी तीसरे पक्ष के CDN से कुछ भी फ़ेच नहीं किया जाता।

क्या मेरा ऑडियो कहीं अपलोड होता है?

नहीं। रिकॉर्डिंग को Web Audio API और एक लोकल Whisper मॉडल का इस्तेमाल करके पूरी तरह आपके ब्राउज़र टैब के अंदर डिकोड और प्रोसेस किया जाता है। न कोई ऑडियो फ़ाइल, न ट्रांसक्राइब किया गया टेक्स्ट, कभी किसी सर्वर पर नहीं भेजा जाता। मॉडल डाउनलोड होने के बाद आप नेटवर्क से डिस्कनेक्ट भी कर सकते हैं और ट्रांसक्रिप्शन तब भी काम करता है।

ट्रांसक्रिप्शन में कितना समय लगता है?

यह आपके डिवाइस के CPU और रिकॉर्डिंग की लंबाई पर निर्भर करता है, क्योंकि सब कुछ सर्वर हार्डवेयर की बजाय लोकल रूप से चलता है। छोटे क्लिप (एक मिनट से कम) आमतौर पर कुछ सेकंड से लेकर एक मिनट से कम समय में पूरे हो जाते हैं। लंबी रिकॉर्डिंग, जैसे एक घंटे का इंटरव्यू, उसी अनुपात में ज़्यादा समय लेती हैं और उतनी देर तक आपका ब्राउज़र टैब व्यस्त रखेंगी; काम पूरा होने तक टैब को खुला रखें और कहीं और न जाएँ।

.txt और .srt आउटपुट में क्या फ़र्क़ है?

.txt फ़ाइल बिना किसी टाइमस्टैंप के सादा ट्रांसक्राइब किया गया टेक्स्ट है, जो पढ़ने या कहीं और पेस्ट करने के लिए उपयोगी है। .srt फ़ाइल एक स्टैंडर्ड सबटाइटल फॉर्मैट है जिसमें हर बोले गए हिस्से के लिए एक टाइमस्टैंप रेंज होती है, जो किसी वीडियो में कैप्शन जोड़ने के लिए उपयोगी है। दोनों एक ही ट्रांसक्रिप्शन से बनाए जाते हैं; आपको आगे जो करना है उसके हिसाब से जो भी फ़िट बैठे उसे चुनें।