كيف تعمل تفريغ الصوت · كلام إلى نص
تحوّل أداة Audio Transcribe تسجيلًا إلى نص باستخدام Whisper، وهو نموذج للتعرّف على الكلام يعمل بالكامل داخل تبويب متصفحك عبر Transformers.js. في المرة الأولى التي تشغّله فيها، يقوم متصفحك بتنزيل النموذج ومحرك WebAssembly اللازم (نحو 68 ميغابايت إجمالًا) من هذا الموقع، ثم يخزّنهما مؤقتًا؛ وبعد ذلك تتم كل عملية تفريغ على جهازك دون تدخل أي خادم ودون أن يغادر الصوت جهازك إطلاقًا. إنها المقايضة نفسها الموجودة في أداتَي OCR والصوت في هذا الموقع: تنزيل حقيقي لمرة واحدة مقابل معالجة حقيقية دون اتصال، لا مجرد ادعاء تسويقي.
النموذج المستخدم هنا هو whisper-tiny.en، وهو أصغر نسخ Whisper وأكثرها ضغطًا (quantized) والمخصص للإنجليزية فقط. إنه سريع بما يكفي للعمل داخل تبويب متصفح وينتج مسودة أولى مفيدة، لكنه ليس خدمة تفريغ احترافية. توقع أخطاء في أسماء الأعلام والمفردات التقنية واللكنات القوية وضوضاء الخلفية وتداخل المتحدثين. تُعالَج التسجيلات الأطول من نحو 30 ثانية على شكل مقاطع متداخلة حتى يُفرَّغ الملف بأكمله، لكن مقابلة مدتها ساعة كاملة تستغرق وقت معالجة حقيقيًا لأن كل شيء يعمل على جهازك أنت لا في مركز بيانات.