ถอดเสียงเป็นข้อความ ทำงานอย่างไร
Audio Transcribe แปลงเสียงบันทึกให้เป็นข้อความโดยใช้ Whisper โมเดลรู้จำเสียงพูดที่ทำงานทั้งหมดภายในแท็บเบราว์เซอร์ของคุณผ่าน Transformers.js ครั้งแรกที่คุณใช้งาน เบราว์เซอร์ของคุณจะดาวน์โหลดโมเดลและเอนจิน WebAssembly ที่จำเป็น (รวมประมาณ 68 MB) จากไซต์นี้ แล้วแคชไว้ หลังจากนั้นทุกการถอดเสียงจะทำงานบนอุปกรณ์ของคุณโดยไม่มีเซิร์ฟเวอร์เกี่ยวข้อง และไม่มีเสียงใดออกจากเครื่องของคุณเลย นี่คือข้อแลกเปลี่ยนแบบเดียวกับเครื่องมือ OCR และเครื่องมือเสียงอื่น ๆ บนไซต์นี้: การดาวน์โหลดครั้งเดียวที่เกิดขึ้นจริง เพื่อการประมวลผลออฟไลน์ที่เกิดขึ้นจริง ไม่ใช่คำโฆษณา
โมเดลที่ใช้ที่นี่คือ whisper-tiny.en ซึ่งเป็น Whisper เวอร์ชันเล็กที่สุด แบบ quantized และรองรับเฉพาะภาษาอังกฤษ มันเร็วพอที่จะทำงานในแท็บเบราว์เซอร์และให้ผลลัพธ์แบบร่างแรกที่ใช้ได้ แต่ไม่ใช่บริการถอดเสียงระดับมืออาชีพ คาดว่าจะมีข้อผิดพลาดกับชื่อเฉพาะ คำศัพท์เทคนิค สำเนียงที่หนัก เสียงรบกวนพื้นหลัง และผู้พูดที่พูดทับกัน การบันทึกที่ยาวกว่าประมาณ 30 วินาทีจะถูกประมวลผลเป็นส่วนที่ซ้อนทับกัน เพื่อให้ทั้งไฟล์ถูกถอดเสียงครบ แต่การสัมภาษณ์หนึ่งชั่วโมงยังคงใช้เวลาประมวลผลจริง เพราะทั้งหมดทำงานบนอุปกรณ์ของคุณเองแทนที่จะเป็นศูนย์ข้อมูล