ไม่มีการอัปโหลด, 100% ในเครื่อง, ไม่มีบัญชี

ถอดเสียงเป็นข้อความในเบราว์เซอร์

วางบันทึกเสียงแล้วรับข้อความถอดความ ทำงานบนอุปกรณ์ของคุณด้วยโมเดล Whisper ขนาดเล็กที่ดาวน์โหลดจากเว็บไซต์นี้ครั้งเดียว เสียงของคุณไม่เคยถูกอัปโหลด

ถอดเสียงเป็นข้อความ ทำงานอย่างไร

Audio Transcribe แปลงเสียงบันทึกให้เป็นข้อความโดยใช้ Whisper โมเดลรู้จำเสียงพูดที่ทำงานทั้งหมดภายในแท็บเบราว์เซอร์ของคุณผ่าน Transformers.js ครั้งแรกที่คุณใช้งาน เบราว์เซอร์ของคุณจะดาวน์โหลดโมเดลและเอนจิน WebAssembly ที่จำเป็น (รวมประมาณ 68 MB) จากไซต์นี้ แล้วแคชไว้ หลังจากนั้นทุกการถอดเสียงจะทำงานบนอุปกรณ์ของคุณโดยไม่มีเซิร์ฟเวอร์เกี่ยวข้อง และไม่มีเสียงใดออกจากเครื่องของคุณเลย นี่คือข้อแลกเปลี่ยนแบบเดียวกับเครื่องมือ OCR และเครื่องมือเสียงอื่น ๆ บนไซต์นี้: การดาวน์โหลดครั้งเดียวที่เกิดขึ้นจริง เพื่อการประมวลผลออฟไลน์ที่เกิดขึ้นจริง ไม่ใช่คำโฆษณา

โมเดลที่ใช้ที่นี่คือ whisper-tiny.en ซึ่งเป็น Whisper เวอร์ชันเล็กที่สุด แบบ quantized และรองรับเฉพาะภาษาอังกฤษ มันเร็วพอที่จะทำงานในแท็บเบราว์เซอร์และให้ผลลัพธ์แบบร่างแรกที่ใช้ได้ แต่ไม่ใช่บริการถอดเสียงระดับมืออาชีพ คาดว่าจะมีข้อผิดพลาดกับชื่อเฉพาะ คำศัพท์เทคนิค สำเนียงที่หนัก เสียงรบกวนพื้นหลัง และผู้พูดที่พูดทับกัน การบันทึกที่ยาวกว่าประมาณ 30 วินาทีจะถูกประมวลผลเป็นส่วนที่ซ้อนทับกัน เพื่อให้ทั้งไฟล์ถูกถอดเสียงครบ แต่การสัมภาษณ์หนึ่งชั่วโมงยังคงใช้เวลาประมวลผลจริง เพราะทั้งหมดทำงานบนอุปกรณ์ของคุณเองแทนที่จะเป็นศูนย์ข้อมูล

วิธีใช้ ถอดเสียงเป็นข้อความ ทีละขั้นตอน

  1. วางไฟล์เสียง (MP3, WAV, M4A, OGG หรือไฟล์ WebM ที่ Voice Recorder ของไซต์นี้สร้างขึ้น)
  2. รอการดาวน์โหลดเอนจินและโมเดลครั้งแรก (ประมาณ 68 MB) หากนี่เป็นการถอดเสียงครั้งแรกของคุณบนอุปกรณ์นี้
  3. เลือกข้อความล้วน (.txt) หรือคำบรรยายพร้อมประทับเวลา (.srt) เป็นรูปแบบเอาต์พุต
  4. กดถอดเสียงและปล่อยให้ Whisper ประมวลผลการบันทึกทั้งหมดภายในแท็บเบราว์เซอร์ของคุณ
  5. คัดลอกข้อความในหน้าเว็บ หรือดาวน์โหลดไฟล์ .txt/.srt เมื่อพร้อม

กรณีการใช้งานที่พบบ่อย

  • ได้ร่างข้อความคร่าว ๆ ของบันทึกเสียงที่บันทึกไว้บนโทรศัพท์ ก่อนแก้ไขด้วยมือ
  • แปลงบทสัมภาษณ์สั้น ๆ ที่บันทึกไว้ให้เป็นข้อความค้นหาได้ โดยไม่ต้องอัปโหลดไปยังบริการถอดเสียงบนคลาวด์
  • สร้างไฟล์คำบรรยาย .srt เริ่มต้นสำหรับคลิปสั้น ๆ เพื่อนำไปแก้ไขในภายหลัง
  • บันทึกโน้ตเสียงด่วนด้วย Voice Recorder ของไซต์นี้ แล้วถอดเสียงในแท็บเบราว์เซอร์เดียวกัน
  • ได้ทรานสคริปต์ร่างแรกของการบรรยายหรือการประชุมที่บันทึกไว้ เมื่อไม่ต้องการความแม่นยำสมบูรณ์แบบ

คำถามที่พบบ่อย

การถอดเสียงแม่นยำแค่ไหน?

ขึ้นอยู่กับคุณภาพเสียงเป็นอย่างมาก เสียงพูดภาษาอังกฤษที่ชัดเจน ผู้พูดคนเดียว บันทึกใกล้ไมโครโฟน และมีเสียงรบกวนพื้นหลังน้อย จะถอดเสียงได้ค่อนข้างดี สำเนียง การพูดทับกัน เพลงหรือเสียงรบกวนพื้นหลัง และคำศัพท์เฉพาะทาง (ชื่อ ศัพท์เทคนิค คำย่อ) ล้วนเพิ่มข้อผิดพลาด นี่คือโมเดลขนาดเล็กแบบ quantized ที่เลือกมาเพื่อให้ทำงานในแท็บเบราว์เซอร์ได้ ไม่ใช่โมเดล Whisper ขนาดใหญ่ที่สุด จึงควรมองผลลัพธ์เป็นร่างที่มีประโยชน์สำหรับตรวจสอบและแก้ไข ไม่ใช่ทรานสคริปต์ฉบับสุดท้าย

ใช้ได้กับภาษาอื่นนอกจากภาษาอังกฤษหรือไม่?

ไม่ได้ เครื่องมือนี้ใช้ whisper-tiny.en ซึ่งเป็น Whisper เวอร์ชันรองรับเฉพาะภาษาอังกฤษ เลือกใช้เพราะมีขนาดเล็กกว่าและแม่นยำกว่าโมเดล tiny แบบหลายภาษาเมื่อใช้กับภาษาอังกฤษ เสียงในภาษาอื่นจะให้ผลลัพธ์ที่แย่หรือไม่มีความหมาย การรองรับภาษาอื่นยังไม่มีในขณะนี้

ทำไมต้องดาวน์โหลดบางอย่างก่อนถึงจะใช้งานได้?

โมเดลรู้จำเสียงพูดและเอนจิน WebAssembly ที่รันมัน (รวมประมาณ 68 MB) ไม่ได้ฝังอยู่ในหน้าเว็บ แต่ถูกดึงมาจากไซต์นี้เพียงครั้งเดียวและแคชไว้โดยเบราว์เซอร์ของคุณ คล้ายกับที่เครื่องมือ OCR ดาวน์โหลดโมเดลภาษา หลังจากดาวน์โหลดครั้งแรกนั้น การถอดเสียงจะทำงานแบบออฟไลน์เต็มรูปแบบ ไม่มีการดึงข้อมูลจาก CDN ของบุคคลที่สามใด ๆ

เสียงของฉันถูกอัปโหลดไปที่ใดหรือไม่?

ไม่ถูกอัปโหลด การบันทึกจะถูกถอดรหัสและประมวลผลทั้งหมดภายในแท็บเบราว์เซอร์ของคุณโดยใช้ Web Audio API และโมเดล Whisper ในเครื่อง ไม่มีไฟล์เสียง และไม่มีข้อความที่ถอดแล้ว ถูกส่งไปยังเซิร์ฟเวอร์เลย คุณสามารถตัดการเชื่อมต่อเครือข่ายหลังจากโมเดลดาวน์โหลดเสร็จ และการถอดเสียงจะยังทำงานได้

การถอดเสียงใช้เวลานานแค่ไหน?

ขึ้นอยู่กับ CPU ของอุปกรณ์คุณและความยาวของการบันทึก เนื่องจากทุกอย่างทำงานในเครื่องแทนที่จะเป็นฮาร์ดแวร์เซิร์ฟเวอร์ คลิปสั้น (ต่ำกว่าหนึ่งนาที) มักเสร็จภายในไม่กี่วินาทีถึงไม่ถึงหนึ่งนาที การบันทึกที่ยาว เช่น การสัมภาษณ์หนึ่งชั่วโมง จะใช้เวลานานขึ้นตามสัดส่วน และจะทำให้แท็บเบราว์เซอร์ของคุณไม่ว่างตลอดช่วงเวลานั้น ควรเปิดแท็บไว้และไม่ย้ายไปหน้าอื่นระหว่างทำงาน

เอาต์พุต .txt กับ .srt ต่างกันอย่างไร?

ไฟล์ .txt คือข้อความที่ถอดเสียงล้วน ๆ โดยไม่มีการประทับเวลา เหมาะสำหรับอ่านหรือคัดลอกไปวางที่อื่น ไฟล์ .srt เป็นรูปแบบคำบรรยายมาตรฐานที่มีช่วงเวลาประทับสำหรับแต่ละช่วงคำพูด เหมาะสำหรับเพิ่มคำบรรยายลงในวิดีโอ ทั้งสองสร้างจากการถอดเสียงเดียวกัน เลือกแบบที่เหมาะกับสิ่งที่คุณต้องทำต่อไป