Без качване, 100% локално, без акаунт

Разпознаване на реч, аудио в текст в браузъра

Пуснете запис и получете текстов препис. Работи на устройството ви с малък модел Whisper, изтеглен веднъж от този сайт; аудиото ви никога не се качва.

Как работи Разпознаване на реч · аудио в текст

Audio Transcribe превръща запис в текст с помощта на Whisper, модел за разпознаване на реч, който работи изцяло в раздела на браузъра ви чрез Transformers.js. При първото стартиране браузърът ви изтегля модела и необходимия WebAssembly механизъм (общо около 68 MB) от този сайт, след което ги кешира; всяка следваща транскрипция се случва на вашето устройство, без сървър и без аудиото да напуска машината ви. Това е същият компромис, както при инструментите за OCR и аудио на този сайт: реално еднократно изтегляне за реална офлайн обработка, а не маркетингово твърдение.

Използваният тук модел е whisper-tiny.en: най-малкият, квантован, само за английски вариант на Whisper. Достатъчно бърз е, за да работи в раздел на браузъра, и произвежда полезна първа чернова, но не е професионална услуга за транскрипция. Очаквайте грешки при собствени имена, техническа лексика, силни акценти, фонов шум и застъпващи се говорители. Записи, по-дълги от около 30 секунди, се обработват на застъпващи се сегменти, за да бъде транскрибиран целият файл, но едночасово интервю все пак отнема реално изчислително време, тъй като всичко се изпълнява на вашето собствено устройство, а не в център за данни.

Как да използвате Разпознаване на реч · аудио в текст, стъпка по стъпка

  1. Пуснете аудио файл (MP3, WAV, M4A, OGG или WebM записите, произведени от Voice Recorder на този сайт).
  2. Изчакайте еднократното изтегляне на механизма и модела (около 68 MB), ако това е първата ви транскрипция на това устройство.
  3. Изберете обикновен текст (.txt) или субтитри с времеви кодове (.srt) като изходен формат.
  4. Натиснете транскрибиране и оставете Whisper да обработи записа изцяло в раздела на браузъра ви.
  5. Копирайте текста директно или изтеглете файла .txt/.srt, когато е готов.

Често срещани приложения

  • Получаване на груба писмена чернова на гласова бележка, записана на телефона ви, преди да я редактирате ръчно.
  • Превръщане на кратко записано интервю в текст с възможност за търсене, без да го качвате в облачна услуга за транскрипция.
  • Генериране на начален файл със субтитри .srt за кратък клип, който после да бъде коригиран.
  • Записване на бърза гласова бележка с Voice Recorder на този сайт, след което транскрибирането ѝ в същия раздел на браузъра.
  • Получаване на първоначален препис на лекция или запис на среща, когато перфектната точност не е задължителна.

Често задавани въпроси

Колко точна е транскрипцията?

Зависи силно от качеството на звука. Ясна, еднословна английска реч, записана близо до микрофона с малко фонов шум, се транскрибира сравнително добре. Акцентите, застъпването на говорители, фоновата музика или шум, и специализираната лексика (имена, жаргон, съкращения) увеличават грешките. Това е малък, квантован модел, избран така, че да работи в раздел на браузъра, а не най-големият модел на Whisper, така че приемайте резултата като полезна чернова за преглед и корекция, а не като окончателен препис.

Работи ли с езици, различни от английски?

Не. Този инструмент използва whisper-tiny.en, само английския вариант на Whisper, избран, защото е по-малък и по-точен за английски от многоезичния tiny модел. Аудио на други езици ще произведе лоши или безсмислени резултати. Поддръжка на други езици в момента не е налична.

Защо трябва да се изтегли нещо, преди инструментът да заработи?

Моделът за разпознаване на реч и WebAssembly механизмът, който го изпълнява (общо около 68 MB), не са вградени в страницата; те се извличат еднократно от този сайт и се кешират от браузъра ви, подобно на начина, по който инструментът за OCR изтегля езиков модел. След това първо изтегляне транскрипцията работи напълно офлайн. Нищо не се извлича от трета страна или CDN.

Качва ли се аудиото ми някъде?

Не. Записът се декодира и обработва изцяло в раздела на браузъра ви чрез Web Audio API и локален модел на Whisper. Нито аудио файл, нито транскрибиран текст се изпращат някога на сървър. Можете да прекъснете връзката с мрежата, след като моделът е изтеглен, и транскрипцията пак ще работи.

Колко време отнема транскрипцията?

Зависи от процесора на устройството ви и от дължината на записа, тъй като всичко се изпълнява локално, а не на сървърен хардуер. Кратки клипове (под минута) обикновено завършват за няколко секунди до под минута. Дългите записи, като едночасово интервю, отнемат пропорционално повече време и ще заемат раздела на браузъра ви през цялото това време; дръжте раздела отворен и не навигирайте другаде, докато работи.

Каква е разликата между изхода .txt и .srt?

Файлът .txt е чистият транскрибиран текст без времеви кодове, полезен за четене или поставяне другаде. Файлът .srt е стандартен формат за субтитри с диапазон от времеви кодове за всеки изговорен сегмент, полезен за добавяне на надписи към видео. И двата се генерират от една и съща транскрипция; изберете този, който отговаря на следващата ви задача.