Без загрузки, 100% локально, без аккаунта

Расшифровка аудио, речь в текст в браузере

Загрузите запись и получите текстовую расшифровку. Работает на вашем устройстве с небольшой моделью Whisper, скачиваемой один раз с этого сайта; ваше аудио никогда не загружается на сервер.

Как работает Расшифровка аудио · речь в текст

Audio Transcribe превращает запись в текст с помощью Whisper, модели распознавания речи, которая полностью работает во вкладке браузера через Transformers.js. При первом запуске браузер загружает с этого сайта модель и необходимый движок WebAssembly (около 68 МБ в сумме), а затем кэширует их; каждая последующая транскрибация происходит на вашем устройстве без участия сервера и без передачи звука куда-либо. Это тот же компромисс, что и у инструментов OCR и аудио на этом сайте: реальная разовая загрузка ради реальной офлайн-обработки, а не маркетинговое заявление.

Используемая здесь модель называется whisper-tiny.en: это самый маленький квантованный вариант Whisper, работающий только с английским языком. Она достаточно быстрая для работы во вкладке браузера и даёт полезный черновой вариант, но не заменяет профессиональную службу транскрибации. Ожидайте ошибок в именах собственных, специальной терминологии, при сильном акценте, фоновом шуме и наложении голосов нескольких говорящих. Записи длиннее примерно 30 секунд обрабатываются перекрывающимися фрагментами, чтобы был транскрибирован весь файл, но часовое интервью всё равно потребует реального времени на вычисления, поскольку всё выполняется на вашем собственном устройстве, а не в дата-центре.

Расшифровка аудио · речь в текст: пошаговая инструкция

  1. Перетащите аудиофайл (MP3, WAV, M4A, OGG или записи WebM, создаваемые инструментом «Диктофон» этого сайта).
  2. Дождитесь разовой загрузки движка и модели (около 68 МБ), если это ваша первая транскрибация на этом устройстве.
  3. Выберите формат результата: обычный текст (.txt) или субтитры с временными метками (.srt).
  4. Нажмите «Транскрибировать» и дайте Whisper полностью обработать запись во вкладке браузера.
  5. Скопируйте текст прямо на странице или скачайте файл .txt/.srt, когда он будет готов.

Частые сценарии использования

  • Получение чернового текстового варианта голосовой заметки, записанной на телефоне, перед ручной доработкой.
  • Превращение короткого записанного интервью в текст с возможностью поиска без загрузки в облачный сервис транскрибации.
  • Создание начального файла субтитров .srt для короткого ролика с последующей ручной правкой.
  • Запись короткой голосовой заметки инструментом «Диктофон» этого сайта с последующей транскрибацией в той же вкладке браузера.
  • Получение первичной расшифровки записи лекции или встречи, когда идеальная точность не требуется.

Часто задаваемые вопросы

Насколько точна транскрибация?

Это сильно зависит от качества звука. Чёткая английская речь одного говорящего, записанная близко к микрофону с минимальным фоновым шумом, распознаётся достаточно хорошо. Акценты, наложение голосов, фоновая музыка или шум и специальная лексика (имена, жаргон, аббревиатуры) увеличивают количество ошибок. Это небольшая квантованная модель, выбранная именно потому, что она может работать во вкладке браузера, а не самая крупная модель Whisper, поэтому относитесь к результату как к полезному черновику для проверки и правки, а не как к готовой расшифровке.

Работает ли это с языками, отличными от английского?

Нет. Этот инструмент использует whisper-tiny.en, вариант Whisper только для английского языка, выбранный потому, что он меньше по размеру и точнее на английском языке, чем многоязычная tiny-модель. Аудио на других языках даст слабый или бессмысленный результат. Поддержка других языков в настоящее время недоступна.

Почему перед работой нужно что-то скачать?

Модель распознавания речи и движок WebAssembly, который её запускает (в сумме около 68 МБ), не встроены в страницу; они один раз загружаются с этого сайта и кэшируются браузером, аналогично тому, как инструмент OCR загружает языковую модель. После этой первой загрузки транскрибация работает полностью офлайн. Ничего не загружается со сторонних CDN.

Загружается ли моё аудио куда-либо?

Нет. Запись декодируется и обрабатывается полностью во вкладке браузера с помощью Web Audio API и локальной модели Whisper. Ни аудиофайл, ни распознанный текст никогда не отправляются на сервер. После загрузки модели вы можете отключиться от сети, и транскрибация всё равно будет работать.

Сколько времени занимает транскрибация?

Это зависит от процессора вашего устройства и длительности записи, поскольку всё выполняется локально, а не на серверном оборудовании. Короткие ролики (меньше минуты) обычно обрабатываются за несколько секунд, максимум за минуту. Длинные записи, например часовое интервью, занимают пропорционально больше времени и будут удерживать вкладку браузера занятой всё это время; держите вкладку открытой и не переходите на другие страницы, пока идёт обработка.

В чём разница между результатами .txt и .srt?

Файл .txt содержит обычный распознанный текст без временных меток, удобный для чтения или вставки в другое место. Файл .srt использует стандартный формат субтитров с диапазоном временных меток для каждого произнесённого фрагмента, удобный для добавления подписей к видео. Оба файла создаются из одной и той же транскрибации; выбирайте тот, который подходит для вашей дальнейшей задачи.