업로드 없음, 100% 로컬, 계정 없음

오디오 텍스트 변환, 브라우저에서 음성을 텍스트로

녹음을 놓으면 텍스트 대본을 얻습니다. 이 사이트에서 한 번 내려받은 작은 Whisper 모델로 기기에서 실행되며, 오디오는 절대 업로드되지 않습니다.

오디오 텍스트 변환 · 음성을 텍스트로 작동 방식

오디오 전사는 Transformers.js를 통해 브라우저 탭 안에서 완전히 실행되는 음성 인식 모델인 Whisper를 사용해 녹음을 텍스트로 변환합니다. 처음 실행할 때 브라우저가 이 사이트에서 필요한 모델과 웹어셈블리 엔진(총 약 68MB)을 다운로드해 캐시하며, 이후의 모든 전사는 서버 없이 기기에서 처리되고 오디오가 기기를 벗어나는 일은 없습니다. 이는 이 사이트의 OCR 도구 및 오디오 도구들과 같은 방식입니다. 마케팅 문구가 아니라 실제 일회성 다운로드로 실제 오프라인 처리를 하는 것입니다.

여기서 사용하는 모델은 whisper-tiny.en으로, 가장 작고 양자화된, 영어 전용 Whisper 버전입니다. 브라우저 탭에서 실행될 만큼 빠르며 쓸 만한 초안을 만들어내지만, 전문 전사 서비스는 아닙니다. 고유명사, 전문 용어, 강한 억양, 배경 소음, 겹치는 화자에서는 오류가 발생할 수 있습니다. 약 30초를 넘는 녹음은 겹치는 구간으로 나누어 처리되어 전체 파일이 전사되지만, 1시간짜리 인터뷰는 데이터 센터가 아니라 사용자 자신의 기기에서 모두 실행되는 만큼 실제로 상당한 연산 시간이 걸립니다.

오디오 텍스트 변환 · 음성을 텍스트로 단계별 사용 방법

  1. 오디오 파일(MP3, WAV, M4A, OGG 또는 이 사이트의 음성 녹음기가 만드는 WebM 녹음)을 놓으세요.
  2. 이 기기에서 처음 전사하는 경우, 일회성 엔진 및 모델 다운로드(약 68MB)를 기다리세요.
  3. 출력 형식으로 일반 텍스트(.txt) 또는 타임스탬프가 있는 자막(.srt)을 선택하세요.
  4. 전사 버튼을 눌러 Whisper가 브라우저 탭 안에서 녹음을 완전히 처리하도록 하세요.
  5. 준비되면 텍스트를 그 자리에서 복사하거나 .txt/.srt 파일을 다운로드하세요.

자주 사용되는 사례

  • 휴대폰으로 녹음한 음성 메모를 손으로 다듬기 전에 대략적인 초안 텍스트로 만듭니다.
  • 클라우드 전사 서비스에 업로드하지 않고 짧은 녹음 인터뷰를 검색 가능한 텍스트로 바꿉니다.
  • 짧은 클립을 위한 시작점 .srt 자막 파일을 생성하고 나중에 수정합니다.
  • 이 사이트의 음성 녹음기로 빠르게 음성 메모를 녹음한 뒤, 같은 브라우저 탭에서 바로 전사합니다.
  • 완벽한 정확도가 필요하지 않을 때 강의나 회의 녹음의 1차 전사본을 얻습니다.

자주 묻는 질문

전사 정확도는 어느 정도인가요?

오디오 품질에 크게 좌우됩니다. 마이크에 가깝게 녹음된 명확한 단일 화자의 영어이고 배경 소음이 적다면 비교적 잘 전사됩니다. 억양, 겹치는 대화, 배경 음악이나 소음, 특수 어휘(이름, 전문 용어, 약어)는 모두 오류를 늘립니다. 이는 브라우저 탭에서 실행될 수 있도록 선택된 작고 양자화된 모델이며, 가장 큰 Whisper 모델이 아닙니다. 최종 전사본이 아니라 검토하고 수정할 유용한 초안으로 다루시기 바랍니다.

영어 외의 언어도 지원하나요?

아닙니다. 이 도구는 다국어 tiny 모델보다 영어에서 더 작고 더 정확하기 때문에 선택된 영어 전용 Whisper 버전인 whisper-tiny.en을 사용합니다. 다른 언어의 오디오는 부정확하거나 의미 없는 결과를 낼 것입니다. 현재로서는 다른 언어 지원이 제공되지 않습니다.

왜 작동하기 전에 무언가를 다운로드해야 하나요?

음성 인식 모델과 이를 실행하는 웹어셈블리 엔진(합쳐서 약 68MB)은 페이지에 내장되어 있지 않습니다. OCR 도구가 언어 모델을 다운로드하는 것과 비슷하게, 이 사이트에서 한 번 가져와 브라우저에 캐시됩니다. 이 최초 다운로드 이후 전사는 완전히 오프라인으로 실행됩니다. 어떤 제3자 CDN에서도 아무것도 가져오지 않습니다.

내 오디오가 어딘가에 업로드되나요?

아닙니다. 녹음은 Web Audio API와 로컬 Whisper 모델을 사용해 브라우저 탭 안에서 완전히 디코딩되고 처리됩니다. 오디오 파일도, 전사된 텍스트도 서버로 전송되지 않습니다. 모델이 다운로드된 후에는 네트워크 연결을 끊어도 전사가 계속 작동합니다.

전사에는 얼마나 걸리나요?

모든 것이 서버 하드웨어가 아니라 로컬에서 실행되므로 기기의 CPU와 녹음 길이에 따라 달라집니다. 짧은 클립(1분 미만)은 보통 몇 초에서 1분 이내에 끝납니다. 1시간짜리 인터뷰처럼 긴 녹음은 그만큼 더 오래 걸리며 그 시간 동안 브라우저 탭이 계속 작업 중이 됩니다. 작업이 끝날 때까지 탭을 열어두고 다른 곳으로 이동하지 마세요.

.txt와 .srt 출력의 차이는 무엇인가요?

.txt 파일은 타임스탬프가 없는 순수 전사 텍스트로, 읽거나 다른 곳에 붙여넣기에 유용합니다. .srt 파일은 각 발화 구간마다 타임스탬프 범위가 있는 표준 자막 형식으로, 동영상에 자막을 추가할 때 유용합니다. 둘 다 같은 전사 결과에서 생성되므로 다음 작업에 맞는 쪽을 선택하시면 됩니다.