오디오 텍스트 변환 · 음성을 텍스트로 작동 방식
오디오 전사는 Transformers.js를 통해 브라우저 탭 안에서 완전히 실행되는 음성 인식 모델인 Whisper를 사용해 녹음을 텍스트로 변환합니다. 처음 실행할 때 브라우저가 이 사이트에서 필요한 모델과 웹어셈블리 엔진(총 약 68MB)을 다운로드해 캐시하며, 이후의 모든 전사는 서버 없이 기기에서 처리되고 오디오가 기기를 벗어나는 일은 없습니다. 이는 이 사이트의 OCR 도구 및 오디오 도구들과 같은 방식입니다. 마케팅 문구가 아니라 실제 일회성 다운로드로 실제 오프라인 처리를 하는 것입니다.
여기서 사용하는 모델은 whisper-tiny.en으로, 가장 작고 양자화된, 영어 전용 Whisper 버전입니다. 브라우저 탭에서 실행될 만큼 빠르며 쓸 만한 초안을 만들어내지만, 전문 전사 서비스는 아닙니다. 고유명사, 전문 용어, 강한 억양, 배경 소음, 겹치는 화자에서는 오류가 발생할 수 있습니다. 약 30초를 넘는 녹음은 겹치는 구간으로 나누어 처리되어 전체 파일이 전사되지만, 1시간짜리 인터뷰는 데이터 센터가 아니라 사용자 자신의 기기에서 모두 실행되는 만큼 실제로 상당한 연산 시간이 걸립니다.