Transcriber

Whisper AI로 브라우저에서 무제한 텍스트 변환

오디오 파일을 고르면 Whisper 모델이 브라우저 안에서 실행되어 텍스트로 옮깁니다. Python·ffmpeg·GPU 드라이버를 준비할 필요가 없습니다. 음성이 서버로 가지 않으며 가입도 결제도 필요 없습니다.

사용 환경을 확인하는 중…

이 언어는 작은 모델에서 정확도가 크게 떨어집니다. 「Whisper Small」 이상을 선택하세요

사용Beta

보통은 「자동」 그대로 두면 됩니다. 결과에 나온 화자 수가 실제와 확연히 다를 때만 지정해 주세요

사용 방법

  1. 모델을 고릅니다. 기본값은 기기 성능에 맞춰 자동으로 정해집니다. WebGPU를 쓸 수 있는 PC에서는 Large v3 Turbo가 정확도와 속도의 균형이 좋습니다.
  2. 언어를 고릅니다. 자동 감지로도 동작하지만 실제 언어를 지정하면 인식 오류가 줄어듭니다.
  3. 오디오 또는 동영상 파일을 고릅니다. 파일을 읽어 들이는 즉시 변환이 시작되고, 끝나면 TXT 또는 SRT 형식의 파일로 내보낼 수 있습니다.

브라우저에서 동작하는 Whisper에 대해

Whisper는 OpenAI가 공개한 음성 인식 모델로, 보통은 Python 환경을 만들고 ffmpeg와 GPU 드라이버를 설치한 뒤에 사용합니다. 이 도구는 같은 Whisper 모델을 브라우저에서 동작하는 형식으로 변환한 것을 사용합니다. 모델은 처음 한 번 내려받고, 그다음부터는 브라우저에 저장된 것을 불러옵니다.

고를 수 있는 모델은 Tiny·Base·Small·Medium·Large v3 Turbo·Large v3의 6개입니다. WebGPU를 쓸 수 있는 PC에서는 GPU로, 스마트폰과 WebGPU를 쓸 수 없는 기기에서는 CPU로 동작합니다. 모델이 클수록 정확도는 올라가지만 내려받는 용량과 메모리 사용량도 늘어납니다. Large v3 Turbo는 인코더가 Large v3와 같고 디코더만 작게 만든 모델이어서, Large v3에 가까운 정확도로 빠르게 동작합니다.

Whisper는 무음이나 음악 구간에서 아무도 말하지 않은 문장을 적어 넣을 때가 있습니다. 같은 문장이 반복되는 경우는 자동으로 제거하지만, 한 번만 나온 문장은 남으므로 결과 화면에서 그 행을 삭제해 주세요.

잘 안 될 때

자주 묻는 질문

Python이나 GPU가 필요한가요?

필요 없습니다. Chrome이나 Edge 같은 최신 브라우저만 있으면 동작합니다. WebGPU를 쓸 수 있는 PC에서는 GPU로 빠르게 동작하고, 스마트폰이나 GPU를 쓸 수 없는 기기에서도 CPU로 동작합니다(시간은 더 걸립니다).

어떤 모델을 골라야 하나요?

기기 성능에 맞춰 자동으로 고른 모델이 기본값입니다. WebGPU를 쓸 수 있는 PC에서는 Large v3 Turbo가 정확도와 속도의 균형이 좋고, 스마트폰에서는 Tiny나 Base를 골라 주세요.

Python 버전의 Whisper와 결과가 같은가요?

모델은 같은 Whisper이지만 브라우저에서 실행하기 위해 경량화했기 때문에 세부 결과는 Python 버전과 일치하지 않을 수 있습니다.

오프라인에서도 쓸 수 있나요?

네. 모델을 한 번 내려받은 뒤에는 네트워크에 연결하지 않아도 변환할 수 있습니다.

오디오·영상 준비와 받아쓰기 이후

서비스 품질 향상에 협조를 부탁드립니다

성공했을 때도 실패했을 때도 그 상황을 보내 주시면 원인을 찾는 데 도움이 됩니다(실패율을 내려면 양쪽이 모두 필요합니다). 어떤 기기와 설정에서 자주 실패하는지 알 수 있으면 권장 설정을 재검토하고 문제를 고치는 데 반영할 수 있습니다. 괜찮으시다면 켜 둔 채로 두시면 큰 도움이 됩니다.

전송하는 정보

기기 성능(GPU 종류·메모리·코어 수), 브라우저와 OS, 선택한 모델과 언어, 어느 단계까지 진행했는지, 오류 내용, 파일 형식과 대략적인 크기·길이, 처리에 걸린 시간.

전송하지 않는 정보

음성 데이터, 전사 결과, 파일 이름, IP 주소. 전송 대상은 이 사이트의 자체 서버뿐이며 외부 서비스에는 넘기지 않습니다.