Transcriber

브라우저에서 끝내는
AI 음성 텍스트 변환

오디오 파일을 고르기만 하면 Whisper AI가 브라우저 안에서 텍스트로 변환합니다. 음성이 서버로 전송되지 않습니다. 가입 불필요, 시간 제한 없이 완전 무료입니다.

완전한 프라이버시
오프라인 지원
WebGPU 고속 추론
사용 환경을 확인하는 중…

이 언어는 작은 모델에서 정확도가 크게 떨어집니다. 「Whisper Small」 이상을 선택하세요

사용Beta

화자 수를 알고 있다면 지정할 때 정확도가 크게 올라갑니다

사용 방법

  1. 1

    오디오 올리기

    MP3, WAV, M4A, FLAC 등 주요 형식을 지원합니다. 끌어다 놓기도 가능합니다.

  2. 2

    AI가 자동으로 변환

    Whisper AI가 브라우저 안에서 추론합니다. 처음 실행할 때 모델을 내려받습니다(선택한 모델에 따라 40 MB~1.6 GB).

  3. 3

    결과 내보내기

    일반 텍스트나 SRT 자막으로 저장할 수 있고, 화자 분리도 지원합니다.

이런 곳에 쓸 수 있습니다

브라우저를 벗어나지 않고 녹음을 텍스트로 만듭니다. 아무것도 업로드하지 않으므로 외부 서비스에 맡길 수 없는 녹음에도 적합합니다.

회의록

화자 분리가 참석자마다 색을 나눠 주기 때문에 변환 결과가 이미 회의록에 가깝습니다. 사내 녹음이 외부 서버로 나가지 않습니다.

인터뷰 정리

녹음 길이에 제한이 없습니다. 화자 수를 지정하면 인터뷰어와 인터뷰이의 구분이 좋아집니다.

영상·YouTube 자막

MP4나 WebM 파일을 그대로 읽어 타임코드가 있는 SRT 자막으로 내보낼 수 있습니다. 미리 변환할 필요가 없습니다.

강의·세미나 기록

녹음한 강의를 검색 가능한 텍스트로 남겨 둡니다. 전문 용어가 많은 음성은 큰 모델이 더 잘 처리합니다.

음성 메모

휴대폰으로 녹음한 M4A 메모를 그대로 읽어 텍스트로 만들 수 있습니다.

팟캐스트·방송 아카이브

지난 회차를 텍스트로 변환해 기사로 재활용하거나 검색 노출의 토대로 삼을 수 있습니다.

지원하는 파일 형식

오디오 파일
MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM
영상 파일
MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPEG-TS・3GP(음성 트랙을 추출해 변환합니다)
내보내기 형식
TXT(텍스트)・SRT(타임코드 자막)
파일 크기 상한
파일당 최대 2 GB(스마트폰은 500 MB)
지원 언어
일본어・영어・중국어・한국어・스페인어・프랑스어・독일어・포르투갈어・러시아어・이탈리아어・인도네시아어. 자동 감지를 선택하면 목록에 없는 언어도 그대로 변환할 수 있습니다

영상 파일을 미리 음성으로 변환할 필요는 없습니다. 파일을 읽는 시점에 브라우저가 음성을 추출합니다.

클라우드형 변환 서비스와의 차이

일반적인 변환 서비스는 음성을 사업자의 서버로 보내 처리합니다. Transcriber는 모델을 브라우저 안에서 실행하므로 전제가 다릅니다.

항목일반적인 클라우드 서비스Transcriber
음성의 행방사업자의 서버로 업로드됩니다전송하지 않고 기기 안에서 처리합니다
무료 사용량보통 월 몇 분까지로 제한됩니다시간·횟수 제한이 없습니다
계정 필요 여부대부분 필요합니다필요 없습니다
오프라인 사용불가능합니다모델을 받은 뒤에는 가능합니다
속도를 좌우하는 것사업자의 서버 성능사용자 기기의 GPU / CPU

클라우드 서비스는 사양이 낮은 기기에서도 속도가 일정하다는 장점이 있습니다. 브라우저 내 처리는 녹음을 외부로 내보낼 수 없는 경우나, 사용량 제한 없이 긴 음성을 처리해야 하는 경우에 적합합니다.

자주 묻는 질문

정말 무료인가요? 시간이나 횟수 제한은 없나요?

완전히 무료입니다. 길이·횟수·글자 수 제한이 없고 신용카드도 필요 없습니다. 유일한 상한은 파일당 2 GB(스마트폰은 500 MB)이며, 그 범위 안에서는 얼마든지 사용할 수 있습니다.

음성이 서버로 업로드되나요?

아니요. Whisper AI가 브라우저 안에서 추론하므로 음성이 기기 밖으로 나가지 않습니다. 서버에 저장되지도, 제3자에게 전달되지도 않습니다.

계정을 만들거나 로그인해야 하나요?

필요 없습니다. 페이지를 열고 오디오 파일을 고르면 바로 변환이 시작됩니다. 이메일 주소를 묻지 않습니다.

어떤 파일 형식을 지원하나요?

오디오는 MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR을 지원하고 영상은 MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPEG-TS, 3GP를 지원합니다. 파일을 끌어다 놓거나 선택 창에서 고를 수 있습니다.

영상 파일도 변환할 수 있나요?

가능합니다. MP4, MOV, MKV, WebM, AVI 파일을 읽으면 브라우저가 음성 트랙만 추출해 변환합니다. 먼저 오디오 파일로 변환할 필요가 없습니다. 파일을 한 번에 모두 읽지 않고 필요한 부분만 순서대로 읽기 때문에 수 GB 영상도 그대로 처리할 수 있습니다.

화자를 구분할 수 있나요?

화자 분리를 지원합니다(베타). 회의나 인터뷰처럼 여러 명이 있는 녹음에서는 화자마다 다른 색으로 표시됩니다. 인원수를 알고 있다면 입력할 때 정확도가 크게 올라갑니다. 결과의 화자 라벨은 화면에서 이름을 바꿀 수 있고, 잘못 나뉜 화자는 병합할 수 있으며, 줄 단위로 화자를 바꾸거나 나눌 수도 있습니다.

자막 파일을 만들 수 있나요?

네. 변환 결과를 타임코드가 있는 SRT 자막으로 내보낼 수 있어 영상 편집 소프트웨어나 동영상 플랫폼에 바로 넣을 수 있습니다. 일반 텍스트(TXT) 내보내기와 클립보드 복사도 가능합니다.

오프라인에서도 동작하나요?

네. AI 모델을 한 번 내려받으면 네트워크 없이도 변환할 수 있습니다. 모델 크기는 선택에 따라 약 40 MB에서 1.6 GB 사이입니다.

정확도를 높이려면 어떻게 해야 하나요?

더 큰 모델을 고르면 정확도가 올라갑니다. WebGPU를 지원하는 환경에서는 「Whisper Large v3 Turbo」가 높은 정확도와 속도를 함께 갖춰 추천할 만합니다. 또한 「자동 감지」로 두지 말고 실제 언어를 지정하면 오인식이 줄어듭니다.

스마트폰에서도 쓸 수 있나요?

사용할 수 있지만 기기를 보호하기 위해 저메모리 모드(WASM)로 동작하고 파일은 500 MB까지로 제한됩니다. 긴 녹음이나 녹화는 PC를 권장합니다.

오류 정보를 수집하나요?

문제를 고치는 데 필요한 통계만 수집합니다. 기기 성능(GPU 유무·메모리·코어 수), 선택한 모델과 언어, 어느 단계에서 실패했는지, 오류 종류와 내용, 파일 형식과 대략적인 크기·길이가 전부입니다. 음성 데이터, 전사 결과, 파일 이름, IP 주소는 전혀 전송하지 않으며, 전송 대상도 이 사이트의 자체 서버뿐이고 외부 서비스에는 넘기지 않습니다. 페이지 하단의 ‘서비스 품질 향상에 협조를 부탁드립니다’에 있는 스위치로 언제든지 끌 수 있습니다.

서비스 품질 향상에 협조를 부탁드립니다

전사가 도중에 실패했을 때 그 상황을 보내 주시면 원인을 찾는 데 도움이 됩니다. 어떤 기기와 설정에서 자주 실패하는지 알 수 있으면 권장 설정을 재검토하고 문제를 고치는 데 반영할 수 있습니다. 괜찮으시다면 켜 둔 채로 두시면 큰 도움이 됩니다.

전송하는 정보

기기 성능(GPU 유무·메모리·코어 수), 선택한 모델과 언어, 어느 단계에서 실패했는지, 오류 내용, 파일 형식과 대략적인 크기·길이.

전송하지 않는 정보

음성 데이터, 전사 결과, 파일 이름, IP 주소. 전송 대상은 이 사이트의 자체 서버뿐이며 외부 서비스에는 넘기지 않습니다.

이 도구를 후원하기

이 도구는 개인이 개발하고 운영하고 있습니다. 후원해 주시면 서비스를 계속 운영하고 품질을 유지·개선하는 데 큰 힘이 됩니다. 어떤 형태의 후원이든 진심으로 감사드립니다.

Stripe로 후원하기