Whisper AI を使用してブラウザ内で無制限に文字起こし
音声ファイルを選ぶと、Whisper のモデルがブラウザの中で動いて文字に起こします。Python・ffmpeg・GPU ドライバーの準備は要りません。音声はサーバーへ送られず、登録も支払いも不要です。
通常は「自動」のままで構いません。結果の話者数が実際と明らかに違うときだけ指定してください
使い方
- モデルを選びます。初期値は端末の性能から自動で決まります。WebGPU が使える PC では Large v3 Turbo が精度と速さのつり合いが良い選択です。
- 言語を選びます。自動検出でも動きますが、実際の言語を指定すると誤認識が減ります。
- 音声か動画のファイルを選びます。読み込んだ時点で文字起こしが始まり、終わったら TXT または SRT 形式のファイルとして書き出せます。
ブラウザで動く Whisper について
Whisper は OpenAI が公開している音声認識モデルで、ふつうは Python の環境を作り、ffmpeg や GPU のドライバーを入れてから使います。このツールは同じ Whisper のモデルをブラウザで動く形式に変換したものを使い、初回にダウンロードしたモデルは 2 回目からブラウザに保存したものを読み込みます。
選べるモデルは Tiny・Base・Small・Medium・Large v3 Turbo・Large v3 の 6 つです。WebGPU が使える PC では GPU で、スマートフォンと WebGPU が使えない端末では CPU で動きます。モデルが大きいほど精度は上がりますが、ダウンロードする量とメモリの使用量も増えます。Large v3 Turbo はエンコーダーが Large v3 と同じで、デコーダーだけを小さくしたモデルなので、Large v3 に近い精度のまま速く動きます。
Whisper は無音や音楽の区間で、話していない文を書き出すことがあります。同じ文の繰り返しは自動で取り除きますが、1 回だけ出た文は残るので、結果の画面で行を削除してください。
うまくいかないとき
- 途中で止まる場合は、端末のメモリが足りていない可能性があります。1 つ小さいモデルに切り替えるか、音声を短く分けてください。
- 固有名詞や専門用語の取りこぼしが多い場合は、モデルを Small 以上に上げてください。
よくある質問
Python や GPU は必要ですか?
必要ありません。Chrome や Edge などの新しいブラウザがあれば動きます。WebGPU が使える PC では GPU で速く動き、スマートフォンや GPU が使えない端末でも CPU で動きます(時間は長くかかります)。
どのモデルを選べばよいですか?
端末の性能から自動で選んだモデルが初期値になっています。WebGPU が使える PC では Large v3 Turbo が精度と速さのつり合いが良く、スマートフォンでは Tiny か Base を選んでください。
Python 版の Whisper と同じ結果になりますか?
モデルは同じ Whisper ですが、ブラウザで動かすために軽量化しているため、細かい結果は Python 版と一致しないことがあります。
オフラインでも使えますか?
使えます。初回にモデルをダウンロードしたあとは、ネットに接続しなくても文字起こしできます。
音声・動画の用意と、文字起こしの後に
サービス品質向上へのご協力のお願い
うまくいったときも失敗したときも、そのときの状況を送っていただけると原因の特定に役立ちます(失敗率を出すには両方が要ります)。どの端末・どの設定で失敗しやすいのかが分かれば、推奨設定の見直しや不具合の修正に反映できます。差し支えなければ、このままオンにしていただけると助かります。
送信する情報
端末の性能(GPU の種類・メモリ・コア数)、ブラウザと OS、選んだモデルと言語、どの段階まで進んだか、エラーの内容、ファイルの形式とおおよそのサイズ・長さ、処理にかかった時間。
送信しない情報
音声データ、文字起こし結果、ファイル名、IP アドレス。送信先は当サイトのサーバーのみで、外部サービスには渡しません。