Transcriber

Whisper AI を使用してブラウザ内で無制限に文字起こし

音声ファイルを選ぶと、Whisper のモデルがブラウザの中で動いて文字に起こします。Python・ffmpeg・GPU ドライバーの準備は要りません。音声はサーバーへ送られず、登録も支払いも不要です。

お使いの環境を確認しています…
有効Beta

通常は「自動」のままで構いません。結果の話者数が実際と明らかに違うときだけ指定してください

使い方

  1. モデルを選びます。初期値は端末の性能から自動で決まります。WebGPU が使える PC では Large v3 Turbo が精度と速さのつり合いが良い選択です。
  2. 言語を選びます。自動検出でも動きますが、実際の言語を指定すると誤認識が減ります。
  3. 音声か動画のファイルを選びます。読み込んだ時点で文字起こしが始まり、終わったら TXT または SRT 形式のファイルとして書き出せます。

ブラウザで動く Whisper について

Whisper は OpenAI が公開している音声認識モデルで、ふつうは Python の環境を作り、ffmpeg や GPU のドライバーを入れてから使います。このツールは同じ Whisper のモデルをブラウザで動く形式に変換したものを使い、初回にダウンロードしたモデルは 2 回目からブラウザに保存したものを読み込みます。

選べるモデルは Tiny・Base・Small・Medium・Large v3 Turbo・Large v3 の 6 つです。WebGPU が使える PC では GPU で、スマートフォンと WebGPU が使えない端末では CPU で動きます。モデルが大きいほど精度は上がりますが、ダウンロードする量とメモリの使用量も増えます。Large v3 Turbo はエンコーダーが Large v3 と同じで、デコーダーだけを小さくしたモデルなので、Large v3 に近い精度のまま速く動きます。

Whisper は無音や音楽の区間で、話していない文を書き出すことがあります。同じ文の繰り返しは自動で取り除きますが、1 回だけ出た文は残るので、結果の画面で行を削除してください。

うまくいかないとき

よくある質問

Python や GPU は必要ですか?

必要ありません。Chrome や Edge などの新しいブラウザがあれば動きます。WebGPU が使える PC では GPU で速く動き、スマートフォンや GPU が使えない端末でも CPU で動きます(時間は長くかかります)。

どのモデルを選べばよいですか?

端末の性能から自動で選んだモデルが初期値になっています。WebGPU が使える PC では Large v3 Turbo が精度と速さのつり合いが良く、スマートフォンでは Tiny か Base を選んでください。

Python 版の Whisper と同じ結果になりますか?

モデルは同じ Whisper ですが、ブラウザで動かすために軽量化しているため、細かい結果は Python 版と一致しないことがあります。

オフラインでも使えますか?

使えます。初回にモデルをダウンロードしたあとは、ネットに接続しなくても文字起こしできます。

音声・動画の用意と、文字起こしの後に

サービス品質向上へのご協力のお願い

うまくいったときも失敗したときも、そのときの状況を送っていただけると原因の特定に役立ちます(失敗率を出すには両方が要ります)。どの端末・どの設定で失敗しやすいのかが分かれば、推奨設定の見直しや不具合の修正に反映できます。差し支えなければ、このままオンにしていただけると助かります。

送信する情報

端末の性能(GPU の種類・メモリ・コア数)、ブラウザと OS、選んだモデルと言語、どの段階まで進んだか、エラーの内容、ファイルの形式とおおよそのサイズ・長さ、処理にかかった時間。

送信しない情報

音声データ、文字起こし結果、ファイル名、IP アドレス。送信先は当サイトのサーバーのみで、外部サービスには渡しません。