本ページはプロモーションが含まれています
無料・無制限の
AI 音声文字起こし
音声ファイルを選ぶだけで、Whisper AI がブラウザ内で文字起こし。音声データがサーバーに送られることはありません。登録不要・時間制限なしで完全無料です。
通常は「自動」のままで構いません。結果の話者数が実際と明らかに違うときだけ指定してください
使い方
- 1
音声をアップロード
MP3・WAV・M4A・FLAC など主要な形式に対応。ドラッグ&ドロップも可能。
- 2
AI が自動で文字起こし
Whisper AI がブラウザ内で推論。初回はモデルのダウンロードが必要です(選ぶモデルにより 40 MB〜1.6 GB)。
- 3
結果を書き出し
テキスト・SRT 字幕ファイルでダウンロード。話者分離にも対応。
こんな場面で使えます
録音した音声をテキストに変える作業を、ブラウザだけで完結できます。アップロード先を気にせず使えるため、社外に出せない録音にも向いています。
会議・打ち合わせの議事録
話者分離を使えば発言者ごとに色分けされるため、議事録に起こす作業がそのまま進みます。社内の録音を外部サービスに預けずに済みます。
インタビュー・取材の書き起こし
長時間の録音でも時間制限はありません。質問者と回答者を自動で分けて表示し、それぞれに名前を付けられます。
動画・YouTube の字幕作成
MP4・WebM の動画をそのまま読み込み、動画を再生しながら字幕を確認・修正して、タイムコード付きの SRT として書き出せます。変換作業は不要です。
講義・セミナーのノート化
録音した講義をテキスト化して検索できる形に残せます。専門用語が多い音声には大きめのモデルが向いています。
音声メモ・ボイスレコーダーの整理
スマートフォンで録った M4A の音声メモも、そのまま読み込んで文字に起こせます。
ポッドキャスト・配信の書き起こし
配信のアーカイブ音声をテキスト化して、記事化や検索対策の下地として使えます。
用途から選ぶ
扱うファイルや目的が決まっている場合は、こちらから始めると設定が合わせてあります。
音声・動画の用意と、文字起こしの後に
同じ運営者の別ツールです。X の配信を保存してから文字起こしする、長い録音を短くしてから読み込む、作った SRT を動画に焼き込む、といった流れをすべてブラウザ内で完結できます。
対応ファイル形式
- 音声ファイル
- MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM
- 動画ファイル
- MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPG・MPEG-TS・3GP(音声トラックを取り出して文字起こしし、結果は動画に字幕として重ねて再生できます)
- 書き出し形式
- TXT(テキスト)・SRT(タイムコード付き字幕)
- ファイルサイズ上限
- 1 ファイル 2 GB まで(スマートフォンでは 500 MB まで)
- 対応言語
- 日本語・英語・中国語・韓国語・スペイン語・フランス語・ドイツ語・ポルトガル語・ロシア語・イタリア語・インドネシア語。自動検出を選べば、これ以外の言語もそのまま文字起こしできます
動画ファイルをあらかじめ音声に変換しておく必要はありません。読み込んだ時点でブラウザ側が音声を取り出します。
選べるモデル
6 種類から選べます。大きいモデルほど精度は上がりますが、初回に取得するサイズと必要な性能も増えます。
| モデル | サイズ | 特徴 |
|---|---|---|
| Whisper Tiny | GPU 〜145 MB / CPU 〜40 MB | 高速・軽量。クリアな音声に最適 |
| Whisper Base | GPU 〜280 MB / CPU 〜75 MB | 速度と精度のバランスが良い |
| Whisper Small | GPU 〜925 MB / CPU 〜240 MB | 高精度。専門用語や難しい音声に強い |
| Whisper Medium | GPU 〜1.0 GB / CPU 〜650 MB | Small と Large の中間。高精度・大容量 |
| Whisper Large v3 Turbo | GPU 〜1.5 GB / CPU 〜725 MB | 最高精度に近く高速。WebGPU 推奨(おすすめ) |
| Whisper Large v3 | GPU 〜2.0 GB / CPU 〜1.2 GB | フル Large v3。最高精度・最大容量・低速(WebGPU 必須級) |
Medium 以上のモデルは WebGPU に対応した環境が必要です。WebGPU が使えない場合は Small までを選んでください。
動作の目安として、Windows 11 と GeForce RTX 2060 SUPER(8 GB)の組み合わせでは Whisper Large v3 まで動作しました。
クラウド型の文字起こしサービスとの違い
一般的な文字起こしサービスは、音声を事業者のサーバーへ送って処理します。Transcriber は処理そのものをブラウザ内で行うため、前提が異なります。
| 観点 | 一般的なクラウド型 | Transcriber |
|---|---|---|
| 音声データの送信 | 事業者のサーバーへアップロードする | 送信しない(端末内で処理) |
| 無料で使える量 | 月あたりの時間制限が設けられていることが多い | 時間・回数の制限なし |
| 会員登録 | 必要なことが多い | 不要 |
| オフライン利用 | できない | 初回のモデル取得後は可能 |
| 処理速度を決めるもの | 事業者側のサーバー性能 | お使いの端末の GPU / CPU |
クラウド型は非力な端末でも速度が安定する利点があります。一方で、録音内容を外部に出せない場合や、長時間の音声を制限なく処理したい場合は、ブラウザ内で完結する方式が向いています。
よくある質問
本当に無料ですか?利用時間や回数の制限はありますか?
完全無料です。利用時間・回数・文字数のいずれにも制限はなく、クレジットカードの登録も必要ありません。1 ファイルあたりの上限は 2 GB(スマートフォンでは 500 MB)で、その範囲であれば何度でもご利用いただけます。
音声ファイルはサーバーにアップロードされますか?
アップロードされません。文字起こしは Whisper AI がブラウザ内で実行するため、音声データがお使いの端末から外に出ることはありません。録音内容がサーバーに保存されることも、第三者に渡ることもありません。
会員登録やログインは必要ですか?
不要です。ページを開いて音声ファイルを選ぶだけで文字起こしを開始できます。メールアドレスの入力も求めません。
どのファイル形式に対応していますか?
音声は MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR に、動画は MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPG・MPEG-TS・3GP に対応しています。ドラッグ&ドロップでもファイル選択でも読み込めます。
動画ファイルから文字起こしできますか?
できます。MP4・MOV・MKV・WebM・AVI などの動画を読み込むと、ブラウザ内で音声トラックだけを取り出して文字起こしします。あらかじめ音声ファイルへ変換しておく必要はありません。文字起こしのあとは動画を再生しながら結果を字幕として重ねて確認・修正でき、翻訳した字幕で見ることもできます。読み込めるのは 1 ファイルあたり 2 GB まで(スマートフォンは 500 MB まで)です。 X(旧 Twitter)の動画は X Video Downloader で保存したものをそのまま読み込めます。音声だけを先に取り出したい場合は Media Tools が使えます。
誰が話したかを分けられますか?(話者分離)
話者分離に対応しています(Beta)。会議やインタビューのように複数人が話す音声で、発言者ごとに色分けして表示します。話者の人数は自動で推定するので、通常は指定しなくて構いません。結果の話者ラベルは画面上で名前を付けたり、誤って分かれた話者を統合したり、行ごとに話者を直したり分割したりできます。話者分離のモデルは、Firefox 以外のブラウザで文字起こしを WebGPU で処理し、話者数が「自動」のときは NVIDIA Nemotron 3 Diarization、それ以外のときは pyannote で、どちらの場合も声の特徴の比較に WeSpeaker を使っています。
字幕ファイルは作成できますか?
SRT 形式の字幕ファイルとして書き出せます。タイムコード付きで出力されるため、動画編集ソフトや動画投稿サイトにそのまま読み込めます。テキスト(TXT)での書き出しやコピーにも対応しています。 書き出した SRT を映像に直接焼き込みたいときは Media Tools(字幕の焼き込み)が使えます。
文字起こしの結果を翻訳できますか?
できます。結果の見出しにある「翻訳」から元の言語と翻訳先を選ぶと、各行の下に訳文が付きます。TXT / SRT は原文・翻訳・対訳のいずれかで書き出せます。動画を読み込んだ場合は、訳文を字幕として動画に重ねて再生することもできます。翻訳には Chrome 138 以降または Edge 148 以降(デスクトップ版)に内蔵された翻訳機能を使い、処理は端末内で完結するため、文字起こしテキストが外部へ送信されることはありません。スマートフォンや Firefox・Safari では利用できません。初回は言語ごとに翻訳モデルのダウンロードが必要です。
オフラインでも使えますか?
使えます。初回に AI モデルをダウンロードしたあとは、ネット接続なしで文字起こしできます。モデルの容量は選んだモデルにより約 40 MB〜1.6 GB です。
文字起こしの精度を上げるにはどうすればよいですか?
より大きいモデルを選ぶと精度が上がります。WebGPU に対応した環境では「Whisper Large v3 Turbo」が高精度かつ高速でおすすめです。また、言語を「自動検出」のままにせず実際の言語を指定すると誤認識が減ります。
スマートフォンでも使えますか?
使えます。ただし端末を保護するため省メモリモード(WASM)で動作し、読み込めるファイルは 500 MB までになります。長時間の録音・録画は PC でのご利用をおすすめします。
エラー情報の収集はしていますか?
不具合を直すための統計だけを収集しています。送信されるのは、端末の性能(GPU の種類・メモリ・コア数)、ブラウザと OS、選んだモデルと言語、どの段階まで進んだか、エラーの種類と内容、ファイルの形式とおおよそのサイズ・長さ、処理にかかった時間です。失敗率を出すために、成功したときも同じ項目を送ります。音声データ・文字起こし結果・ファイル名・IP アドレスは一切送信されず、送信先も当サイトのサーバーのみで、外部サービスには渡していません。ページ下部の「サービス品質向上へのご協力のお願い」にあるスイッチで、いつでも停止できます。
サービス品質向上へのご協力のお願い
うまくいったときも失敗したときも、そのときの状況を送っていただけると原因の特定に役立ちます(失敗率を出すには両方が要ります)。どの端末・どの設定で失敗しやすいのかが分かれば、推奨設定の見直しや不具合の修正に反映できます。差し支えなければ、このままオンにしていただけると助かります。
送信する情報
端末の性能(GPU の種類・メモリ・コア数)、ブラウザと OS、選んだモデルと言語、どの段階まで進んだか、エラーの内容、ファイルの形式とおおよそのサイズ・長さ、処理にかかった時間。
送信しない情報
音声データ、文字起こし結果、ファイル名、IP アドレス。送信先は当サイトのサーバーのみで、外部サービスには渡しません。