MP3 を文字起こしする
MP3 ファイルを選ぶと、Whisper AI がブラウザの中で文字に起こします。音声はサーバーへ送られません。登録も支払いも不要で、長さの制限もありません。
話者数が分かっている場合は指定すると精度が大きく向上します
MP3 を扱うときに知っておくとよいこと
MP3 は圧縮された音声形式なので、録音時のビットレートがそのまま精度に効きます。128 kbps 以上あれば通常の会話は問題なく認識できますが、64 kbps を下回るものや、電話の録音のように高い周波数が削られた音声は取りこぼしが増えます。うまくいかないときはモデルを small 以上に上げてください。
処理は端末の中だけで完結します。ファイルはアップロードされず、文字起こしの結果も外部へは送られません。会議の録音や取材の音源のように、外に出せないものをそのまま扱えます。
よくある質問
MP3 以外の音声も文字起こしできますか?
できます。WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM に対応しています。動画ファイルを選んだ場合は音声トラックだけを取り出して処理します。
ファイルサイズの上限はありますか?
1 ファイルあたり 2 GB まで、スマートフォンでは 500 MB までです。時間の制限はないので、上限に収まる長さであれば何時間の録音でも処理できます。
音声はどこかへ送信されますか?
送信されません。文字起こしは端末のブラウザ内で実行され、音声ファイルも結果のテキストも外部のサーバーへは渡りません。
文字起こしにかかる時間はどのくらいですか?
端末の性能とモデルの大きさで変わります。WebGPU が使える環境では実時間より短く済むことが多く、対応していない環境では音声の長さの数倍かかることがあります。
音声・動画の用意と、文字起こしの後に
サービス品質向上へのご協力のお願い
うまくいったときも失敗したときも、そのときの状況を送っていただけると原因の特定に役立ちます(失敗率を出すには両方が要ります)。どの端末・どの設定で失敗しやすいのかが分かれば、推奨設定の見直しや不具合の修正に反映できます。差し支えなければ、このままオンにしていただけると助かります。
送信する情報
端末の性能(GPU の種類・メモリ・コア数)、ブラウザと OS、選んだモデルと言語、どの段階まで進んだか、エラーの内容、ファイルの形式とおおよそのサイズ・長さ、処理にかかった時間。
送信しない情報
音声データ、文字起こし結果、ファイル名、IP アドレス。送信先は当サイトのサーバーのみで、外部サービスには渡しません。