浏览器内完成的
AI 语音转文字
只需选择音频文件,Whisper AI 就会在浏览器内完成转写。音频不会被发送到服务器。无需注册,没有时长限制,完全免费。
该语言在较小的模型上准确率会明显下降,请选择「Whisper Small」或更大的模型
如果已知说话人数,指定后准确率会大幅提升
使用方法
- 1
上传音频
支持 MP3、WAV、M4A、FLAC 等主流格式,也可以直接拖放文件。
- 2
AI 自动转写
Whisper AI 在浏览器内进行推理。首次运行时会下载模型(根据所选模型,约 40 MB 至 1.6 GB)。
- 3
导出结果
可导出为纯文本或 SRT 字幕,并支持说话人分离。
可以用来做什么
不离开浏览器就能把录音变成文字。由于不会上传任何内容,也适合处理无法交给第三方服务的录音。
会议记录
说话人分离会用颜色区分每位参与者,转写结果已经接近一份会议纪要。内部录音不会流向外部服务器。
采访转写
录音时长没有限制。指定说话人数后,采访者与受访者的划分会更准确。
视频与 YouTube 字幕
可直接读取 MP4 或 WebM 文件,并导出带时间码的 SRT 字幕,无需事先转换。
讲座与研讨会笔记
把录下的课程保存为可检索的文字。专业术语较多的音频建议使用更大的模型。
语音备忘录
手机录制的 M4A 备忘录可以直接读取并转成文字。
播客与直播存档转写
把过往节目转成文字,可再利用为文章,或作为提升搜索曝光的基础。
支持的文件格式
- 音频文件
- MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM
- 视频文件
- MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPEG-TS・3GP(会提取音轨进行转写)
- 导出格式
- TXT(纯文本)・SRT(带时间码的字幕)
- 文件大小上限
- 单个文件最大 2 GB(手机上为 500 MB)
- 支持的语言
- 日语・英语・中文・韩语・西班牙语・法语・德语・葡萄牙语・俄语・意大利语・印尼语。选择自动检测后,列表之外的语言也可以直接转写
不需要事先把视频转换成音频,文件读取时浏览器就会提取音轨。
与云端转写服务的区别
常见的转写服务会把音频发送到服务商的服务器处理。Transcriber 则在浏览器内运行模型,取舍因此不同。
| 对比项 | 一般的云端服务 | Transcriber |
|---|---|---|
| 音频去向 | 上传到服务商的服务器 | 不会发送,在你的设备上处理 |
| 免费额度 | 通常按每月分钟数设限 | 没有时长与次数限制 |
| 是否需要账号 | 通常需要 | 不需要 |
| 离线使用 | 无法离线 | 下载模型后即可离线 |
| 速度取决于 | 服务商的服务器性能 | 你自己设备的 GPU / CPU |
云端服务的优势在于低配设备上也能有稳定的速度。浏览器内处理更适合录音不能外流的场景,或需要处理长音频而不想受额度限制的情况。
常见问题
真的免费吗?有时长或次数限制吗?
完全免费。时长、次数、字数都没有限制,也不需要信用卡。唯一的上限是单个文件 2 GB(手机上为 500 MB),在此范围内可以随意使用。
音频会被上传到服务器吗?
不会。Whisper AI 在浏览器内进行推理,音频不会离开你的设备,既不会保存在服务器,也不会交给第三方。
需要注册或登录吗?
不需要。打开页面选择音频文件即可开始转写,不会要求你填写邮箱地址。
支持哪些文件格式?
音频支持 MP3、WAV、M4A、AAC、FLAC、OGG、Opus、AIFF、WMA 和 AMR;视频支持 MP4、MOV、MKV、WebM、AVI、WMV、FLV、MPEG-TS 和 3GP。可以拖放文件,也可以通过文件选择框打开。
可以转写视频文件吗?
可以。读取 MP4、MOV、MKV、WebM 或 AVI 文件后,浏览器会提取其中的音轨进行转写,无需事先转换成音频文件。文件是分段读取而非一次性载入,因此数 GB 的视频也能处理。
能区分不同的说话人吗?
支持说话人分离(Beta)。会议、采访等多人录音会以不同颜色区分每位说话人。如果已知人数,填入后准确率会明显提升。结果中的说话人标签可在页面上重命名,误分开的说话人也可以合并,还可以逐行更改说话人或拆分。
可以生成字幕文件吗?
可以。转写结果能导出为带时间码的 SRT 字幕,可直接导入视频编辑软件或视频平台。也支持导出纯文本(TXT)和复制到剪贴板。
可以离线使用吗?
可以。AI 模型下载一次之后,没有网络也能进行转写。根据所选模型,体积大约在 40 MB 到 1.6 GB 之间。
怎样才能提高准确率?
选择更大的模型可以提高准确率。在支持 WebGPU 的环境中,「Whisper Large v3 Turbo」兼顾高准确率与速度,值得推荐。另外,不要停留在「自动检测」,明确指定实际语言也能减少识别错误。
可以在手机上使用吗?
可以,但为保护设备会以节省内存的模式(WASM)运行,且文件上限为 500 MB。较长的录音或录像建议使用电脑。
你们会收集错误信息吗?
仅收集修复问题所需的统计信息:设备性能(有无 GPU、内存、核心数)、所选模型与语言、在哪个环节失败、错误类型与内容,以及文件格式和大致的大小与时长。音频数据、转写结果、文件名和 IP 地址一律不会发送,数据也只发送到本站自有服务器,不会交给第三方服务。你可以随时用页面下方「诚邀协助提升服务品质」中的开关停止发送。
诚邀协助提升服务品质
转写中途失败时,若能把当时的情况发送给我们,将有助于查明原因。了解哪些设备、哪些设置更容易失败后,我们就能调整推荐设置并修复相应问题。如果方便,保持开启会帮上很大的忙。
会发送的信息
设备性能(有无 GPU、内存、核心数)、所选模型与语言、在哪个环节失败、错误内容,以及文件格式和大致的大小与时长。
不会发送的信息
音频数据、转写结果、文件名和 IP 地址。数据只发送到本站自有服务器,不会交给第三方服务。