使用 Whisper AI 在浏览器内无限制转写
选择音频文件后,Whisper 模型会在浏览器内运行并完成转写。不需要准备 Python、ffmpeg 或 GPU 驱动。音频不会发送到服务器,无需注册,也无需付费。
该语言在较小的模型上准确率会明显下降,请选择「Whisper Small」或更大的模型
通常保持「自动」即可。仅当结果中的说话人数与实际明显不符时才需指定
使用方法
- 选择模型。默认模型会根据设备性能自动选择。在支持 WebGPU 的电脑上,Large v3 Turbo 在精度和速度之间比较均衡。
- 选择语言。自动检测也能使用,但指定实际语言可以减少识别错误。
- 选择音频或视频文件。文件读取后即开始转写,完成后可导出为 TXT 或 SRT 格式的文件。
关于在浏览器中运行的 Whisper
Whisper 是 OpenAI 公开的语音识别模型,通常需要先搭建 Python 环境,并安装 ffmpeg 和 GPU 驱动才能使用。本工具使用的是转换成可在浏览器中运行的格式的同一 Whisper 模型。模型在首次使用时下载,之后会读取保存在浏览器中的副本。
可选模型共 6 个:Tiny、Base、Small、Medium、Large v3 Turbo 和 Large v3。在支持 WebGPU 的电脑上使用 GPU 运行,在手机和不支持 WebGPU 的设备上使用 CPU 运行。模型越大精度越高,但需要下载的数据量和占用的内存也越多。Large v3 Turbo 的编码器与 Large v3 相同,只缩小了解码器,因此能以接近 Large v3 的精度快速运行。
Whisper 在静音或音乐片段中,有时会写出没有人说过的句子。重复出现的句子会被自动删除,但只出现一次的句子会保留下来,请在结果页面中删除该行。
遇到问题时
- 如果处理中途停止,可能是设备内存不足。请换用小一级的模型,或把音频分成较短的几段。
- 如果专有名词或专业术语经常漏掉,请把模型换成 Small 或更大的模型。
常见问题
需要 Python 或 GPU 吗?
不需要。只要有 Chrome、Edge 等较新的浏览器即可运行。在支持 WebGPU 的电脑上会用 GPU 快速运行,在手机或无法使用 GPU 的设备上也能用 CPU 运行(耗时较长)。
应该选择哪个模型?
默认会根据设备性能自动选择模型。在支持 WebGPU 的电脑上,Large v3 Turbo 在精度和速度之间比较均衡;在手机上请选择 Tiny 或 Base。
结果和 Python 版 Whisper 一样吗?
模型同样是 Whisper,但为了在浏览器中运行做了轻量化处理,因此细节上的结果可能与 Python 版不一致。
可以离线使用吗?
可以。模型下载一次之后,没有网络也能进行转写。
准备音频、视频,以及转写之后
诚邀协助提升服务品质
无论成功还是失败,如果能把当时的情况发送给我们,都有助于查明原因(统计失败率需要两者兼有)。了解哪些设备、哪些设置更容易失败后,我们就能调整推荐设置并修复相应问题。如果方便,保持开启会帮上很大的忙。
会发送的信息
设备性能(GPU 型号、内存、核心数)、浏览器与操作系统、所选模型与语言、处理进行到哪一步、错误内容、文件格式和大致的大小与时长,以及处理耗时。
不会发送的信息
音频数据、转写结果、文件名和 IP 地址。数据只发送到本站自有服务器,不会交给第三方服务。