将录音文件转为文字
选择录音笔或录音应用的录音文件后,Whisper AI 会在浏览器内完成转写。无需转换格式,无论录音多长都没有时长限制。音频不会发送到服务器。
该语言在较小的模型上准确率会明显下降,请选择「Whisper Small」或更大的模型
通常保持「自动」即可。仅当结果中的说话人数与实际明显不符时才需指定
录音笔录音转文字的步骤
- 用 USB 把录音笔连接到电脑,复制录音文件。用手机录音应用录下的文件,可以从分享菜单保存到云存储后取出。iPhone 语音备忘录的步骤请见「M4A 转文字」页面。
- 如果有两人以上在说话,请开启说话人分离。如果知道语言,请选择实际语言而不是自动检测。
- 选择录音文件。已确定的行会依次显示在页面上,完成后可导出为 TXT 或 SRT 格式的文件。
不同录音设备的文件格式
录音笔大多保存为 MP3 或 WAV,也有保存为 WMA 的机型。手机的录音应用会保存为 M4A、MP3、AMR 等格式。这些都可以直接读取,不需要先转换成 MP3。
对结果影响最大的是录音条件。说话人离麦克风近、空调等杂音小、多人的声音不重叠,这三点最有效。
即使是很长的录音也没有时长限制。处理过程中已确定的行会陆续显示,因此不必等到结束就能确认内容。中途关闭页面时,已经确定的文字也会保留在历史记录中。
遇到问题时
- 如果声音小或离得远的内容被漏掉,请把模型换成 Small 或更大的模型。
- 在静音较长的录音中,可能会出现没有人说过的句子。请在结果页面中删除这些行。
常见问题
支持哪些录音格式?
支持 MP3、WAV、M4A、AAC、FLAC、OGG、Opus、AIFF、WMA、AMR、WebM。选择视频文件时,只会提取音轨进行处理。
最多能转写多少小时的录音?
没有时长限制。单个文件最大 2 GB,手机端为 500 MB。手机为保护设备会以节省内存的模式运行,较长的录音建议使用电脑。
可以区分录音中的多位说话人吗?
可以。开启说话人分离后,会按说话人分行(最多 8 人)。如果是会议录音,默认已开启说话人分离的「会议记录转文字」页面更方便。
录音会被发送到别处吗?
不会。转写在设备的浏览器内完成,录音和转写结果都不会传到外部服务器。
准备音频、视频,以及转写之后
诚邀协助提升服务品质
无论成功还是失败,如果能把当时的情况发送给我们,都有助于查明原因(统计失败率需要两者兼有)。了解哪些设备、哪些设置更容易失败后,我们就能调整推荐设置并修复相应问题。如果方便,保持开启会帮上很大的忙。
会发送的信息
设备性能(GPU 型号、内存、核心数)、浏览器与操作系统、所选模型与语言、处理进行到哪一步、错误内容、文件格式和大致的大小与时长,以及处理耗时。
不会发送的信息
音频数据、转写结果、文件名和 IP 地址。数据只发送到本站自有服务器,不会交给第三方服务。