Transcriber

浏览器内完成的
AI 语音转文字

只需选择音频文件,Whisper AI 就会在浏览器内完成转写。音频不会被发送到服务器。无需注册,没有时长限制,完全免费。

完全私密
支持离线
WebGPU 高速推理
正在检测你的运行环境…

该语言在较小的模型上准确率会明显下降,请选择「Whisper Small」或更大的模型

开启Beta

如果已知说话人数,指定后准确率会大幅提升

使用方法

  1. 1

    上传音频

    支持 MP3、WAV、M4A、FLAC 等主流格式,也可以直接拖放文件。

  2. 2

    AI 自动转写

    Whisper AI 在浏览器内进行推理。首次运行时会下载模型(根据所选模型,约 40 MB 至 1.6 GB)。

  3. 3

    导出结果

    可导出为纯文本或 SRT 字幕,并支持说话人分离。

可以用来做什么

不离开浏览器就能把录音变成文字。由于不会上传任何内容,也适合处理无法交给第三方服务的录音。

会议记录

说话人分离会用颜色区分每位参与者,转写结果已经接近一份会议纪要。内部录音不会流向外部服务器。

采访转写

录音时长没有限制。指定说话人数后,采访者与受访者的划分会更准确。

视频与 YouTube 字幕

可直接读取 MP4 或 WebM 文件,并导出带时间码的 SRT 字幕,无需事先转换。

讲座与研讨会笔记

把录下的课程保存为可检索的文字。专业术语较多的音频建议使用更大的模型。

语音备忘录

手机录制的 M4A 备忘录可以直接读取并转成文字。

播客与直播存档转写

把过往节目转成文字,可再利用为文章,或作为提升搜索曝光的基础。

支持的文件格式

音频文件
MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM
视频文件
MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPEG-TS・3GP(会提取音轨进行转写)
导出格式
TXT(纯文本)・SRT(带时间码的字幕)
文件大小上限
单个文件最大 2 GB(手机上为 500 MB)
支持的语言
日语・英语・中文・韩语・西班牙语・法语・德语・葡萄牙语・俄语・意大利语・印尼语。选择自动检测后,列表之外的语言也可以直接转写

不需要事先把视频转换成音频,文件读取时浏览器就会提取音轨。

与云端转写服务的区别

常见的转写服务会把音频发送到服务商的服务器处理。Transcriber 则在浏览器内运行模型,取舍因此不同。

对比项一般的云端服务Transcriber
音频去向上传到服务商的服务器不会发送,在你的设备上处理
免费额度通常按每月分钟数设限没有时长与次数限制
是否需要账号通常需要不需要
离线使用无法离线下载模型后即可离线
速度取决于服务商的服务器性能你自己设备的 GPU / CPU

云端服务的优势在于低配设备上也能有稳定的速度。浏览器内处理更适合录音不能外流的场景,或需要处理长音频而不想受额度限制的情况。

常见问题

真的免费吗?有时长或次数限制吗?

完全免费。时长、次数、字数都没有限制,也不需要信用卡。唯一的上限是单个文件 2 GB(手机上为 500 MB),在此范围内可以随意使用。

音频会被上传到服务器吗?

不会。Whisper AI 在浏览器内进行推理,音频不会离开你的设备,既不会保存在服务器,也不会交给第三方。

需要注册或登录吗?

不需要。打开页面选择音频文件即可开始转写,不会要求你填写邮箱地址。

支持哪些文件格式?

音频支持 MP3、WAV、M4A、AAC、FLAC、OGG、Opus、AIFF、WMA 和 AMR;视频支持 MP4、MOV、MKV、WebM、AVI、WMV、FLV、MPEG-TS 和 3GP。可以拖放文件,也可以通过文件选择框打开。

可以转写视频文件吗?

可以。读取 MP4、MOV、MKV、WebM 或 AVI 文件后,浏览器会提取其中的音轨进行转写,无需事先转换成音频文件。文件是分段读取而非一次性载入,因此数 GB 的视频也能处理。

能区分不同的说话人吗?

支持说话人分离(Beta)。会议、采访等多人录音会以不同颜色区分每位说话人。如果已知人数,填入后准确率会明显提升。结果中的说话人标签可在页面上重命名,误分开的说话人也可以合并,还可以逐行更改说话人或拆分。

可以生成字幕文件吗?

可以。转写结果能导出为带时间码的 SRT 字幕,可直接导入视频编辑软件或视频平台。也支持导出纯文本(TXT)和复制到剪贴板。

可以离线使用吗?

可以。AI 模型下载一次之后,没有网络也能进行转写。根据所选模型,体积大约在 40 MB 到 1.6 GB 之间。

怎样才能提高准确率?

选择更大的模型可以提高准确率。在支持 WebGPU 的环境中,「Whisper Large v3 Turbo」兼顾高准确率与速度,值得推荐。另外,不要停留在「自动检测」,明确指定实际语言也能减少识别错误。

可以在手机上使用吗?

可以,但为保护设备会以节省内存的模式(WASM)运行,且文件上限为 500 MB。较长的录音或录像建议使用电脑。

你们会收集错误信息吗?

仅收集修复问题所需的统计信息:设备性能(有无 GPU、内存、核心数)、所选模型与语言、在哪个环节失败、错误类型与内容,以及文件格式和大致的大小与时长。音频数据、转写结果、文件名和 IP 地址一律不会发送,数据也只发送到本站自有服务器,不会交给第三方服务。你可以随时用页面下方「诚邀协助提升服务品质」中的开关停止发送。

诚邀协助提升服务品质

转写中途失败时,若能把当时的情况发送给我们,将有助于查明原因。了解哪些设备、哪些设置更容易失败后,我们就能调整推荐设置并修复相应问题。如果方便,保持开启会帮上很大的忙。

会发送的信息

设备性能(有无 GPU、内存、核心数)、所选模型与语言、在哪个环节失败、错误内容,以及文件格式和大致的大小与时长。

不会发送的信息

音频数据、转写结果、文件名和 IP 地址。数据只发送到本站自有服务器,不会交给第三方服务。

支持这个工具

本工具由个人开发与运营。你的支持能让服务持续运行,也让我有余力维护和改进它的质量。任何形式的支持都非常感谢。

通过 Stripe 支持