免费工具 · 在你的设备上
免费音频、视频转文字
把音频或视频文件中说的话转成文字:语音消息、采访、讲座或一集播客。转写使用你设备上的 Whisper 完成;检查文字后,可复制,或下载为 TXT(按段落或带时间戳)或 SRT。
- 免费,需要免费账号
- TXT 和 SRT
- 你的音频绝不会离开你的设备
- 添加你的音频或视频
- 转写
- 检查并下载
使用方法
三个步骤。
添加你的音频或视频
带语音的 MP3、WAV、M4A、OGG、MP4、WebM 或 MOV,最长 10 分钟。选择语言:西班牙语、英语或自动检测。
转写
点击「转写成文字」。首次使用时模型会下载;之后在较新的电脑上,耗时大约与音频时长相当。
检查并下载
修正文字后,可复制,或下载按段落或带时间戳的 TXT,以及按句子分段的 SRT。
下一步
继续使用这些工具
转写成文字:常见问题
转写有多准确?
在语音清晰、噪声很小的情况下,它通常能识别出大部分词语。对人名、背景音乐、浓重口音或重叠的声音可能出错,而且它不会区分说话人。使用前请检查文字。
适用于 WhatsApp 语音消息吗?
可以,只要你的浏览器能播放该文件(语音消息通常是 OGG 或 OPUS,Chrome、Edge 和 Firefox 可以读取)。先把它保存到你的设备,再在这里添加。
如果我的音频超过 10 分钟怎么办?
把它剪成最长 10 分钟的几段,并逐段转写。最长 15 分钟的音频文件可以直接在这里用我们的 MP3 剪切工具剪切;视频或更长的音频,请在手机相册或你的编辑器中剪切(「剪辑视频」同样限制在 10 分钟以内)。这一限制能让它在手机上也运行良好。
转写是由什么完成的?
Whisper(OpenAI 的语音识别模型,权重采用 MIT 许可)由 transformers.js(Apache 2.0 许可)在你的浏览器中运行,与我们的「自动字幕」工具使用的是同一个。首次使用时会下载模型(「普通」约 77 MB,「高」约 250 MB),并由你的浏览器保存。
我的音频会上传到服务器吗?
不会。音频在你的浏览器中读取并转写,不会发送给 Cocuyo 或任何第三方。只有语音模型会从我们的服务器下载一次。
真的免费吗?
是的。注册前就可以试用;如需继续使用,我们会请你创建一个免费账号,无需订阅。不消耗积分,也不占用你的 30 次欢迎使用次数:使用次数不限。
有哪些限制?
一个最大 300 MB、10 分钟、浏览器能播放的音频或视频文件。转写在设备上进行:在手机上可能比在电脑上慢得多。
了解如何……
更多免费工具
其他音频工具
全部免费工具
当你想要创作时
用 AI 创建声音和旁白。
Cocuyo 工作室汇集了 30 多个图像、视频和语音 AI 模型。生成前你会看到积分费用,积分永不过期。





