免费软件专题
免费语音转文字工具
这些工具跑的是同一批 Whisper 模型,所以中文准不准取决于你选多大的模型,不取决于你用哪个工具。真正的差别在形态:有的是引擎(命令行/库),有的是桌面应用(拖文件就转),还有一个专做字幕(词级时间戳 + 说话人分离)。这个专题按「你缺哪一层」来分,所有数字截至 2026 年 8 月,可在各自仓库核对。
5 个精选推荐
怎么挑
- 完全免费,核心功能没有次数或时长限制。
- 可以完全离线运行,音频不上传到任何服务器。
- 不需要注册账号。
- 协议按实际 LICENSE 文件标注,不采信仓库页的自动识别。
推荐工具
常见问题
- 中文识别哪个最准?
- 这个问题问错了对象。五个工具跑的是同一批 Whisper 模型,同样用 large-v3,出来的文字是一样的。准不准取决于你选多大的模型:tiny 只有 75 MiB 但错字多,medium 要 1.5 GiB,large-v3 要 2.9 GiB。机器一般的话优先试 large-v3 的量化版,只有 1.1 GiB。
- 不想碰命令行选哪个?
- Vibe 或 Buzz,都是装完拖文件进去就能转的桌面应用。硬盘紧张选 Vibe(Windows 43.2 MB、macOS 39.8 MB),要批量处理和更多导出格式选 Buzz(macOS ARM64 版 449 MB)。
- 要做字幕、还要区分谁在说话呢?
- whisperX。它在 Whisper 之上加了词级时间戳和说话人分离,是这几个里唯一开箱具备这两项的。代价是依赖链长,装起来比较折腾。
- faster-whisper 还能用吗?
- 能用,但要知道它维护停滞了:最后一次提交是 2025 年 11 月 19 日,最新版 v1.2.1 发布于 2025 年 10 月 31 日,315 个 issue 未关闭。仓库没归档,已有项目继续用没问题;要接进长期维护的东西,建议改用 whisper.cpp。