Buzz 离线语音转录工具:本地音频转文字与字幕,文件不离开电脑
Buzz 是一个完全离线语音转录工具,基于 OpenAI 的 Whisper 模型,把音频和视频在本地转成文字或字幕,文件不用上传到任何云端。
把 90 分钟的采访拖进窗口
你有一段 90 分钟的采访录音躺在文件夹里。点开 Buzz,点左上角的「+」,选中这个文件,选好语言和模型,点「运行」。几分钟后,状态栏变成 Completed,双击那一行,逐句带时间戳的文字稿就摆在眼前。
整个过程没有联网,录音从头到尾没离开过你的硬盘。和需要把文件传到云端的在线服务不同,Buzz 的所有识别计算都在本地完成,适合处理会议录音、采访、课程等不方便外传的内容。
本地转录,原理其实很简单
一句话:Buzz 把音频喂给运行在本机的 Whisper 模型,模型逐句输出文字和时间戳,再按需导出成 TXT、SRT 或 VTT。
它背后接了多种推理引擎,比如原生 Whisper、带 GPU 加速的 Whisper.cpp、Faster Whisper 和 Hugging Face 模型,你可以根据机器配置挑最顺的那个,支持 90 多种语言。
三步跑通第一次离线语音转录
安装:Windows 装安装包(提示安全警告时选「更多信息 → 仍要运行」),macOS 拖 .dmg 到应用程序,Linux 用 flatpak install flathub io.github.chidiwilliams.Buzz 或 sudo snap install buzz。
导入并转录:点「+」选音频或视频文件,在任务里指定语言(手动选比自动检测更准),挑一个模型,点「运行」。第一次用建议从 small 或 medium 起步。
打开结果:完成后双击任务行,就能在转录查看器里核对、搜索、播放、改文字,再导出成你要的格式。
用在工作里:采访稿与视频字幕
采访录音整理成文字稿
输入是一段采访音频。导入后选 medium 模型、手动指定语言,点「高级」里的 Initial prompt 填几个容易写错的专有名词,能明显减少错字。转录完成后在查看器里核对,需要的话用「识别说话人」把不同人的句子打上标签。最后导出 TXT,直接交给编辑。
给视频做字幕
输入是一段视频,Buzz 会自动抽出音轨再转录。生成时勾选 Word-Level Timings,然后点「Resize」,按最大长度和标点重新合并出字幕行,还能给每条字幕延长停留时间。导出 SRT 或 VTT,拖进剪辑软件就是现成的字幕。
遇到转录慢或不准时怎么办
- 遇到转录太慢:换小一号的模型(tiny、base),或改用支持 GPU 加速的 Whisper.cpp 后端;后台关掉吃资源的程序也能省出时间。
- 遇到识别不准:优先手动选对语言,把背景音重的素材开启「提取语音」,重要内容再上大一号的模型,并在 Initial prompt 里补上术语。
- 遇到 GPU 显存吃紧:在偏好里打开减少 GPU 显存占用,用量化版本的小模型替代。
- 遇到多人对话分不清:用「识别说话人」功能给每句打上标签,再把同一人的连续句子合并。
继续探索:模型、文件夹监视与命令行
模型下载与删除在「偏好 → Models」里管理,设好默认模型后日常使用更省心。想让新录音自动转录,用「偏好 → Folder Watch」指定输入目录,放入新文件即自动处理。需要脚本化批量处理时,命令行 buzz add 支持指定模型、语言、导出格式等参数。更多细节见官方文档,插件系统源码在 plugins/。
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考







