Buzz 离线语音转文字完整指南:5分钟上手,字幕与会议记录一步到位
Buzz 离线语音转文字完整指南:5分钟上手,字幕与会议记录一步到位
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
上周整理一份两个小时的会议录音,纠结了半天:上传云端转录怕泄密,手动听写又太折磨。最后是朋友推荐的Buzz解决了问题——一款完全免费、完全离线的语音转文字工具。它把 OpenAI 的 Whisper 模型装进了你的个人电脑,音频从导入到出稿全程不离开本地,转录、翻译、字幕制作一条龙。今天我把自己的使用过程完整整理成这篇 Buzz 使用指南,从安装到进阶玩法一次讲透。
它其实不需要联网:一次发生在硬盘上的转录
先说说 Buzz 的底层逻辑,理解了这一点,你就能明白它和市面上其他转录工具的本质区别。
市面上多数语音转文字服务把录音上传到服务器,由云端 AI 识别后再把结果发回来。Buzz 反着来:它把 Whisper 模型直接下载到你本地(首次使用约 200MB),识别运算全部在本机完成。这意味着三件事:
- 隐私有保障:会议纪要、客户访谈、商业机密,永远不会离开你的设备
- 离线可用:飞机上、地铁里、无网环境,照常转录
- 没有次数限制:不按分钟计费,转多少都是零成本
而且 Buzz 不是一个"只能跑一个模型"的封闭工具,它支持 Whisper.cpp、Faster Whisper、Hugging Face 上的 Whisper 系列模型等多个后端,还能调用 OpenAI Whisper API(联网模式,可选)。你完全可以把它当成一个可插拔的转录平台来用。
安装的四种打开方式:总有一种适合你
Buzz 的安装方式覆盖了几乎所有主流场景,这也是我最喜欢它的地方之一。
Windows 用户:从项目发布页下载安装文件,双击安装。因为安装包未签名,首次运行会弹出警告,选择"更多信息 → 仍要运行"即可。
macOS 用户:一条命令搞定:
brew install --cask buzzLinux 用户:支持 Snap 和 Flatpak 两种方式:
sudo snap install buzzPython 用户:如果你习惯命令行,可以直接从 PyPI 安装:
pip install buzz-captions python -m buzz需要说明的是,PyPI 方式要求 Python 3.12 环境,并预装 ffmpeg。如果你有 NVIDIA 显卡想跑 GPU 加速,README 里也有对应的 CUDA 安装指引。
第一次转录:从导入文件到拿到文字稿
装好之后第一次打开,你会看到一个非常清爽的主界面。别被这个朴素的样子骗了,它其实是一台功能完整的转录工作台。
主界面的任务表格清晰列出每个文件的模型、任务类型和实时状态
首次转录的流程就三步:
- 添加文件:支持导入本地音频、视频文件,甚至可以粘贴 YouTube 链接
- 选择模型与任务:下拉选择 Whisper 模型,任务类型选"转录"或"翻译"
- 点击运行:任务进入队列,状态栏实时显示进度
把文件拖进来之后,我习惯顺手选好模型再批量点运行——表格里每个文件一行,状态从 Queued(排队中)、In Progress(处理中)到 Completed(已完成)一目了然,多任务并行处理完全不慌。
关于模型怎么选,第一次用别纠结太多,记住这个经验就够:
- Tiny / Base:速度飞快,适合实时转录或先出个草稿
- Small / Medium:速度和准确度的平衡点,日常够用
- Large:准确度天花板,重要内容、专业字幕首选
转录完成后:校对、搜索与导出
转录不是终点,把结果改得能交付才是。双击任务列表里的转录结果,就进入了完整的查看器界面。
每条文本都带精确起止时间,支持边播放边校对
这个界面的价值在于,它把"转录"和"交付"之间最后一公里也补齐了:
- 时间轴对齐:每条文本都标注了精确的开始、结束时间
- 播放校对:底部播放器边放音频边核对文字,发现识别错误直接改,自动保存
- 搜索定位:长音频里找关键讨论点,搜索框一下就能跳到对应位置
- 一键导出:TXT、SRT、VTT 三种格式,字幕文件直接能用
让字幕真正能用的关键一步:Resize 智能调整
转录软件不少,但绝大多数停在"把话说对"这一步。Buzz 的 Resize 功能,则是专门解决"字幕怎么排才好看"的痛点——这也是我把它推荐给做视频的朋友时的核心理由。
Resize 与 Merge 面板可以按标点、时长、间隙自动重组字幕
比如一段 42 字符太长的字幕,直接设置目标长度后点 Resize,Buzz 会自动拆分。它还有几个很聪明的合并选项:
- 按间隙合并:检测到音频停顿超过设定阈值时,自动把相邻短句合并
- 按标点拆分:在句号、逗号处断开长句,让字幕断句更符合阅读习惯
- 按最大长度拆分:配合字符上限,保证字幕不超出一行
如果转录时开启了词级时间戳(word-level timings),Resize 甚至会用静音分析来优化字幕边界——这种细节,是很多付费工具都不给的。
进阶玩法:从录音笔到自动化流水线
用熟基本流程之后,Buzz 还能帮你把转录这件事彻底"自动化"。
实时录音转录:接上麦克风,说话的同时文字实时出现在屏幕上,还带一个适合投屏的演示窗口。做会议记录、采访整理时,会开完稿子就有了。
文件夹监控:在设置里指定一个目录,之后丢进去的任何新音频都会自动转录。配合团队协作或定期批量处理,基本就是一条全自动流水线。
多语言翻译:除了 Whisper 自带的"翻译成英文",Buzz 还支持通过 OpenAI 兼容 API 把转录结果翻译成任意语言——甚至可以接本地跑的 Ollama、LM Studio,翻译也全程离线。
说话人识别:多人对话的录音,转录后能区分不同说话人,做访谈纪要时非常实用。
在模型管理页可以下载、切换不同 Whisper 模型,还能粘贴自定义模型链接
如果你追求更极致的性能,还可以试试它的命令行接口(CLI),把转录脚本化、集成到自己的自动化流程里;对嘈杂音频,开启"语音分离"预处理能明显提升准确率。
现在就可以开始
如果你也在为录音整理头疼,或者想给视频加字幕又不想被订阅费绑架,Buzz 是目前我见过最省心的答案:免费、离线、跨平台,从装好的那一刻起,转录这件事就不再需要求人。
动手的方式很简单,clone 一份代码跑起来,或者直接按上文任一方式安装:
git clone https://gitcode.com/GitHub_Trending/buz/buzz找一份录音试试,你离拿到第一份离线字幕,只差五分钟。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考