Buzz:离线转写与翻译音频的桌面工具,由 Whisper 提供支持
Buzz 的定位很朴素:把转写这件事从网页搬到本机。它由 OpenAI 的 Whisper 驱动,能在个人电脑上离线完成音频的转写与翻译,官方为几个桌面平台都提供了现成安装包,下载即用。
和调用在线接口相比,本地跑的好处很直接:录音不出本机,长文件不需要上传等进度,也不受调用次数限制。代价是要看自己机器的性能。

从文件到实时,输入方式不止一种
最常用的方式是导入文件。官方说明它支持音频与视频文件,也支持在线视频链接——界面上就能看到一条链接被直接丢进任务列表。除了导入,它还支持从麦克风做实时转写,并配了一个演示窗口,方便在会议或演讲场景把字幕投到大屏上。
录音质量不理想时,可以在转写前先做一次语音分离,官方说这能在嘈杂音频上换来更好的准确率。转写完成后,它还能在内容里识别说话人,多人采访或会议记录可以直接区分出不同的人。

输出格式与后续处理
转写结果可以导出成三种格式:纯文本、SRT 和 VTT。后两种是常见的字幕交换格式,意味着结果可以直接拖进剪辑软件做字幕,不需要手工整理时间轴。界面上还能勾选按词级时间戳输出,对精细对齐有帮助。
配套的转写查看器支持搜索、播放控制与播放速度调整,还有一套快捷键用于快速跳转。如果待处理的文件很多,可以打开文件夹监听,新文件放进去就自动开始转写;要用在脚本或流水线里,它提供了命令行接口。插件系统则留出了扩展位置,官方举例里包括自动生成摘要和批量调整转写长度。
后端与加速:按自己的显卡选
Buzz 支持多种 Whisper 后端,这是它在同类工具里比较灵活的地方。官方列出的加速方案包括面向 Nvidia 显卡的 CUDA、面向较新机型的原生支持,以及通过 Whisper.cpp 在多数显卡(含集成显卡)上启用的 Vulkan 加速。此外,它还通过 Hugging Face 支持其他同类型的 Transformer 模型族,模型可以在偏好设置里按后端分组切换,也能填自定义模型地址。
如果装的是 1.4.6 或更新的版本,并且用的是 Nvidia 显卡,可以直接在「帮助 - 关于」里安装 CUDA 加速组件,不需要自己去配环境。

装起来:几个平台各有现成安装包

官方为几个平台都准备了安装方式:macOS 提供磁盘映像安装包,Windows 提供安装程序,Linux 侧则提供 Flatpak、Snap 与 AppImage 三种分发形式,按自己的习惯挑一种即可。
需要提前知道的是,安装包没有做代码签名,安装过程中系统会给出提示,按提示选择继续就能装完。另外,官方说明当前版本对机型有要求,较早的机器可用的最后一个版本是 1.4.5。
想在命令行环境里使用,也可以走包管理器安装,装好之后以模块方式启动。这条路需要先自备 ffmpeg,并且要求 Python 3.12 环境;如果是 Nvidia 显卡并且想要 GPU 加速,还需要额外安装带 CUDA 支持的推理框架版本。
许可是 MIT
Buzz 以 MIT 许可证开源,代码公开可查,仓库的下载量已经超过一百五十万次。宽松的许可意味着把它接进自己的工作流、或者做二次开发,都不会遇到太多授权上的障碍。
它适合谁
如果你的需求是「把一批录音或视频变成文字,而且不希望它们离开本机」,Buzz 的价值就体现在这里:不需要注册账号、不需要为每次调用付费、装好即可离线工作,界面上的实时转写与文件夹监听还能覆盖会议记录与批量处理两类场景。
但它对硬件有要求,模型越大越吃显存与时间;机型兼容上也有取舍,官方已经在文档里说明了各平台的适用情况。另外,转写准确率依然取决于音频质量,再好的模型遇到嘈杂素材也建议人工过一遍再使用。
把 AI 能力做成桌面应用,好处是数据留在本地、使用不受网络限制。代价是从此性能这件事由你自己负责——这也是离线工具最现实的一面。