
Buzz 离线语音转录工具深度解析从本地 Whisper 配置到播客后期的完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线语音转录与翻译工具支持 Whisper.cpp、Faster-Whisper 等多种后端。它的最大亮点所有音频处理都在本地完成隐私零泄露。项目速览定位离线音频/视频转录 翻译工具GUIPyQt6与 CLI 双形态技术栈Python Whisper 多后端buzz/model_loader.py中定义了 whisper、whispercpp、fasterwhisper、huggingface、openaiapi 五种模型类型核心卖点完全本地化运行、实时录音与演示窗口、说话人识别、插件系统硬件友好Nvidia GPUCUDA、Apple Silicon、集显 Vulkan 加速均有一等公民待遇输出TXT / SRT / VTT 三种格式支持字幕合并与逐句编辑为什么需要它如果你是做播客、录网课或者带客服团队的人大概率被这三件事折磨过敏感录音不敢上云。商业转录服务要把音频传到服务器内部讨论、用户访谈这类内容一旦外流就是事故。Buzz 把模型拉下来跑在本机文件不出机器。在线服务又贵又不稳定。按分钟计费的转录服务量大以后账单很难看断网、限流还会让工作流卡死。本地推理一次性的只有算力成本。拿到字幕只是第一步。真正的痛点在后期时间戳要调、多说话人要分清、格式要转。Buzz 把转录、查看、编辑、导出、翻译串成了一条完整流水线而不只是转个文字。对这三点的回应直接体现在它的架构上——这也是下面拆解的重点。快速上手安装按平台走最短路径macOS下载.dmg安装包Windows安装程序未签名首次安装时选More info→Run anywayLinuxflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz源码安装需 Python 3.12 和 ffmpeggit clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install buzz-captions python -m buzz首次启动建议先配置三件事模型选择在偏好设置的 Models 页签buzz/widgets/preferences_dialog/models_preferences_widget.py对应界面选后端与规格。日常用tiny或base足够快追求精度上large-v3兼顾速度精度可以看large-v3-turbo。模型下载后缓存在~/.cache/BuzzLinux偏好界面里有 Show file location 可直接跳转。输出路径General 页签里设置导出目录建议单独建一个 transcripts 文件夹文件名模板支持变量占位。GPU 加速有 Nvidia 卡≥6GB 显存就切到 Faster Whisper 后端速度差距是量级的PyPI 安装的版本需要额外装 CUDA 版 torchREADME 里有现成命令。核心能力拆解多后端模型层按需切换算力转录引擎抽象在buzz/transcriber/目录每个后端一个实现文件whisper_file_transcriber.py、whisper_cpp.py、local_whisper_cpp_server_transcriber.py等。model_loader.py里用枚举统一了模型规格LARGEV3TURBO这类新规格都收在一张表里带预估下载体积。实际选型经验CPU 环境优先 Whisper.cpp显存充足选 Faster WhisperOpenAI 原版最稳但吃内存。实时录音 演示窗口直播场景区别于同类buzz/recording.py负责音频采集recording_transcriber.py做流式分段识别而widgets/presentation_window.py提供一个独立的全屏大字窗口——开会、演讲、直播时开一个窗口实时滚动字幕观众视角非常舒服。这是纯命令行工具给不了的体验。说话人识别多人对话不再一锅粥仓库里带了一个whisper_diarization/子模块Whisper 声纹聚类方案GUI 入口在widgets/transcription_viewer/speaker_identification_widget.py转写完成后点一下即可给每个段落标注 Speaker 1 / Speaker 2访谈和会议内容整理效率明显不同。插件系统不改核心代码就能扩展流水线buzz/plugins/manager.py中的PluginManager是统一注册中心插件可以挂两个钩子转录前处理源音频、转录后改写文本段落还能声明 pip 依赖自动安装、生成配置界面。仓库内置了ai_summaryAI 摘要、transcript_resizer、export_docx、deep_filter_net降噪等插件都在buzz/plugins/下。Help → Plugins 里支持用 zip 地址直接装第三方插件。实战演练场景一播客后期——一条 60 分钟音频到成品字幕操作把节目 MP3 拖进主界面模型选large-v3勾选 SRT 输出。跑完后打开转录查看器用 Resizer 面板按间隔合并过碎的短句、或按标点拆长句对应widgets/transcription_viewer/transcription_resizer_widget.py对个别错字直接双击段落文本修改。效果查看器里搜索、跳转、调速播放一应俱全改完的字幕直接导出时间戳自动跟着文本编辑重算不用手对轴。小贴士播客多人对谈先跑一次说话人识别再导出 SRT剪辑软件里可以按说话人区分颜色。场景二网课录音整理——文件夹监控自动转录操作General 偏好里开启 Folder Watch指向课程录音目录。以后每往文件夹里丢一个新 MP4/MP3Buzz 就自动排入转录队列配合内置的skip_already_transcribed插件重复放入的文件会自动跳过。效果一周 5 节录播课周五下班前目录里已经躺着 5 份整理好的 TXT 文稿全程没开过一次 GUI。小贴士批量场景下 CLI 更顺手python -m buzz add支持--srt --vtt --txt多格式同时输出、-d指定输出目录写进 crontab 或 CI 都行。场景三客服质检——术语纠错 翻译双语存档操作质检团队用中文录音但主管要看英文版本。任务选translate或先转录再翻译关键是在初始提示词initial prompt里塞进业务术语比如产品名称、系统代号Whisper 会顺着提示纠正专有名词。效果一段中文客服录音出来的是带时间戳的英文文本TXT 直接进质检工单系统双语留档成本接近零。小贴士提示词在widgets/transcriber/initial_prompt_text_edit.py对应的输入框里配置写两三个高频术语即可别贪多。进阶调优与实用技巧字级时间戳CLI 加--word-timestamps定义在buzz/cli.py的word_timestamp_option输出会细到每个词的开始/结束时间做卡拉OK式歌词或逐词高亮字幕时很有用。转录前语音分离嘈杂音频加--extract-speechBuzz 会先用 Demucs 把人声从背景里抽出来再转录仓库根目录有demucs_repo/多人混响场景的准确率提升肉眼可见。插件依赖免手工安装PluginManager在加载插件时会自动把声明的 pip 依赖装进用户缓存/Buzz/plugins_deps/见buzz/plugins/manager.py的_install_deps_if_needed写插件时在 metadata 里声明依赖即可不用让用户跑 pip。降噪插件替代手工预处理不想手动跑 ffmpeg 降噪直接用内置deep_filter_net插件挂在转录前钩子上效果比传统滤波更适合人声场景。生态与社区代码组织清晰buzz/transcriber/是引擎层buzz/widgets/是全部 Qt 界面buzz/db/用 SQLite 做任务与段落持久化tests/覆盖了从 DAO 到 GUI 的各层贡献前看CONTRIBUTING.md即可。国际化做得比较到位buzz/locale/下有 15 种语言的.po文件插件侧也有独立的locale/*.json翻译机制加一门语言只需要补两个目录的文件。贡献入口有三条提交代码 PR、翻译.po文件、以及写插件buzz/plugins/AGENTS.md是插件开发者的完整契约文档钩子、配置字段、本地化都写了。常见问题Q模型文件存在哪里能手动管理吗ALinux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。Preferences → Models 里有 Show file location 按钮直接打开目录可以手动备份或删除模型。Q想转录电脑里其他应用发出的声音系统音频怎么办A需要虚拟声卡macOS 用 BlackHole、Windows 用 VB CABLE、Linux 用 PulseAudio 的配置把应用输出接到虚拟设备再在 Buzz 录音源里选它即可。官方 FAQ 里就是这么写的。Qlarge-v3 偶尔幻觉编造音频里没有的词选哪个模型好Alarge-v2在很多语言上更稳large-v3精度上限更高但偶尔会幻觉turbo是速度和精度的折中。官方建议没有万能答案用你自己的语言实际跑一轮对比最靠谱。QWindows 安装提示程序未签名安全吗A是开发者未购买代码签名证书属正常现象。从官方发布渠道SourceForge下载即可安装向导里选More info→Run anyway放行。QCLI 能挂到定时任务里批量跑吗A可以。python -m buzz add 文件列表 --srt --vtt --txt -d 输出目录是完整的无交互用法配合--hide-gui隐藏主窗口写进 shell 脚本或 cron 就是自动化管线。总结技术上多后端模型层加本地化推理让它同时覆盖了精度、速度和隐私三个诉求体验上从队列、查看器、Resizer 到演示窗口整条工作流都在 GUI 里闭环不用碰命令行也能用满功能生态上插件契约文档、15 种语言本地化和分层测试体系说明它是一个可持续投入而非一次性玩具的开源项目。如果你手边有还没整理的录音现在就可以开始git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install buzz-captions python -m buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考