ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Buzz 离线语音转写完整指南:从安装到 GPU 加速只需 10 分钟

Buzz 离线语音转写完整指南:从安装到 GPU 加速只需 10 分钟 Buzz 离线语音转写完整指南从安装到 GPU 加速只需 10 分钟【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款运行在你自己电脑上的免费离线音频转写工具内置 OpenAI Whisper 模型支持 Whisper.cpp、Faster-Whisper 和 Hugging Face 多种后端无需联网即可将录音、播客或视频音轨转成带时间戳的文字稿。本指南面向第一次接触 Buzz 的用户带你完成安装、首次转写、模型选择和性能调优。为什么本地转写值得投入 隐私是本地转写最直接的收益你的音频文件永远不出电脑不存在上传到第三方服务器的风险。其次是零成本——模型一次下载后永久免费使用没有按分钟计费的焦虑。Buzz 同时支持 NVIDIA GPUCUDA、Apple Silicon 和集显Vulkan即使没有独立显卡也能跑出可用的速度。与在线转写服务对比维度在线服务Buzz 本地转写隐私音频上传到服务器文件不出本机费用按时长/次数计费免费模型一次下载网络依赖必须联网完全离线可用语言支持取决于服务商90 种语言三种安装方式选一个适合你的Buzz 提供三种安装途径根据你熟悉的系统选择即可。方式一图形安装包推荐新手前往 SourceForge 下载对应系统的安装包macOS 是.dmgWindows 是安装程序。Windows 安装包未签名安装时系统会弹出安全提示点击「更多信息」→「仍要运行」即可。方式二Linux 包管理器flatpak install flathub io.github.chidiwilliams.Buzz这条命令通过 Flatpak 从 Flathub 仓库安装 Buzz不需要手动编译。如果你更习惯 Snap也可以运行sudo snap install buzz。方式三pip 从源码安装先确保系统已安装 ffmpeg 并使用 Python 3.12 环境然后执行pip install buzz-captions python -m buzzpip install从 PyPI 拉取 Buzz 包及其依赖python -m buzz启动图形界面。适合想要跟踪最新开发版本的用户。第一次转写导入音频、选模型、点开始打开 Buzz 后你会看到上面这样的任务列表界面。第一次转写只需三步导入音频。点击工具栏上的「」按钮在文件选择器中挑选 MP3、WAV、FLAC、M4A 等格式的音频或视频文件。Buzz 也支持直接粘贴 YouTube 链接导入。选择模型和语言。在导入对话框里从下拉列表选择 Whisper 模型首次使用建议选base或small指定音频语言或留空让 Buzz 自动检测。任务类型选「Transcribe」做同语言转写选「Translate to English」则把外语翻译成英文。点击 OK 开始转写。任务加入队列后进度条会实时更新。完成后双击任务行即可打开转写查看器。转写查看器支持按段落播放、调速和文字搜索适合边听边校对。模型怎么选大小、后端与 GPU 加速Buzz 内置四种本地模型后端各有侧重Whisper.cpp纯 C 实现CPU 上表现稳定支持量化如q5、q8降低内存占用。Faster-Whisper基于 CTranslate2 的优化版GPU 加速下速度明显快于原版 Whisper。Whisper原版PyTorch 实现生态兼容性最好。Hugging Face Whisper 类型支持 Whisper 之外的其他 Transformer 语音模型。打开首选项Ctrl/Cmd ,→「Models」标签页可以下载、删除和切换模型。模型大小怎么选模型适用场景大致内存需求tiny快速草稿、低配设备~1 GBbase / small日常会议、播客~2 GBmedium高质量转写~5 GBlarge-v3专业级、多语言混合~10 GBGPU 加速要点NVIDIA 显卡用户安装 Buzz 时注意选择带 CUDA 支持的 PyTorch 版本Apple Silicon 用户自动使用 Metal 后端其他 GPU包括集显可以通过 Whisper.cpp 的 Vulkan 支持获得加速。如果在首选项「General」中勾选「Reduce GPU RAM」Buzz 会对模型做 8 位量化以少量精度损失换取更低的显存占用。实时录音与演示模式Buzz 不只能转写文件还支持麦克风实时转写。点击工具栏的录音按钮Buzz 会持续监听麦克风并将语音实时转成文字。这个功能在两个场景特别有用会议记录开着 Buzz 开会结束后直接拿到完整文字稿。现场演讲启用「Presentation Window」演示窗口实时字幕会放大显示在独立窗口中可以投屏给观众看。实时转写还有三种模式在末尾追加、在顶部追加、以及「追加并修正」会回溯修正上一句的错误但更耗资源。导出与后处理从文字稿到字幕文件转写完成后右键任务行可以选择导出格式TXT纯文本适合快速浏览。SRT / VTT带时间戳的字幕文件可直接拖进视频编辑器或视频播放器。Buzz 还提供几个实用的后处理功能说话人识别自动区分录音中不同人的发言在文字稿前加上说话人标签。语音分离在转写前先用 Demucs 把混叠的人声分开适合多人重叠说话的嘈杂录音。段落重新分段Resize手动拖拽调整段落边界让时间戳更贴合实际语句节奏。提速的隐藏设置项Buzz 的部分高级参数不暴露在图形界面上而是通过环境变量控制。在启动 Buzz 之前设置这些变量即可生效变量作用示例BUZZ_WHISPERCPP_N_THREADS控制 Whisper.cpp 使用的 CPU 线程数默认是核心数的一半。笔记本上设成略低于核心数通常有 15% 左右提速。BUZZ_WHISPERCPP_N_THREADS8BUZZ_FORCE_CPU强制使用 CPU 而非 GPU适合旧显卡反而比 GPU 更快的情况。BUZZ_FORCE_CPUtrueBUZZ_REDUCE_GPU_MEMORY对模型做 8 位量化降低显存占用。BUZZ_REDUCE_GPU_MEMORYtrueBUZZ_MODEL_ROOT自定义模型文件的存储目录方便统一管理。BUZZ_MODEL_ROOT/data/models以 macOS / Linux 为例可以写一个启动脚本run_buzz.sh在里面export这些变量再调用buzzWindows 下则用run_buzz.bat配合set命令。常见坑与解决思路转写速度慢先确认是否启用了 GPU 加速查看系统监控里 GPU 使用率如果显存紧张勾选「Reduce GPU RAM」或换小一号的模型CPU 用户可以适当调低BUZZ_WHISPERCPP_N_THREADS。模型下载失败Buzz 默认从 Hugging Face 拉取模型文件。如果网络不稳定可以手动下载.bin或.ct2模型文件然后在 Whisper.cpp 的模型选择里选「Custom」粘贴文件的本地路径或直链 URL。转写结果不准确换更大的模型通常是最有效的办法其次检查音频信噪比嘈杂环境下可以先用语音分离功能对于专业术语较多的录音在转写选项里填写initial_prompt一段提示文字帮助模型锁定领域词汇。下一步想深入了解 Buzz 的更多能力可以从项目文档入手docs/docs/ 目录下的cli.md讲命令行自动化faq.md汇总了高频问题。插件系统源码在 buzz/plugins/目前包含 AI 摘要生成、Docx 导出、自动跳过已转写文件等扩展适合有定制需求的用户参考。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表