ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Buzz:3 分钟上手的免费离线音频转录工具,把 Whisper 装进你的电脑

Buzz:3 分钟上手的免费离线音频转录工具,把 Whisper 装进你的电脑 Buzz3 分钟上手的免费离线音频转录工具把 Whisper 装进你的电脑【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线音频转录工具基于 OpenAI 的 Whisper 语音识别模型把音频、视频里的说话内容转成可编辑的文字和字幕整个过程完全在你的电脑上完成不花一分钱也不需要把文件上传到任何服务器。如果你经常要处理会议录音、课程录像或访谈音频这篇文章会带你走一遍从安装到导出的完整流程并回答几个新手最常问的问题真的能完全离线吗转录太慢怎么办识别错了能不能改安装 Buzz 离线转录工具Windows、macOS、Linux 三步到位Buzz 支持三大平台普通用户直接下载官方安装包即可不用自己配环境Windows下载 .exe 安装包。装的时候系统会弹出未知发布者警告因为应用未签名点更多信息→仍然运行即可。macOS下载 .dmg 镜像。注意当前版本要求 Apple Silicon 芯片Intel 老款 Mac 最后一个可用版本是 1.4.5。Linux一条命令装 Flatpak 版或走 Snap 商店flatpak install flathub io.github.chidiwilliams.Buzz习惯命令行的用户也可以用 pip 安装需要 Python 3.12 和 ffmpegpip install buzz-captions python -m buzz装好后打开应用你会看到一个任务列表界面——所有转录任务都在这里排队、显示进度、存放结果这就是 Buzz 的主界面。详细步骤可参考仓库里的安装文档。第一次转录从丢进音频到导出字幕只需 4 步第一次使用不需要任何配置跟着做就行点工具栏的图标或按 Ctrl/Cmd O导入一个音频或视频文件甚至可以直接粘贴一个 YouTube 链接选择任务转录还是翻译成英文、选择语言——官方建议手动指定语言自动检测偶尔会跑偏选一个模型不确定就选默认点Run状态变成 Completed 后双击那一行就进入了转录查看器。查看器里可以边播放边校对逐句高亮、点击跳转、调节播放速度还能全文搜索关键词。确认无误后可以导出为TXT、SRT视频字幕、VTT网页字幕三种格式默认保存在原音频旁边。转录结果不理想时还有几个微调旋钮说话人识别点 Identify speakersBuzz 会把不同人的话标上不同标签还能试听某位说话人的原声、把自动标签改成本名。多人访谈和会议录音从此不用猜这句话是谁说的Intel 版 macOS 暂不支持此功能。初始提示词Initial prompt在 Advanced 里填入人名、专业术语等容易听错的词能显著减少同类错误的出现。先分离人声再转录嘈杂音频可开启语音分离先把背景音剥掉再送进识别模型。这几项的用法分别写在说话人识别和文件导入文档里。转录太慢换 Whisper 引擎和模型尺寸的取舍指南Buzz 内置了 4 种 Whisper 推理引擎选对组合同一台电脑上的速度能差好几倍Whisper.cppC 实现的优化版本兼容几乎所有 GPU包括集成显卡没有显卡也能跑 CPU是 MacBook 和普通笔记本的首选现代轻薄本甚至能实时转写Faster Whisper速度比原版快一个数量级但要求 N 卡显卡显存至少 6GB原版 Whisper准确但慢、吃内存一般不建议HuggingFace走 Transformers 生态好处是能加载社区为特定语言优化的模型还支持 Meta 的 MMS 多语言模型覆盖 1000 语言。模型尺寸从 tiny 到 large 依次增大小模型快但错得多大模型准但慢。官方 FAQ 给的经验是拿自己的语言把几个候选模型各测一遍比任何理论对比都靠谱。模型在帮助 → 偏好设置 → 模型里一键下载和删除选完引擎后在这里勾选对应尺寸即可。新手常见问题能离线吗、识别错了改不了吗没有网络还能用吗能。识别模型和音频处理全程都在本机唯一需要联网的环节是首次下载模型。如果目标电脑完全断网可以在有网的机器上下载模型后拷过去——模型默认存放在用户缓存目录Linux 为~/.cache/Buzz在偏好设置 → 模型页点显示文件位置即可定位仓库里的 scripts/download-models.py 脚本可以提前帮你准备好整套模型缓存。识别错了能救吗能。转录查看器里每句文字都可直接编辑改完再导出就是最终版本时间戳不对也能在段落编辑器里调整。做字幕的话开启字级时间戳后再用 Resize 功能可以按最长字符数、标点位置自动把长句切成一行行短字幕还能给每条字幕末尾统一加几秒停留时间细节见编辑与调整文档。能批量处理吗能。两个办法一是设置监听文件夹把文件丢进去自动开始转录二是用命令行一条命令处理整个文件夹buzz add --srt --output-directory ./subtitles recordings/*.mp4命令行还支持翻译任务、指定模型、指定语言等参数完整参数见 CLI 文档。顺手装上的 5 个内置插件Buzz 1.4.5 起内置了插件系统帮助 → 插件里开关和排序有 5 个开箱即用的插件都是围绕转录流水线的AI Summary转录完成后调用 OpenAI 兼容接口也支持 Ollama 这类本地服务生成摘要写进转录的 Notes 字段或存成文本文件——2 小时会议录音直接变成一份要点小结Skip Already Transcribed重新导入或监听文件夹时自动跳过已经转过的文件省掉重复计算Export to DOCX把转录稿导出成 Word 文档可带时间戳Resize Transcript转录完自动把字级片段合并成字幕大小的短句Enhanced Language Detection用本地 tiny 模型先判断语言再转录适合语言不明的文件。插件机制本身也开放社区插件可以用一个.zip链接直接导入插件源码就是写自己插件的模板。更多功能细节实时录音、文件夹监听、偏好设置都可以查阅官方文档。从丢文件到出字幕Buzz 把 Whisper 的能力封装成了一个普通人也能用的桌面工具文件不出电脑费用只有电费。装好它你手边那堆一直没空整理的录音随时可以开工。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表