
Buzz 离线音频转录实战如何把本地录音免费转成文字稿和 SRT 字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、课堂音频、采访素材都存在一个共同的麻烦文件躺在本地却往往因为内容敏感、不便上传或者单纯不想为在线服务付费而迟迟没法变成可检索的文字。Buzz 是一款跑在你自己电脑上的本地音频转录工具基于 OpenAI 的 Whisper 模型把语音识别和字幕生成这件事放在离线环境里完成——不依赖云端也不产生按分钟计费的账单。它是一款什么工具适合谁用Buzz 的核心工作方式很简单读取你指定的音频或视频文件也支持麦克风实时输入用本地的 Whisper 模型推理出文本再按段落切分并带上时间戳最后导出成 TXT、SRT 或 VTT 文件。它不上传音频处理过程全部在本地完成支持 Windows、macOS 和 Linux并可在 NVIDIA 显卡上启用 CUDA、在 Apple Silicon 上做优化也能通过 Whisper.cpp 后端借助 Vulkan 使用各类 GPU 甚至核显。它的定位是单人本地的批处理工具而不是一个多用户协作平台。需要说清楚两处边界第一除 OpenAI API 这一后端外它是纯离线的而一旦选用该后端就需要联网和密钥第二模型越大、音频越长处理时间越长它不会即时返回更适合丢进去、等结果、批量跑的节奏。安装与首次运行三个平台的安装路径各有不同按自己系统选最快的一条macOS从 SourceForge 下载.dmg拖入应用程序目录即可。Windows从 SourceForge 下载安装包。由于程序未做签名安装时系统会弹出警告点更多信息再选仍要运行。Linux以 Flatpak 或 Snap 形式提供一条命令即可装好例如flatpak install flathub io.github.chidiwilliams.Buzz。通过 Python 安装需要先装好 ffmpeg再用 Python 3.12 环境执行pip install buzz-captions之后以python -m buzz启动。若想让 PyPI 版本用上 NVIDIA 显卡还需额外安装带 CUDA 的 PyTorch 与对应 CUDA 运行库。首次启动时它会提示你选择默认后端、模型与语言。界面是一个任务表每行代表一个待处理文件或录音任务右侧可以单独设置参数底部有全局设置入口。把文件拖进窗口或点即可开始。官方把完整文档放在仓库的 docs/ 目录按导入文件、实时录音、翻译、编辑与字幕调整分节适合逐项对照。把一段录音转成带时间戳的文字稿这是最基础的任务。操作流程用按钮、拖拽或快捷键Windows/Linux 是 CtrlOmacOS 是 CmdO导入一个音频或视频文件。Buzz 支持 MP3、WAV、FLAC 以及 MP4、AVI 等容器因为底层走 ffmpeg 解码绝大多数能播放的音视频都能处理。在任务行里确认任务类型选的是转录transcribe语言留空则自动检测或手动指定。选择模型档位见下文参数表点运行。结果是一个带时间戳的分段文字稿可在转录查看器里逐段播放、搜索和调整速度。导出时勾选 TXT就是一份可复制进笔记或 Word 的纯文本。给视频生成 SRT / VTT 字幕给视频配字幕和转个文字差别不大只是导出格式不同同样导入视频文件任务类型保持转录。运行后在导出处勾选SRT或VTT。SRT 更适合大多数剪辑软件和平台上传VTT 则面向网页播放器。如果单行字幕太长、太短或换行频繁用字幕调整resize功能重排设置目标行数和最大字符长度程序按标点和语义边界重新切段生成符合平台规范的字幕文件。翻译需求走的是另一条路任务类型选翻译translate它会把源语言音频直接转成英文文本适合法语音频转成英文稿这类跨语言场景。实时录音转写与演讲场景Buzz 也能直接读麦克风输入把语音即时转成文字并配有一个独立的演示窗口专门在报告、直播、访谈时把实时文字投到第二块屏幕上。适用场景包括线上会议边开边出纪要、讲座同步出笔记、直播加实时字幕、访谈边录边出稿。操作路径是打开实时录音界面、选择麦克风与语言后开始若对噪声敏感可开启提取语音选项它会先做一次语音分离再识别能明显降低背景杂音对结果的干扰。批量处理与文件夹监控需要一次性跑很多文件时Buzz 有两层自动化多任务队列一次导入多个文件它们在任务列表里排队逐个处理进度互不阻塞。文件夹监控watch folder在偏好里指定一个目录后任何新音频丢进去就会被自动转录适合定期更新的播客、批量上传的课程录音这类持续产出的工作流。仓库中对应的监控逻辑在 buzz/widgets/transcription_task_folder_watcher.py。结合先小模型快速过一遍、重要文件再换大模型重跑的策略可以兼顾预览速度和最终精度。关键参数怎么选下表是日常最常用的几个参数按它管什么 → 怎么选给出建议。参数作用选择建议任务类型转录保留原语言或翻译转成英文只要原语言文字稿选转录要跨语言转英文选翻译模型后端决定推理引擎Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI API本地跑优先 Whisper.cpp 或 Faster Whisper有独显且要最高精度可用 Whisper CUDA模型档位tiny / base / small / medium / large 系列越大越准也越慢实时或预览用 tiny/base日常用 small/medium重要内容用 large-v3 或 large-v3-turbo语言留空为自动检测或手动指定已知语言时手动指定识别更稳输出格式TXT / SRT / VTT 可多选纯文本用 TXT剪辑、平台上传用 SRT网页播放用 VTT初始提示词把术语、人名、地名喂给模型含专业词汇的音频填入关键词能提升这些词的命中率提取语音转录前先做语音分离噪声大、多人嘈杂时开启词级时间戳生成 word 级对齐需要逐词定位时开启模型档位命名里带.en的是仅针对英文的变体如tiny.en、base.en在纯英文素材上通常更准支持 101 种语言的识别翻译统一输出为英文。进阶插件、脚本与命令行Buzz 的插件系统把一些高频需求做成可开关的模块代码在 buzz/plugins/包括AI 摘要生成、字幕自动调整transcript resizer、跳过已转录文件、增强语言检测、导出 DOCX、以及噪声下的语音分离deep filter net。在插件对话框里启用或禁用即可不用改任何代码。命令行面向脚本和自动化核心是add子命令把文件或 URL交给 Buzz 并在完成后退出。典型用法# 转录单文件输出 SRT 与 TXT buzz add -l zh -s small --srt --txt audio.mp3常用选项-t指定任务transcribe/translate-m指定后端-s指定档位-l指定语言-p填初始提示词-w开词级时间戳-e开语音分离-d指定输出目录。翻译场景则是把-t translate加上去。加--hide-gui可以隐藏主窗口方便嵌进定时任务。常见问题Buzz 需要联网吗不需要。选用本地后端Whisper / Whisper.cpp / Faster Whisper / Hugging Face时全程离线只有 OpenAI API 后端才需要网络和密钥。支持哪些语言共 101 种语言的识别翻译功能统一把音频转成英文文本。处理速度受什么影响主要由音频时长、模型档位、后端和硬件共同决定。小模型 GPU 后端时通常能接近甚至快于实时大模型 纯 CPU 则会明显变慢长音频建议用大模型前先跑一遍小模型确认结果。能处理多长的音频没有硬性时长限制从几秒到几小时都可以长文件用队列或文件夹监控跑更省心。结果不准怎么调依次尝试手动指定正确语言、换更大的模型档位、给专业术语填初始提示词、噪声场景开启语音分离。输出格式怎么选TXT 用于阅读和复制SRT 用于剪辑与平台上传VTT 用于网页播放器可一次多选。小结Buzz 把 Whisper 的语音识别能力装进一个本地、离线、可批处理的应用里导入文件即转、支持实时录音与演讲窗口、能输出 TXT/SRT/VTT并通过模型档位、后端选择、插件和命令行覆盖从个人到自动化的不同需求。它的代价是等结果而非即时模型越大越慢——理解这一点就能把它安排进正确的工作流。下一步可以直接做三件事装一个对应平台的版本丢一段本地录音选 small 档跑一遍 SRT再打开偏好里的文件夹监控把手动导入升级成自动转录。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考