ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Buzz 离线转录工具:3 步从会议录音生成文字稿,免费且数据不出本机

Buzz 离线转录工具:3 步从会议录音生成文字稿,免费且数据不出本机 Buzz 离线转录工具3 步从会议录音生成文字稿免费且数据不出本机【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz高铁上断了网而你手里有一份两小时的会议录音明早就要交文字稿。这正是 Buzz 要解决的场景一款离线语音转录工具基于 OpenAI Whisper 在你的电脑上本地运行音频和文稿数据不出本机也没有任何 API 费用。为什么选离线转录Buzz 与云端语音服务的差异云端转录服务按分钟计费、受文件大小和时长限制且音频要上传到对方服务器。Buzz 把计算全部放在你的设备上差异如下对比维度云端语音转录服务Buzz 本地离线转录网络连接必须联网弱网下任务中断模型下载后可完全离线运行数据位置音频上传至服务商服务器始终留在本机磁盘使用成本按调用量/时长计费软件免费无 API 费用文件限制常有大小、时长上限不限可批量排队处理语言支持取决于所选服务支持近百种语言转录与翻译如果你需要转录的是敏感访谈、内部会议或设备长期处于弱网环境这个差异就是选择 Buzz 的理由。安装 Buzz 并跑通第一次转录普通用户Windows 和 macOS 版本从 SourceForge 下载对应安装包即可。Windows 安装时会弹出未签名警告点更多信息→仍要运行即可继续macOS 双击.dmg拖入Applications完成。Linux 用户可用 Flatpak 或 Snap 一键安装。开发者需 Python 3.12 环境并先装好 ffmpegpip install buzz-captions python -m buzz首次运行只需三步点击工具栏号或按 Ctrl/CmdO导入一个音频或视频文件。在表单里选择任务转录或翻译成英语、语言和 Whisper 模型参数。点击运行等待状态变为已完成双击任务行打开转录视图。转录视图里可以逐段播放、拖动进度、搜索文字并直接导出为 TXT、SRT、VTT 三种格式。默认导出文件名支持模板变量如输入文件名、日期可在偏好设置中自定义逻辑见 docs/docs/preferences.md。按使用流程走一遍导入、选模型、出稿到导出导入音频。除本地文件外Buzz 也支持导入视频文件和网络链接提取音轨视频画面在转录视图中可同步播放。选模型。这是影响速度和质量的最关键一步。Whisper 模型从 tiny 到 large 共五档选错档位要么慢得等不住要么错得没法用模型档位典型用途速度体验资源占用建议设备tiny / base实时录音、快速预览极快低普通笔记本small日常会议、课程录音较快中4 核以上 CPUmedium正式文稿、多语访谈一般高独显或较新 CPUlarge 系列重要存档、高难音频慢很高6GB 显存以上 GPU官方 FAQ 还提示large-v3 精度最高但偶尔会脑补不存在的词turbo 档位则在速度和精度之间做了平衡。没有银弹最稳妥的办法是拿同一段音频把几档都试一遍。出稿与润色。勾选Word-Level Timings按词生成时间戳后字幕可以按最大长度、标点位置重新合并还能整体延长每条字幕的停留时间——这是做字幕时最实用的功能对应工具在 buzz/widgets/transcription_viewer/transcription_resizer_widget.py。若音频环境嘈杂开启Extract speech可先把人声分离出来再转录准确率更稳转录完成后还能用说话人识别区分不同发言者。实时录音与演示窗口。选好任务、语言、麦克风后点录音即可边说边出文字支持追加并修正等模式。开始录音后可打开演示窗口把实时字幕投到大屏适合演讲和无障碍场。三个让批量转录更省事的效率玩法文件夹监听在偏好设置的 Folder Watch 标签里添加一个目录新放进来的音频文件会自动排队转录输出格式和模型参数一次配好长期生效。NVIDIA GPU 加速仅 PyPI 安装版需要额外配置安装带 CUDA 的 torch 后再启动Buzz 会自动用 GPU 推理。命令行与快捷键buzz add命令支持指定模型、语言并直接输出 SRT/VTT适合写脚本批量跑常用快捷键如 CtrlO 导入完整定义在 buzz/settings/shortcuts.py偏好设置里还能改键。三类人群最常用的打开方式研究者访谈录音批量离线转录符合数据伦理要求导出 SRT 后可直接导入质性分析软件多语言访谈靠语言参数逐个指定。视频创作者从视频直接提取音频出字幕用词级时间戳 时长调整工具精修每条字幕的出入点按平台需求导出 SRT/VTT。会议与活动组织者实时录音模式生成初步记录演示窗口让参会者同步看到文字会后在转录视图里修正错别字再导出纪要。转录前就该纠正的三个认知模型越大越好不一定。large 档对硬件和时间都是重负载日常会议用 small/medium 通常足够实时录音建议 tiny/base 才跟得上语速。语言靠自动检测就行自动检测只依据开头几秒方言、口音或混合语言场景容易判错。知道语言就明确选上多数情况下准确率更高。离线就一定用不了只要模型下载完整就完全不需要网络。模型默认存在用户缓存目录如 Linux 的~/.cache/Buzz在有网机器上下载好、拷贝到离线机器的相同位置即可仓库的scripts/download-models.py就是为这种场景准备的。装好 Buzz、下载好你常用的那一档模型把下一个待转录的文件丢进队列——离线文字稿这件事本机就能闭环。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表