Buzz本地音频转录:三个系统装起来,全程离线把声音变成字幕
发布时间:2026/9/6 20:21:55 锦皓数字建站

Buzz本地音频转录三个系统装起来全程离线把声音变成字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个基于 OpenAI Whisper 的开源本地音频转录工具转写、翻译都在你自己的电脑上跑离线可用、免费支持 90 多种语言还能对着麦克风实时录音转写。它到底解决什么问题在线转录服务需要你把音频上传到别人的服务器。会议录音、采访原声这类内容隐私风险摆在那里。Buzz 的思路是把模型搬回本地音频文件不出你的电脑转录结果也存本地断网照常工作。另一个好处是零费用。项目开源没有订阅制装一次用一次。它同时覆盖了日常需求批量导入音视频文件、导出 TXT/SRT/VTT 字幕、麦克风实时转录、文件夹自动监听还有 CLI 命令行可供脚本调用。下面是主界面左侧任务列表管理批量转录右侧是录音和导出入口。装起来Windows从官方下载页SourceForge 的 buzz-captions 项目拿到安装程序双击安装即可。程序没有数字签名安装时 Windows 会弹安全警告点「更多信息」→「仍要运行」放行。macOS同样去官方下载页拿.dmg安装包拖进「应用程序」文件夹完成安装Intel 和 Apple 芯片都支持。LinuxFlatpak 和 Snap 都有任选其一flatpak install flathub io.github.chidiwilliams.BuzzSnap 方式则是sudo snap install buzz需要先装 libportaudio2 等依赖见 docs/docs/installation.md。首次启动时 Buzz 会自动下载你选的转录模型建议先在联网状态下打开一次把它备好。首次运行要做的三件事选模型帮助 → 偏好设置 → Models下载要用的模型。没有 NVIDIA 显卡就选 Whisper.cppCPU、核显、Mac 都跑得动显卡显存 6GB 以上可以选 Faster Whisper速度快很多。定导出文件名偏好设置里可以给默认导出文件名设模板支持源文件名、任务、语言、日期等变量比如{{ input_file_name }} ({{ task }}d on {{ date_time }})。选界面语言程序自带多语言界面包含简体中文在偏好设置里切到你的语言后面看菜单不费劲。功能逐个说批量转录一次导入一整批文件菜单 File 里的「Import Media File」或 CtrlO、工具栏「」号导入音频或视频也可以直接粘 YouTube 链接。文件进队列后自动排队处理每行的状态会实时更新为「Completed」。双击列表行即可打开转录结果查看。进阶选项里可以开「Extract speech」先把人声从背景里分离出来噪声大的素材准确率更稳。偏好设置里可开文件夹监听往指定目录丢新文件就自动开始转录。模型怎么选速度、内存和精度的平衡模型分 tiny 到 large 多个档位越大越准也越吃资源。没有标准答案官方 FAQ 的建议就是「在你的语言上把几个档位都测一遍」。档位速度内存占用精度适用场景Tiny极快很低基础快速草稿、实时转录Base快较低良好日常使用Small中等中等良好常规内容Medium较慢较高优秀重要内容Large慢很高最好专业转录、精细校对[除了档位还要挑后端类型默认 Whisper 最稳但慢Whisper.cpp 是 C 优化版Mac 上首选Faster Whisper 需要 6GB 以上显存的 N 卡。带.En后缀的模型只认英语。实时录音边说边出文字 ️选好麦克风、语言和任务后点 Record声音就会边录边转成文字。任务可选「Transcribe」转写或「Translate to English」翻译成英文。语言建议手动指定自动检测靠前几秒音频判断偶尔会认错。实时转写比较吃资源官方提示优先用 Whisper.cpp 小模型。开会、做报告时可调出 Presentation window把实时文字放大展示也方便现场无障碍使用。字幕编辑时间轴和文本都能改双击转录结果打开查看器能逐段校对、搜索CtrlF、按 0.5 倍到 2 倍速播放还能循环播放某一段或让文本跟随音频滚动。用 Ctrl方向键微调某段的开始/结束时间每次 0.5 秒。点「Resize」做字幕整形设每条字幕最大长度、按标点断句、延长每条字幕的显示时长。想用上完整的合并与断句功能转录时要先勾上「Word-Level Timings」。成品可导出 SRT、VTT、TXT、JSON 等格式。三个场景直接抄作业场景一会议记录打开录音面板选好麦克风和会议语言。点 Record把 Presentation window 调出来投到副屏。散会后停止录音检查实时生成的文本。导出 TXT顺手丢进文档归档。场景二视频字幕导入视频文件语言手动指定模型选 Medium 起步。高级设置里勾上 Word-Level Timings专有名词多的话填进 Initial prompt。转录完成后打开查看器用 Resize 把字幕调成每条 40 字符左右。导出 SRT直接拖进剪辑软件。场景三访谈整理把访谈录音批量导入或放进监听文件夹自动开转。人名、术语提前写进 Initial prompt减少拼写错误。在查看器里搜索关键词逐段核对并修正。导出 TXT 或 DOCX启用内置的 Export to DOCX 插件按说话人分段归档。卡住了看这里转录太慢怎么办把模型降到 base 或 small换成 Whisper.cpp 后端它在 CPU 和核显上都能跑有 6GB 以上显存的 N 卡就切 Faster Whisper。三条里挑一条通常立刻见效。识别准确率不高换更大的模型medium、large 系列用 Initial prompt 提供背景词和人名音频本身噪声明显的话先跑一遍内置的 DeepFilterNet 降噪插件再转录。模型下载失败、甚至启动崩溃多半是模型文件不完整。到帮助 → 偏好设置 → Models 里删掉已下载的模型重新拉。如果目标机器完全断网可以在有网的电脑上下载好把模型缓存文件夹拷过去Linux 是~/.cache/BuzzmacOS 是~/Library/Caches/BuzzWindows 是%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。录音时报PaErrorCode-9999检查系统是否允许应用访问麦克风Windows 在 设置 → 隐私 → 麦克风杀毒软件有时也会拦先临时关掉试试。Buzz 把本地语音转文字做成了不写代码就能用的样子装完试一条自己的音频就知道合不合适。更多细节见 docs/docs/faq.md想扩展功能可以翻翻 buzz/plugins/ 里现成的插件源码。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。