资讯详情

资讯详情

Buzz 离线音频转录指南:用本地 Whisper 快速完成语音转文字与字幕导出

Buzz 离线音频转录指南用本地 Whisper 快速完成语音转文字与字幕导出【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线音频转录工具基于 OpenAI 的 Whisper 模型在你的电脑上本地完成语音转文字与翻译。它支持 100 多种语言既能处理 MP3、WAV、FLAC、MP4 等音视频文件和 YouTube 链接也能实时录音转录并内置字幕编辑、说话人识别与多种格式导出TXT、SRT、VTT。所有数据都在本地处理无需上传服务器。先做选型云端转录和本地转录怎么选把录音交给云端服务通常换来的是更省心的算力代价是音频会离开自己的设备。本地转录正好相反维度云端转录服务Buzz 本地转录数据去向上传到第三方服务器完全保留在本机网络要求必须在线可离线运行费用多按分钟/时长计费免费无隐藏收费硬件要求无取决于模型大小约 75MB 至 2.9GB可定制性受限于平台功能可换后端、写插件、接入脚本如果你的内容涉及商业信息、个人隐私或者经常在没有网络的环境下工作本地路线更稳妥对算力要求不高的轻量场景两者都可行。下文假设你已经决定使用 Buzz。按操作系统选择 Buzz 的安装方式详细步骤见官方 安装文档。四种路径任选其一macOS下载.dmg安装包拖入 Applications 即可支持 Intel 与 Apple 芯片。Windows下载安装包后按提示安装。Buzz 未做代码签名系统提示安全警告时选择更多信息→仍要运行。LinuxFlatpak 或 Snap 均可flatpak install flathub io.github.chidiwilliams.Buzz # 或 sudo snap install buzzPyPI需要 Python 3.12 环境和 ffmpeg适合想参与开发或定制的用户pip install buzz-captions python -m buzz选对 Whisper 模型速度、精度和内存的平衡Buzz 的模型管理入口在偏好设置菜单打开或按Ctrl/Cmd ,的 Model 标签页里可以下载新模型、删除不用的模型。Whisper 系列模型按体积分五档体积越大识别越精细但转录也更慢、更吃内存模型体积约适用情况tiny75MB快速预览、实时转录、低配设备base142MB日常使用的平衡之选small466MB需要更高准确度的正式内容medium1.5GB高精度、长内容large2.9GB最高准确度资源需求也最高除了原始 WhisperBuzz 还支持 Whisper.cpp、Faster Whisper、Hugging Face 模型族和 OpenAI API 后端。几个和性能直接相关的选择Whisper.cpp 后端支持 CUDANVIDIA 显卡、Vulkan多数独立/核显显卡和 Apple Silicon实时录音场景官方也建议用它。大模型可以选量化版本如q_5来降低显存占用在偏好设置里开启Reduce GPU RAM或使用 Whisper.cpp 量化模型都能减少显存消耗。显卡老旧或出问题时可以设置环境变量BUZZ_FORCE_CPUtrue强制用 CPU。日常对话内容base 或 small 通常就够用先把小模型跑通确认准确度不足再换大的是更省时间的做法。第一次转录导入文件、挑语言、跑通导出完整说明见 文件导入文档流程是四步点 File → Import Media File或工具栏的 按钮、快捷键Ctrl/Cmd O选择音频、视频文件或粘贴 YouTube 链接。选择任务转录 / 翻译成英文、语言、模型。官方建议明确指定语言——自动检测依据的是开头几秒的音频容易误判。点 Run 开始处理任务列表里会显示排队、进行中、已完成状态。状态变为 Completed 后双击该行或选中后点展开图标打开转录查看器。三个值得留意的选项Initial prompt初始提示词在 Advanced 按钮下填写把容易写错的人名、术语放进去能明显减少同音字错误。Word-level timings词级时间戳开启后每个词都有独立时间点之后才能用调整工具把文本切分成规范字幕详见下文。Export As导出格式可选 TXT、SRT、VTT。转录完成之后编辑文字、识别说话人、调整字幕长度转录查看器是 Buzz 里功能最集中的页面常用能力如下详见 转录查看器文档搜索与定位Ctrl/Cmd F打开搜索Ctrl/Cmd G让文本滚动跟随播放位置播放速度支持 0.5 到 2.0 倍。时间戳微调Ctrl/Cmd ←/→以 0.5 秒为单位移动片段起止时间配合 Loop Segment 反复试听同一段落。说话人识别在查看器点Identify speakersBuzz 会标注不同说话人的句子可以试听任意一句并把手动改标签改为真实姓名还能勾选合并同一人的连续句子Intel 芯片的 Mac 上不可用。字幕长度调整点Resize。启用过词级时间戳的转录可以按标点拆分、按最大长度合并还能延长每段字幕的显示时长并借助音频静音分析优化切分位置没有词级时间戳的转录则只能按最大长度重新合并。详见 编辑与调整文档。翻译Whisper 本身支持把非英语音频翻译成英文要翻到其他语言需在偏好设置里配置 OpenAI 兼容 API支持 OpenAI、Ollama、LM Studio 等再在查看器的 Translate 按钮里填入翻译指令。参考成本一小时音频用 ChatGPT/Claude 级别模型约 1 美元。导出TXT、SRT、VTT、JSON 等格式可直接交给视频剪辑软件或其他脚本处理。批量与自动化命令行、文件夹监控和实时录音用 CLI 批量处理文件Buzz 自带命令行入口CLI 文档适合脚本化场景。转录单个文件并导出 SRTbuzz add --task transcribe --language zh --model-type whisper --model-size small --srt 音频文件.mp3批量处理目录内所有 MP3for f in *.mp3; do buzz add --task transcribe $f; done其他常用参数-t指定任务transcribe/translate-m指定后端whisper、whispercpp、fasterwhisper、huggingface、openaiapi-p传入初始提示词--hide-gui后台运行。用文件夹监控实现扔进去就转在偏好设置的 Folder Watch 标签页指定一个目录放入的音频文件会自动进入转录队列。配合内置插件Skip Already Transcribed检测同名 TXT/SRT/VTT 文件或数据库记录重复导入同一批文件时会自动跳过已完成的任务。实时录音与演示窗口麦克风录音转录的步骤选好任务转录 / 翻译成英文、语言、麦克风点 Record 即可。官方提示默认 Whisper 后端实时转录开销较大建议用 Whisper.cpp并优先 tiny、base 这类小模型。三个实时模式各有取舍——Append below / Append above只追加新句子Append and correct会持续回改末尾错误更准但更耗算力。录音开始后还会出现 Presentation window 选项可以开一个独立窗口在大屏上投出实时文字。想转录电脑里播放的声音网课、播客、系统音效需要装一个虚拟音频设备macOS 可用 BlackHoleWindows 可用 VB CABLE把系统输出引到虚拟设备再在 Buzz 里把它选为麦克风。完整步骤见 实时录音文档。插件给转录流水线加扩展1.4.5 起支持插件Help → Plugins 管理内置的六个能覆盖不少重复劳动AI Summary接 OpenAI 兼容 API 生成摘要、Enhanced Language Detection转录前本地检测语言、Export DOCX导出 Word可带时间戳、Resize Transcript转录完自动重排字幕、DeepFilterNet 降噪先消噪再转录适合嘈杂录音、Skip Already Transcribed。自定义插件可参考 buzz/plugins 目录的源码结构。关于效果的四个高频问题语言该选自动检测吗已知语种就手动指定检测基于前几秒音频双语或口音重的内容更容易出错。长音频要分段吗模型会整段处理更实际的优化是关掉其他占内存的程序、用 smaller 的模型或量化版本而不是人为切碎音频。有 GPU 怎么开加速NVIDIA 显卡装带 CUDA 的 PyTorchpip install torch torchaudio --index-url https://download.pytorch.org/whl/cu129Whisper.cpp 后端可走 Vulkan核显也能加速。录音环境要讲究吗要。安静环境、外接麦克风、录音前试一次电平对最终准确度的影响比换更大模型更明显。下一步行动清单下载你操作系统的安装包或pip install buzz-captions打开 Buzz。在偏好设置里下载 base 模型导入一段两三分钟的音频跑通第一次转录。在查看器里试一次搜索、时间戳微调和 SRT 导出。需要常态化使用时再依次配置文件夹监控、CLI 脚本和实时录音。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →