资讯详情

资讯详情

faster-whisper 语音识别教程:如何在 1 分钟内转写 13 分钟音频

faster-whisper 语音识别教程如何在 1 分钟内转写 13 分钟音频【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 把长音频转成文字比原版 Whisper 更快、更省内存。它是基于 CTranslate2 重写的语音识别引擎最高可达原版 4 倍速度。如果你还在跑原版 Whisper 做批量转写这篇教程适合你。用原版 Whisper 转写时你会撞上这 3 个问题跑原版 large-v2 模型13 分钟音频要 2 分 23 秒显存占用 4708MBCPU 上 small 模型更慢要 6 分 58 秒。原版还要求系统单独安装 FFmpeg容器环境经常卡在依赖上。faster-whisper 换用 CTranslate2 推理引擎并内置 PyAV 解码音频不需要在系统装 FFmpeg。⚡ 3 分钟安装并完成第一次转录要求 Python 3.9一条命令安装pip install faster-whisper按模型名加载时对应的 CTranslate2 权重会自动从 Hugging Face Hub 下载。最小可运行示例from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})注意segments是生成器进入循环后转写才真正开始。3 个值得深挖的核心能力VAD 语音活动检测先跳过静音再转写传vad_filterTrue转写前用内置 Silero VAD 切掉静音段。默认策略保守只移除超过 2 秒的静音想切得更碎可用vad_parameters把min_silence_duration_ms调低到 500。参数定义见 faster_whisper/vad.py。批量转写默认开启 VAD。词级时间戳精确到每个单词word_timestampsTrue会把每个片段拆成单词每个单词带起止时间适合做字幕对齐、关键词定位。批量推理GPU 吞吐明显提升BatchedInferencePipeline可直接替换WhisperModel.transcribe。以 distil-large-v3 在 GPU 上batch_size16为例耗时从 46 分 12 秒降到 25 分 50 秒transformers 实现跑同一任务WER 为 13.527 对 14.801。更多参数可在 faster_whisper/transcribe.py 中查阅。 基准对比耗时与内存差多少GPU 端large-v2RTX 3070 Ti 8GBCUDA 12.4均为 13 分钟音频实现精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPU 端small 模型i7-12700K8 线程原版 6 分 58 秒faster-whisper fp32 为 2 分 37 秒int8 为 1 分 42 秒内存从 2335MB 降到 1477MB。 5 条部署建议compute 类型、CUDA 版本与批大小GPU 场景优先compute_typefloat16显存吃紧时换int8_float16。仅用 CPU建议compute_typeint8small 模型下耗时减半内存省 780MB1477MB 对 2257MB。CUDA 版本不匹配最新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用户降级到 ctranslate23.24.0。仓库提供基于 nvidia/cuda 镜像的部署参考见 docker/Dockerfile。长音频批处理批量会推高内存int8 从 2926MB 升到 4500MB按空闲显存定 batch_size。做横向对比确保 beam size 一致faster-whisper 默认 beam_size5原版默认是 1否则数据不可比。3 个常见落地场景会议录音转写VAD 自动跳过静音段算力不浪费在无声音上视频字幕生成词级时间戳让字幕对齐精确到单词多语言语料本地化自动检测语言并返回置信度单条音频还是批量任务faster-whisper 都用更少的时间和内存给出同样的文字结果把现有转写流水线里的引擎换掉即可。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →