4 倍速跑通 faster-whisper:CTranslate2 重写版 Whisper 语音转写指南
发布时间:2026/9/18 23:30:33 锦皓数字建站

4 倍速跑通 faster-whisperCTranslate2 重写版 Whisper 语音转写指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper18:00你手里有一段 40 分钟的会议录音想晚饭前拿到一份带时间戳的逐字稿。faster-whisper 就是干这个的用 CTranslate2≈ 给模型换一台更省油的推理引擎重写的 OpenAI Whisper 语音转写同等精度下最高快 4 倍还更省内存。10 分钟装好并跑通第一条转写装 GPU 运行库有 N 卡才做ctranslate2 推理要调 cuBLAS 和 cuDNN缺了模型起不来。Linux 下pip install nvidia-cublas-cublas-cu12 nvidia-cudnn-cu129.*后把这两个库目录加进LD_LIBRARY_PATH再启动 Python。装本体只要 Python 3.9。音频解码走 PyAVav11它把 FFmpeg 的库打进了自己的 wheel≈ 省去系统再装一遍 FFmpeg装完直接读 mp3 / wav / m4a一行pip install faster-whisper带齐 ctranslate2、tokenizers、onnxruntime。跑第一条转写WhisperModel按模型名自动下载对应 CTranslate2 权重下面选small档是 CPU / 低显存下能拿到带时间戳结果的最快选择。beam_size5是库的默认解码精度vad_filterTrue也是默认先用内置 Silero VAD 剪掉长静音模型不用白算空段。注意segments是生成器真正跑转写发生在遍历它的那一刻from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(meeting.mp3, beam_size5, vad_filterTrue) print(f语言 {info.language} 置信度 {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})按硬件和延迟选档位 这些数字来自仓库基准13 分钟音频、NVIDIA RTX 3070 TiCUDA 12.4与 Intel Core i7-12700K8 线程。你的硬件推荐配置13 分钟 large-v2 实测内存占用N 卡devicecudafloat161 分 03 秒≈4.5GB 显存N 卡要更快同上 batch_size817 秒≈6.1GB 显存N 卡显存紧int8_float16量化59 秒≈2.9GB 显存纯 CPUdevicecpuint8small 档1 分 42 秒≈1.5GB 内存batch_size会多占一部分显存/内存但批量转写提速明显1 分 03 秒压到 17 秒。int8 量化在 CPU 和 GPU 上都进一步降内存精度损失很小。报错时先查这张表如果import faster_whisper报 ctranslate2 版本冲突说明机器上已有不兼容的旧版回到安装步用pip install --force-reinstall ctranslate24.4.0之类锁版本核对CUDA 11 cuDNN 8 的老环境锁3.24.0。如果加载时看到cuDNN not found或 CUDA 报错说明库没进环境变量或版本对不上 CUDA 12回到第 1 步核对LD_LIBRARY_PATH路径懒得折腾可以直接用nvidia/cuda:12.3.2-cudnn9-runtime这类 Docker 镜像。如果 PyAV 触发本地编译失败说明 pip 拉到了源码包而非 wheel换官方预编译包重装别在 Windows 上硬编译。如果转写卡住没有输出说明segments还是生成器没被遍历segments list(segments)或写for循环才会真正跑完。再往前走一步要词级时间戳做字幕加word_timestampsTrue每个seg.words里都有起止时刻解码细节见 faster_whisper/transcribe.py。音频长、说话占比低时收紧静音切分省算力vad_parametersdict(min_silence_duration_ms500)各参数默认值见 faster_whisper/vad.py。长音频上量BatchedInferencePipeline把片段攒成批一次喂给模型13 分钟音频 fp16 从 1 分 03 秒压到 17 秒用法见 README.md 的 Batched Transcription 一节。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。