SadTalker 安装配置完整指南:三步跑通音频驱动的说话视频生成
发布时间:2026/9/12 2:31:05 锦皓数字建站

SadTalker 安装配置完整指南三步跑通音频驱动的说话视频生成【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker一张照片加一段录音就能生成嘴型贴合、表情自然的说话视频——SadTalkerCVPR 2023 音频驱动说话人脸项目就是为此而生。但它依赖钉得严、模型文件多、路径讲究装错一步就得重来。下面按先判断硬件、再装环境、跑通验证、卡住查表的顺序带你把 SadTalker 的安装配置一次做对。硬件自检清单先定 GPU 还是 CPU 路线要装哪个版本的 torch、跑的时候配多少显存都由这个判断决定所以放在第一步一条命令就够在终端执行nvidia-smi。硬件项GPU 路线CPU 路线显卡NVIDIA 独显VRAM显存≥4GB推荐 8GB无要求内存16GB 起步16GB推荐 32GB磁盘≥10GB 空闲模型与权重约 4GB同左出片速度256 分辨率短视频数十秒级单条分钟级判断标准一句话nvidia-smi能打出显卡型号走 GPU 路线命令不存在或只有集显就走 CPU 路线。三步搭好运行环境requirements.txt 把 numpy 1.23.4、face_alignment 1.3.5 等钉死在精确版本必须在隔离的 conda 环境创建相互独立 Python 环境的工具里装否则冲突会缠到系统其他项目上。1) 拿代码、建环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalkerconda create -n sadtalker python3.8 conda activate sadtalker选 Python 3.8 的原因仓库钉死的版本是在这个大版本上验证过的换高版本容易撞编译与 ABI 问题。2) 装 PyTorch 与其余依赖必须先装 torch再装 requirements否则 pip 可能重解析 torch 版本把环境搅乱路线安装命令GPUCUDA 11.3pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113CPUpip install torch1.12.1cpu torchvision0.13.1cpu torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cpu其余包一次性补全pip install -r requirements.txt3) 装视频处理工具 FFmpegFFmpeg 负责全部音视频的编码、解码与抽帧缺了它第一步生成就会报ffmpeg is not recognized。conda install ffmpegWindows 也可将 ffmpeg 二进制包加入 PATHmacOS 可用brew install ffmpeg。模型文件下载与目录放置这是 SadTalker 安装的收尾一步src/utils/init_path.py 按文件名硬编码了读取位置少一个文件、放错一层目录都会在加载时直接报错。bash scripts/download_models.shLinux/macOS 一键完成。脚本基于wget -nc已完成的文件重跑时自动跳过断网后直接再执行即可续传Windows 用户按下面的目录树手动下载摆放。项目根目录 ├─ checkpoints/ │ ├─ SadTalker_V0.0.2_256.safetensors / SadTalker_V0.0.2_512.safetensors │ └─ mapping_00229-model.pth.tar / mapping_00109-model.pth.tar └─ gfpgan/weights/ alignment_WFLW_4HG.pth / detection_Resnet50_Final.pth / GFPGANv1.4.pth / parsing_parsenet.pth文件体积范围自检用谁在用SadTalker_V0.0.2_256.safetensors约 1.2GB256 人脸渲染默认--size 256SadTalker_V0.0.2_512.safetensors约 1.2GB512 人脸渲染--size 512mapping_00229-model.pth.tar约 200MBcrop / extcrop 裁剪模式mapping_00109-model.pth.tar约 200MBfull / extfull 全身模式gfpgan/weights/下 4 个文件各 50–300MB仅--enhancer gfpgan面部增强时需要下载完用du -h checkpoints gfpgan对照上表明显偏小说明没下全。注意两个 mapping 文件由--preprocess在裁剪与全身模式间自动选用gfpgan 目录不用增强就可以不占地方。跑一次推理验证配置框架、依赖、视频工具、端到端流程四条链路只有跑通了才算数。输入就是下面这样一张人像python -c import torch;print(torch.__version__, torch.cuda.is_available()) python -c import face_alignment,librosa,scipy;print(deps OK) ffmpeg -version | head -n 1 python inference.py预期输出1.12.1cu113 TrueCPU 路线则是 CPU 版本号加Falsedeps OK以ffmpeg version开头的版本信息最后打印The generated video is named: ./results/...mp4且 results 目录下的 mp4 能正常播放第 4 条不用传参默认使用仓库自带的examples/driven_audio/bus_chinese.wavexamples/source_image/full_body_1.png。之后换成自己的素材正式跑按路线【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。