十分钟跑通 SadTalker:环境搭建、模型下载与高频报错完整清单
发布时间:2026/9/12 16:06:39 锦皓数字建站

十分钟跑通 SadTalker环境搭建、模型下载与高频报错完整清单【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker模型下了十分钟还没下完一跑推理就弹出一串红色报错SadTalker 部署最容易卡在这。它能把一张图片加一段语音变成会说话的视频这篇把环境配置、模型一键下载和高频报错修复的完整清单列全照着走完就能出第一个会说话的视频。跑之前先确认三件事Python 3.8 Conda官方安装文档按 3.8 调过换更高版本容易踩依赖坑ffmpeg一行conda install ffmpeg音频解码和视频合成全靠它git克隆代码仓库版本细节和 docs/install.md 保持一致即可不用提前折腾 CUDA。一条命令拉起来下面整块直接粘进终端不用改任何文件git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg # Windows 用 scoop install ffmpeg 并加入 PATH pip install -r requirements.txt pip install dlib # macOS M1/M2 需单独装原生 dlibWindows 上若报ffmpeg: not recognized装好后把它加进 PATH 就行其他平台照搬上面的块即可。这个环境后面跑 WebUI 也能直接复用不用另建。模型文件别手动搬推理要加载四个 checkpoint 和一组 GFPGAN 权重手写下载命令很容易放错目录直接跑项目自带脚本bash scripts/download_models.sh它会拉下来这些文件checkpoints/mapping_00109-model.pth.tar音频到表情的映射网络checkpoints/mapping_00229-model.pth.tar音频到姿态的映射网络checkpoints/SadTalker_V0.0.2_256.safetensors和SadTalker_V0.0.2_512.safetensors256/512 分辨率人脸渲染器512 细节更清楚gfpgan/weights/含 GFPGANv1.4.pth人脸修复与检测模型只有用--enhancer时才需要 总量约 2GB网络稳定时 5 到 10 分钟。脚本用的是wget -nc支持断点续传中断后重跑同一条命令就能接着下如果网络环境差也可以从项目 release 页面手动下载后放进checkpoints/对应目录文件名不能改。先验证再跑示例python -c import torch; print(torch.__version__) ffmpeg -version两条都能打印版本号说明基础环境没问题。输入素材仓库里都备好了python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png跑完后results/目录下会出现一个 mp4。源图可以从examples/source_image/任选音频从examples/driven_audio/任选注意只支持 wav 和 mp3。报错急救包报错关键词一行原因一行修复ffmpeg: not recognizedffmpeg 没在 PATH 里conda install ffmpegWindows 把安装目录加入 PATHModuleNotFoundError: No module named ai模型文件损坏或大小不对重跑bash scripts/download_models.shFileNotFoundError ... similarity_Lm3D_all.mat模型没下到正确目录检查checkpoints/结构后重新下载CUDA out of memory显存碎片化运行前先export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Illegal Hardware ErrorMac M1dlib 编译版本不对pip install dlib 还卡住的话把报错关键词丢进 docs/FAQ.md 搜一下官方 FAQ 基本都覆盖过。再玩点高级的觉得脸部偏糊加上 GFPGAN 修复参数人脸皮肤和轮廓会明显锐利python inference.py --driven_audio examples/driven_audio/imagine.wav \ --source_image examples/source_image/happy.png --enhancer gfpgan头部动作太机械时用参考视频驱动姿态examples/ref_video/里有两个样例视频参考视频比音频短会自动循环python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/art_0.png \ --ref_pose examples/ref_video/WDA_KatieHill_000.mp4另外把--expression_scale调大比如 1.5表情会更夸张生动。现在你可以自由组合不同源图和音频再配合增强参数调出自己想要的效果。更多参数用法详见 docs/best_practice.md有更新记得git pull拉一下最新代码。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。