资讯详情

资讯详情

SadTalker 本地部署指南:从环境配置到生成第一个说话头像

SadTalker 本地部署指南从环境配置到生成第一个说话头像【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你手上有一张照片和一段旁白音频想要一个口型随声音自然开合的视频SadTalker 本地部署就是做这件事的输入一张单图和一个 wav 文件输出口型同步、头部动作自然的说话头像视频。这篇文章带你从零在自己电脑上跑通第一次生成全程只需要三步时间成本主要取决于首次依赖下载的速度。先看机器条件满足这三项就可以开始开始之前对照环境逐项确认Python 版本3.8 到 3.10 均可启动脚本会自动校验Windows 建议 3.10内存与磁盘8GB 以上内存16GB 更稳妥10GB 以上可用磁盘空间用于代码、模型和依赖ffmpeg合成输出视频必须用到缺失会在启动时报错显卡NVIDIA 显卡能明显加速纯 CPU 也可以跑只是慢显存低于 4GB 时把分辨率固定在 256部署方式的选择看下面的对照第一次体验走 WebUI 路径最短后续要批量处理再考虑命令行。部署方式硬件要求适用场景本地 WebUI本文8GB 内存起步GPU 可选长期使用、数据不出本机命令行推理同上批量处理、脚本化调用社区 Docker 镜像需 Docker 环境快速验证、环境隔离拉取代码并完成环境自检这一步的目的是拿到代码后让启动脚本自动搭好 Python 环境你不需要手动安装任何依赖。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker确认方式目录里能看到webui.sh、launcher.py、app_sadtalker.py等文件即拉取成功。接着启动 WebUImacOS 与 Linux 执行bash webui.shWindows 用户直接双击webui.bat即可。首次运行会自动创建 venv 虚拟环境并安装 PyTorch 及全部依赖终端滚动大量 Installing 日志属于正常现象耐心等待它跑完。确认方式浏览器自动打开本地页面默认地址 127.0.0.1:7860看到左侧可上传图片与音频、右侧有参数区和Generate按钮的界面环境就搭好了。下载模型文件并核对目录模型权重不包含在代码里需要单独下载这一步最容易被跳过。bash scripts/download_models.sh该脚本会把 4 个核心权重下到checkpoints/目录、4 个 GFPGAN 增强权重下到gfpgan/weights/目录。下载完成后核对一下ls checkpoints看到 mapping_00109-model.pth.tar、mapping_00229-model.pth.tar、SadTalker_V0.0.2_256.safetensors、SadTalker_V0.0.2_512.safetensors 四个文件即正常。脚本用 wget -nc 下载中断后直接重跑即可续传网络不稳定时可从官方 release 手动下载对应文件放进同一目录。跑通第一个说话头像在 WebUI 页面按顺序填写输入有三个地方需要留意输入照片正面、五官清晰、无遮挡方图或略竖的图最稳。下面这张正面人像就是一个典型合格输入。音频wav 格式最稳手头没有音频文件时非 Windows 系统可以在文本框输入文字用内置 TTS 生成语音。参数face model resolution 先用 256512 更清晰但更慢preprocess 默认 crop 适合人脸特写想让全身图动起来就选 full 并勾选 Still Mode。艺术风格的输入同样适用整体效果通常比真实照片更稳定点击Generate后等待生成时间取决于音频长度与分辨率普通显卡上大约每分钟音频几十秒。完成时右侧 Generated video 区域直接播放成片文件同时保存在results/目录。排错与效果调优以下问题按出现频率排序每条按现象、原因、修复说明。提示 ffmpeg is not recognizedffmpeg 未安装或不在 PATH 中。Linux 执行 conda install ffmpegmacOS 执行 brew install ffmpegWindows 把 ffmpeg 可执行文件加入 %PATH% 后重开终端。CUDA out of memory显存不足。把 face model resolution 切到 256、调低 batch size或启动前设置 PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128仍失败就改用纯 CPU 模式跑。checkpoints 下缺文件或提示文件损坏unexpected EOF模型下载中断导致不完整。重跑 bash scripts/download_models.sh 续传或手动重新下载对应文件。音频解码报错Invalid data found程序只支持 wav 与 mp3 输入。用 ffmpeg 先把其他格式转成 wav 再上传。效果调优建议expression_scale控制表情幅度命令行推理默认 1.0表情夸张时降到 0.5~0.8 试试face model resolution256 出片快512 细节好显存够就直接用 512GFPGAN as Face enhancer勾选后人脸更清晰生成时间约翻倍preprocess全身图配 full Still Mode头部动作少、更不易抖动读到这里之后批量处理多组图片与音频src/generate_batch.py参数详解与使用建议docs/best_practice.mdDocker 与 macOS 安装说明docs/install.md常见错误清单docs/FAQ.md下一步建议挑一张自己的正面照片配一段你满意的旁白分别用 256 和 512 分辨率各生成一次对比口型同步度与人脸细节你会对哪些参数值得花时间调优立刻有数。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →