资讯详情

资讯详情

SadTalker完整教程:语音驱动人脸动画,一张图一条命令生成说话视频

SadTalker完整教程语音驱动人脸动画一张图一条命令生成说话视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你有一段口播音频还有一张照片想让照片开口说话。SadTalker 是一个开源的语音驱动人脸动画工具CVPR 2023给它一张写实人像和一段音频它会输出一段嘴型、表情、头部动作都对得上音频的说话人脸视频。下面带你把环境搭起来跑通第一个动画再讲怎么调出更好的效果。能力速览项目说明输入一张写实人像图片或视频 一段音频wav/mp3输出说话人脸动画视频mp4默认存在results/目录适合谁做口播数字人、视频二创、虚拟形象的人想快速接入动画管线的开发者亮点全身图像模式、GFPGAN 人脸增强、参考视频借头部动作与眨眼、自由视角转动限制只支持写实人像动漫风暂不支持官方说明见 docs/best_practice.md最小可运行闭环整条路径只有四步拿代码、装环境、下模型、跑一条命令。1. 获取代码git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker2. 准备环境官方推荐 Python 3.8。建议用 conda 建独立环境然后装三样东西PyTorch深度学习框架、FFmpeg处理视频文件的工具系统包管理器或conda install ffmpeg都行、以及项目依赖清单 requirements.txtconda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio pip install -r requirements.txtLinux、Windows、macOS 的完整命令模板在 README.md 的 Installation 部分macOS 与 Docker 场景见 docs/install.md。3. 下载预训练模型bash scripts/download_models.shscripts/download_models.sh 会自动创建两个目录checkpoints/音频转表情、256/512 分辨率人脸渲染器等核心模型和gfpgan/weights人脸检测与增强模型。4. 跑第一条说话视频仓库自带示例音频和源图直接跑这条最小命令入口是 inference.pypython inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png看到效果怎么确认跑通了命令结束前终端会打印一行The generated video is named: ...视频落在results/时间戳.mp4。打开它看三点嘴型是否对得上音频——这是第一优先级的判断头部动作——点头、侧头是否自然有没有抖动面部质量——人脸区域有没有闪烁或畸变。判断不准时加一个参数再跑一次对比--enhancer gfpgan会用 GFPGAN人脸修复网络重绘面部细节清晰度肉眼可见地提升。调优空间常用组合都列在这里完整参数说明见 docs/best_practice.md你的目标在最小命令后追加头部动作更少、更稳--still动画化全身照片--preprocess full --still表情更丰富--expression_scale 1.2越大越夸张人脸更清晰--enhancer gfpganRestoreFormer 亦可整段视频更清晰--background_enhancer realesrgan人脸分辨率更高--size 512借一条参考视频的头部动作--ref_pose examples/ref_video/xxx.mp4借一条参考视频的眨眼--ref_eyeblink 视频路径可与上一行同指一条视频比如想要姿态自然 面部增强的全身动画python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/full_body_1.png \ --preprocess full --still --enhancer gfpgan挑源图图选对了参数就不用较劲选图记住三条单人、正脸或接近正脸面部清晰、占画面比例足够大写实风格。仓库 examples/source_image/ 里的图都是可直接跑通的参考全身照想保留原姿态用--preprocess full --still官方文档里对crop/resize/full三种模式的适用场景有逐一对比含全身照别用 resize的提醒。避坑速查现象处理提示ffmpeg不是命令装好 FFmpeg 后先跑ffmpeg -version确认CUDA out of memory运行前设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Linux 用exportWindows 用set仍不行就调小--batch_sizeModuleNotFoundError、找不到模型文件重跑bash scripts/download_models.sh确认checkpoints/与gfpgan/weights都在解码音频报错音频只支持 wav 或 mp3先转格式生成效果发飘检查源图模型只支持写实人像动漫/卡通图做不了MacM1dlib 相关报错单独执行pip install dlib重装更完整的错误对照表在 docs/FAQ.md。动手现在就跑那条最小命令拿到你的第一个说话视频——跑通之后再回头对着调优表逐项试比只看文档快得多。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →