Duix.Avatar 数字人本地部署指南:克隆形象与声音,离线生成口播视频
发布时间:2026/9/11 4:03:57 锦皓数字建站

Duix.Avatar 数字人本地部署指南克隆形象与声音离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做数字人视频过去要么是找团队定制要么是依赖云端平台——前者贵后者意味着真人视频和声音数据要上传到别人的服务器。开源项目 Duix.Avatar 提供了另一条路整套能力跑在你自己的机器上提交一段 10 秒左右的带声音视频就能克隆出数字人的形象和声音之后输入文案或上传音频即可驱动数字人完成口型匹配自动生成口播视频。数据全程不出本机适合在意隐私、有内网合规要求的使用者。本文不堆功能对比只回答四个问题你的机器能不能跑起来、第一次部署怎么做、部署后功能怎么用、常见故障怎么处理。会 Docker 基本就能跟下来硬件条件不足时也建议先看完上手门槛一节再决定是否继续。项目速览适合谁能做什么典型使用对象内容创作者用本人形象批量生成口播视频课程、产品介绍、自媒体更新都可以复用同一个数字分身无需反复出镜录制。企业与培训团队内部材料不需要离开内网即可完成视频制作降低数据外发风险。开发者模特训练、音频合成、视频合成三组能力都以本地 API 形式暴露可以嵌入自己的产品或批量生成流水线。核心能力一览能力说明形象 声音克隆上传 10 秒左右、带真人说话声音的视频分别完成外貌与声音克隆文本 / 音频双驱动输入文案自动转语音驱动也可直接使用自备录音口型同步合成画面与声音在本地完成匹配合成导出可播放的视频多语言文案脚本支持中、英、日、韩、法、德、阿拉伯、西八种语言本地 API训练、音频合成、视频合成接口在本地端口开放可用程序调用上手门槛说明硬件是硬门槛部署前先对照。项目给出的推荐配置为 i5-13400F、32G 内存、RTX 4070其中内存是必要条件16G 内存机器可能出现服务无法启动的情况。项目要求 / 成本系统Windows 1019042.1526 及以上或 Ubuntu 22.04显卡英伟达显卡且驱动安装正常全部算力依赖本地 GPU磁盘数据目录所在盘空闲 30G 以上Docker 镜像盘建议空闲 100G 以上时间与流量首次拉取镜像约 70G通常半小时到一小时取决于网速从 0 到 1推荐的部署路径以下以 Windows Docker Desktop 为例Ubuntu 22.04 的步骤类似只是换用对应的 compose 文件。部署前检查确认显卡驱动执行nvidia-smi能看到显卡信息才算正常。没有英伟达显卡或驱动异常三个服务都起不来。检查 WSLwsl --list --verbose未安装则先执行wsl --install再用wsl --update更新。安装并启动一次 Docker Desktop接受协议、跳过登录即可。若 C 盘空闲不足 100G进入 Docker 设置 → Resources把镜像存储位置改到空间充足的磁盘。推荐启动步骤git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d资源紧张时可选轻量方案docker-compose -f docker-compose-lite.yml up -d只部署视频合成一个服务适合已有音频素材、想降低占用的场景具体可用功能以客户端实际表现为准。RTX 50 系列显卡以及 30/40 系列 CUDA 12.8 用户改用docker-compose -f docker-compose-5090.yml up -d。客户端从仓库 Releases 页面下载 Windows 安装包双击安装即可如果你需要自行构建客户端则还需要 Node.js 18 环境。启动后如何验证是否成功打开 Docker Desktop确认容器全部处于 Running 状态。完整部署应有三个服务asr语音识别、tts语音合成、gen-video视频合成lite 版本只有一个 gen-video。然后做一次完整闭环新建模特上传 10 秒带声音视频→ 在创建视频里输入一段短句 → 等待本地合成完成并下载播放。能正常出片说明整条链路已打通。注意语音识别服务首次就绪可能需要几分钟刚启动时建议稍等再操作。典型使用场景把功能翻译成工作流场景一文本驱动口播视频适用对象课程讲解、产品介绍、账号口播等以文案为主的内容。输入已克隆的模特 一段文本脚本。操作步骤在创建形象中上传带声音的 10 秒视频完成克隆到创建视频输入文案并提交生成等待本地合成完成后下载。输出口型与文本内容匹配的口播视频。注意事项训练视频必须有人在说话否则声音克隆会直接报错文案越长合成耗时通常越久耐心等待不要重复提交任务。场景二自备音频合成视频适用对象已有录制好的配音只想补一个出镜形象。输入已克隆的模特 本地音频文件。操作步骤在客户端选择模特上传音频启动合成完成后取走视频。输出按自备音频节奏、语调驱动的说话视频。注意事项建议音频清晰、噪音小嘈杂录音对合成效果可能有影响以实际结果为准。场景三通过本地 API 接入自有应用适用对象想批量生成或把数字人能力集成进产品流程的开发者。输入针对http://127.0.0.1的 HTTP 请求音频合成在 18180 端口视频合成在 8383 端口。操作步骤先调模特训练接口拿到返回值供后续音频合成引用再调音频合成最后提交视频合成任务并用进度查询接口取结果。客户端内置的调用示例在 src/main/service/ 目录下参数细节见 README 的开放 API 章节。输出可编程、无需界面操作的数字人生产流水线。注意事项训练接口的返回字段必须记录并传给下一步合成任务为异步执行不要假设提交后立即完成。常见问题与排查现象可能原因处理建议docker-compose up报连接超时 / request canceledDocker Hub 官方源连接不稳定配置国内镜像源或借助代理工具新增模特报错提示视频必须有声音上传的视频无声音或没有人在说话重新录制一段真人说话的视频定制模特报 Connection refusedASR 服务启动慢或内存不足16G 可能起不来服务端启动后等几分钟再操作内存建议 32Gtts 容器反复重启社区已知问题issue #69先升级到最新镜像再试客户端连不上服务服务未 Running 或版本过旧到 deploy 目录重新执行docker-compose up -d更新镜像拉取镜像失败时可在 Docker Engine 设置中添加镜像源格式参考{ registry-mirrors: [ https://docker.m.daocloud.io, https://docker.1ms.run ] }README 中列出了多个常见镜像源但镜像源可用性随时间变化建议自行验证后选用当前可用的地址。排查问题前先拿到两份日志客户端日志在客户端设置菜单中打开日志日志为 main.log 文件以及服务端容器日志在 Docker 中点开对应服务的 Logs 页复制关键报错段落。项目仓库内还有一份 常见问题 文档提问前先通读一遍多数启动类问题都有现成答案。进阶优化与资源入口50 系列显卡使用docker-compose-5090.yml部署基于 torch 预览版本官方说明已在 5090 上测试通过。磁盘空间紧张lite 版本只部署视频合成服务数据目录compose 中的duix_avatar_data挂载路径可在 compose 文件里改到其他磁盘。显存 / 共享内存参数compose 文件中的PYTORCH_CUDA_ALLOC_CONF与shm_size可调整建议先保持默认值仅在遇到显存不足报错时再动。Ubuntu 22.04安装 docker、nvidia-container-toolkit 后用docker-compose -f docker-compose-linux.yml up -d启动客户端为 AppImage 免安装root 用户运行需加--no-sandbox参数。资源入口deploy/ 目录存放各环境的 compose 文件src/main/ 是客户端主进程与本地接口调用实现LICENSE 为开源协议——支持免费商用但用户量超过 10 万或年营收超过 1000 万美元的企业需签署商业许可协议商用前请自行核对条款。写在最后如果你打算动手可以按这个顺序来先对照上表的显卡、内存、磁盘条件确认机器可用再按推荐路径完成一次部署把克隆 → 生成完整走通一遍遇到问题时先确认三个服务的 Running 状态再翻常见问题文档。仍然卡住时到仓库的 Issue 区提交问题附上截图和日志通常更容易得到帮助。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。