资讯详情

资讯详情

Duix.Avatar AI数字人本地部署完整指南:一段10秒视频做出数字人视频

Duix.Avatar AI数字人本地部署完整指南一段10秒视频做出数字人视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想象这个场景你想把一份周报做成一分钟的口播视频但不想真人出镜也不想为商用数字人服务按月付费。Duix.Avatar 是一个真正开源的 AI 数字人项目支持本地部署和 API 调用提交一段 10 秒左右的视频就能克隆你的形象和声音之后输入文案或上传音频即可生成口播视频。所有计算跑在你自己的显卡上素材不用离开电脑。只要一台带英伟达显卡的 PC就能完成这次 AI 数字人本地部署。 一分钟看懂Duix.Avatar 能做什么这一节用 5 条说清项目定位以及它和云上数字人服务的关键差异。开源免费商用代码、部署配置、客户端源码全在仓库里协议支持全球免费商用只有用户量超 10 万或年营收超 1000 万美元的企业需要签署商业许可协议见 LICENSE全离线运行语音合成、语音识别、视频生成三个容器全部跑在本地 GPU 上视频和音频文件不经过任何云端10 秒视频完成克隆上传一段带人声的短视频程序用 ffmpeg 转码并分离出音轨一次完成形象建模和声音克隆文字、语音双驱动可以输文案自动合成语音再驱动口型也可以直接用自己的录音驱动脚本支持 8 种语言英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语和传统 3D 数字人方案比它把数万美元的制作成本降到了「一张显卡 开源软件」和商用 SaaS 比代价是硬件门槛你需要 32G 内存和英伟达显卡。 部署前准备硬件软件清单这一节只列硬性要求和推荐值照单检查即可。硬件英伟达显卡 正确安装的显卡驱动必要没有 GPU 服务起不来内存 32G 及以上必要16G 可能起不了 ASR 服务推荐 CPU 第 13 代 i5-13400F、显卡 RTX 4070 级别WindowsD 盘空闲大于 30G存数字人数据C 盘空闲大于 100G存镜像Ubuntu硬盘空闲大于 100G软件Windows 10 19042.1526 或更高版本或 Ubuntu 22.04 Desktop官方验证内核 6.8.0-52-genericWindows 需 WSL2 Docker DesktopLinux 需 Docker Engine docker-compose NVIDIA Container ToolkitNode.js 18仅从源码构建客户端时需要直接用官方安装包可跳过 逐步部署四步跑通本地数字人服务这一节按「拉代码 → 装 Docker → 起服务 → 装客户端」推进每步都给了验证方法。第 1 步获取源码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar验证目录下能看到deploy/、src/和README_zh.md。第 2 步安装 WSL 与 Docker DesktopWindows先查是否装过 WSLwsl --list --verbose没有输出就先安装再更新wsl --install wsl --update然后下载 Docker Desktop Windows 版安装首次运行接受协议、跳过登录即可。验证托盘图标显示 Engine running。注意C 盘不足 100G 时在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 改到其他空闲盘再 Apply restart。第 3 步启动服务端部署配置 下有三个服务各自占一个本地端口服务端口职责duix-avatar-tts18180语音合成duix-avatar-asr10095语音识别duix-avatar-gen-video8383视频合成cd deploy docker-compose up -d只需要口型合成、自带音频源的用 lite 版只起一个服务docker-compose -f docker-compose-lite.yml up -dNVIDIA 50 系显卡30/40 系 CUDA 12.8 用户也可用此方案docker-compose -f docker-compose-5090.yml up -d这一步会拉约 70G 镜像耗时约半小时建议连 WiFi 等。Linux 上则执行docker-compose -f docker-compose-linux.yml up -d数据目录为~/duix_avatar_data。验证容器列表里三个服务全部 Runninglite 版只有duix-avatar-gen-video一个。第 4 步安装客户端Windows从项目 releases 下载Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu下载Duix.Avatar-x.x.x.AppImage直接运行root 桌面账号下打不开时终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox部署完成的判断标志客户端打开即见主界面顶部有 Create Video 和 Create Avatar 两个入口且操作列表时不报连接错误。此时本地服务已全线可用。 第一次体验做出你的第一条口播视频这一节按真实流程走一遍准备素材 → 克隆形象 → 输文案 → 拿到成片。1. 准备素材。录一段 10 秒左右、人正对镜头、光线清晰的视频。必须带声音且是本人说话——程序靠这段音轨做声音克隆静音视频会在下一步直接报错。推荐 MP4 格式。2. 创建形象。打开客户端点右上角 Create Avatar上传视频并命名提交。后台会自动把视频转成 H.264、用 ffmpeg 分离音频、送 TTS 服务做对齐、注册新模特。几分钟后回到主页的 My Avatars 页签就能看到刚建的形象。3. 输文案生成。点 Create Video选中刚建的形象输入口播文案或直接上传一个音频文件提交。有文案时客户端先调 TTS 服务合成音轨再把「音频 形象视频」交给视频生成服务做口型对齐任务按队列串行执行列表里能看到排队位置。4. 拿到成片。合成完成后 My Works 里的状态变为 success可在线预览并导出文件落在D:\duix_avatar_data\face2faceLinux 为~/duix_avatar_data/face2face。从一段素材到成片全程几分钟形象、声音和文件都留在本机——这就是本地部署相对云服务的核心差别。 功能详解形象克隆、文字驱动、语音驱动这一节拆解部署后最常用的三条主线每条按「功能 → 路径 → 效果 → Tip」展开。一段 10 秒视频同时克隆形象与声音功能提交一个视频同时得到形象模特和可复用的声音模型。操作路径主页 → Create Avatar → 上传视频 → 命名提交。效果与参数音频会被写入D:\duix_avatar_data\voice\data供 TTS 服务使用克隆完成后该形象的所有口播都用这个声音朗读。Tip视频里人声越干净、越接近正常说话音量之后的口播还原度越高。文字驱动输文案自动配音对口型功能只给文字系统自动合成语音并驱动口型。操作路径Create Video → 选形象 → 输入文案 → 生成。效果与参数文案先经 18180 端口的 TTS 接口出音轨再交 8383 端口的视频服务合成任务进队列串行执行状态在 My Works 里逐个刷新。Tip多段文案可以连续提交客户端会按提交顺序排队不用盯着单条跑完。语音驱动用自己的录音直接对口型功能不走 TTS直接拿已有录音驱动口型。操作路径Create Video → 选形象 → 上传音频 → 生成。效果与参数检测到音频文件时客户端跳过 TTS 环节直接用「你的音频 形象视频」调视频合成接口音轨保留原声。Tip这条路线适合你本人出镜录制、再让数字人替嘴的场景录音环境安静比后期降噪更有效。 常见问题排查先对照这 5 条这一节整理了部署和首次使用中最容易卡住的 5 个问题按「现象 → 原因 → 解决」给出。1.docker-compose up -d拉镜像失败报Client.Timeout/request canceled现象三个服务全部拉取失败错误里出现registry-1.docker.io超时。原因Docker Hub 官方源连接不稳定。解决在 Docker Desktop 的 Settings → Docker Engine 配置里加registry-mirrors指向国内镜像源Apply restart 后重新执行docker-compose up -dLinux 改/etc/docker/daemon.json。2. 服务起不来或反复重启现象docker ps里服务不是 Runningdocker logs见 CUDA 相关报错。原因没有英伟达显卡或显卡驱动 / NVIDIA Container Toolkit 没装好。本项目所有算力都在本地没有 GPU 三个服务必然起不来。解决先在宿主机执行nvidia-smi确认能显示显卡信息再按 README_zh.md 的 Ubuntu 章节补装 NVIDIA Container Toolkit 并重启 Docker。3. 定制模特报Connection refused现象客户端克隆形象时日志出现「建立 funasr 连接异常[Errno 111] Connection refused」。原因ASR 服务duix-avatar-asr启动很慢连接时还没就绪内存只有 16G 的机器可能根本起不了它。解决服务端启动后等几分钟再操作克隆内存低于 32G 先升级硬件。服务日志可以在 Docker Desktop 里点开对应容器复制方便定位。4. 新增模特提交即报错现象上传视频创建形象很快失败。原因素材视频没有声音、或画面里没有人说话程序拿不到用于声音克隆的音频。解决重录一段带清晰人声的素材再提交。5. 客户端连不上服务现象客户端操作超时或提示服务不可用。原因三个服务未全部 Running或 18180 / 10095 / 8383 端口被占用。解决先docker ps核对状态再docker logs duix-avatar-gen-video逐个看日志客户端右上角菜单有 Open Log可取客户端侧日志对照。⚙️ 进阶玩法直接调用服务 API 做集成服务跑起来后会在本地暴露 HTTP 接口你可以把它们接进自己的脚本或业务系统。端口对照速查三个服务全部监听127.0.0.1无需外网接口用途http://127.0.0.1:18180/v1/preprocess_and_tran音频预处理 对齐返回声音克隆所需字段http://127.0.0.1:18180/v1/invoke文本合成语音TTShttp://127.0.0.1:8383/easy/submit提交视频合成任务http://127.0.0.1:8383/easy/query?code{code}轮询合成进度视频合成接口二次开发最常用提交任务 轮询进度完整参数与返回值参考 src/main/service/video.jsawait fetch(http://127.0.0.1:8383/easy/submit, { method: POST, body: JSON.stringify({ audio_url: D:/duix_avatar_data/face2face/temp/xx.wav, video_url: D:/duix_avatar_data/face2face/temp/xx.mp4, code: uuid, chaofen: 0, watermark_switch: 0, pn: 1 }) }) await fetch(http://127.0.0.1:8383/easy/query?code${uuid})code是唯一任务号查询接口轮询到code为 10000 且状态为 2 时即合成完成结果文件路径在返回的data.result里。 适用场景三个回本最快的用法这一节挑三个最划算的用法说明谁在用、怎么用。企业内部培训与产品教程运营录一次 10 秒样本建好形象之后每篇新文档贴文案就能出成片不用反复约棚、约人单条边际成本几乎为零。多语言内容脚本支持中、英、日、韩等 8 种语言同一形象翻译后依次生成可产出口型一致的整套多语言口播视频。数据敏感的合规场景金融、法务、医疗等内部资料音频和视频全程不出本机隐私顾虑天然规避比走云端 SaaS 更省事。 资源与下一步这一节集中给出后续最常用的仓库内入口。官方 FAQdoc/常见问题.md含自查步骤和提问模板部署配置deploy/四个 compose 文件分别对应完整版、lite 版、Linux 版和 5090 版服务端接口参考src/main/service/model.js、voice.js、video.js分别对应形象训练、语音合成、视频合成三条链路商用许可LICENSE协议全文见仓库内的 Duix.Avatar model community Licensing Agreement 文档项目更新比较频繁提问或排障前建议先git pull看新版是否已包含修复。现在就可以把容器起起来录一段 10 秒的素材做出你的第一条数字人视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →