1小时跑通本地数字人:Duix-Avatar离线部署,从拉镜像到出片

📅 发布时间:2026/9/20 21:45:12
1小时跑通本地数字人:Duix-Avatar离线部署,从拉镜像到出片
1小时跑通本地数字人Duix-Avatar离线部署从拉镜像到出片【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想录产品口播视频公司规定素材不能离开办公电脑云端数字人平台又要传素材、按分钟计费。Duix-Avatar 是开源的离线数字人方案在本地克隆自己的形象和声音断网也能批量生成口播视频。它是什么Duix-Avatar 是一个本地部署的离线数字人工具包传一段10秒左右的说话视频克隆形象和声音输入文案就能直接生成口播视频。与云端平台的差别全流程本地运行素材不上传算力全在你自己的 GPU 上三个 Docker 容器就是全部服务端。上手体验先跑通再看效果前置条件三样硬性要求先别急着看代码。项目把全部算力放在本地硬件不达标服务直接起不来NVIDIA 显卡且驱动装对了nvidia-smi能出显卡信息32GB 内存16GB 大概率起不动 asr 服务Docker 镜像留 100GB 空闲三个镜像合计约 70GB 下载量数据目录 30GB 空闲系统要求 Windows 10 19042.1526 或 Ubuntu 22.04Windows 还需要一个 D 盘服务端数据默认落在D:\duix_avatar_data。5090 这类 50 系显卡别用默认 compose 文件仓库里备了专门的docker-compose-5090.yml。服务端三条命令拉起来deploy/目录开箱即用。执行下面三条Docker 会拉取 asr、tts、gen-video 三个镜像合计约 70GB千兆宽带约 30 分钟家宽可能要 1 小时git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -dUbuntu 下换成docker-compose -f docker-compose-linux.yml up -d。如果只需要视频生成、声音另有来源跑 lite 版一条命令就只起 gen-video 一个容器省一半下载量docker-compose -f docker-compose-lite.yml up -d拉完用docker-compose ps看一眼三个服务都是 Running服务端就绪。客户端装完打开一分钟看到效果客户端从 Release 页面下官方构建包本仓库是客户端源码。Windows 双击.exe安装Ubuntu 下如果用 root 用户双击 AppImage 跑不起来终端里加个参数./Duix.Avatar-x.x.x.AppImage --no-sandbox客户端启动后自动连接本地三个服务。顶部两个入口对应两步操作创建数字人上传一段 10 秒左右说话视频注意必须有声音、且是人在说话系统同时克隆形象和声音4070 上约 1 分钟生成口播视频选中刚建的数字人输入文案支持中、英、日、韩等 8 种语言选清晰度提交4070 上一段 30 秒的视频通常几分钟完成后在 My Works 里回放或导出先播一遍第一个成片口型跟着声音走、脸没串味就算跑通了。调参数最值得动的三处C 盘不够 100G装完 Docker 后在右上角 Settings → Resources 里把 Disk image location 改到空闲 100GB 的其他盘Apply restart。拉镜像慢daemon.json 里加国内镜像源具体看下文踩坑实录第 1 条。显存卡边社区有 8GB 显存跑通的实测低端卡可以切 lite 单容器并调低输出分辨率。原理速览把整套东西理解成一场对口型皮影戏你上传的 10 秒参考视频就是皮影。系统先从它身上学两件事——脸长什么样、说话时嘴怎么动再把里面的声音抽出来做声纹克隆。之后你输入任意文案TTS 先用克隆好的声音合成语音视频模型再按这段音频逐帧复现参考视频里的嘴型把新口型贴回原画面输出。所以它不是实时渲染一整个人而是把你那 10 秒的口型反复重新演一遍——参考视频越稳效果越好。踩坑实录最常见的三个1. 拉镜像失败连接超时现象docker-compose up -d报registry-1.docker.io ... Client.Timeout exceeded三个服务全挂原因Docker Hub 官方源在国内不稳定解法daemon.json 的registry-mirrors加一个国内镜像重启 Docker 再拉2. 刚启动就建模特报 Connection refused现象容器已 Running客户端点创建数字人却失败日志Connection refused原因asr 容器加载模型慢服务起了还没 ready解法启动后等 3-5 分钟再建模特且内存别低于 32GB3. 克隆模特报 file not exists现象客户端报错duix-avatar-tts容器日志里是File not exists原因音频没落到服务约定的挂载目录Windows 默认D:\duix_avatar_data\voice\data或上传的视频没有声音解法对照 deploy/docker-compose.yml 里的 volumes 核对实际目录换一段有清晰人声的视频重传进阶玩法直接调 API把生成接进自己的流水线Docker 起来后服务在本地暴露了端口18180语音合成、10095语音识别、8383视频合成。不想依赖客户端界面三步接入客户端里先克隆好模特记下对应的 speaker 和参考视频路径调POST http://127.0.0.1:18180/v1/invoke传文案和克隆声音拿到 wav调POST http://127.0.0.1:8383/easy/submit提交视频任务轮询GET /easy/query?code...拿结果const r await fetch(http://127.0.0.1:8383/easy/submit, { method: POST, headers: { Content-Type: application/json }, body: JSON.stringify({ audio_url: a.wav, video_url: b.mp4, code: task }) }) const code (await r.json()).code // 再轮询 /easy/query?code${code} 直到 status 为 2客户端源码 src/main/service/ 就是这三个接口的参考实现对着读一遍就懂。换一段自己录的素材生成新形象想换另一个人出场再录一段 10 秒说话视频光线一致、脸占满画面客户端重新建一次模特得到新数字人声音也一并换掉生成视频时选中它即可无需其他调参成片统一输出到D:\duix_avatar_data\face2face\temp拖进剪辑软件继续加字幕和 BGM整条工作流就闭环了。收尾三条建议先拉完镜像再开工70GB 别催启动等几分钟再建模特8GB 显存上 lite 单容器更多坑见仓库 doc/常见问题.md社区几乎每天在更新 issue你要的修复大概率已经在里面了。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考