用10秒视频克隆你的AI数字人:口播视频生成全在本地跑
用10秒视频克隆你的AI数字人口播视频生成全在本地跑【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个完全离线的AI数字人开源项目上传一段10秒视频即可完成数字人克隆输入文案就能生成口播视频全程在你的电脑上运行。适合自媒体创作者、培训讲师以及不想把面部声音交给云端的开发者。它帮你解决什么问题文案一改就要重新录制。你作为自媒体作者一条3分钟口播视频说错一句就得重录换个选题还得换场地重新拍。克隆数字人后只改文案视频随时重新生成。外包贵、在线工具有隐私顾虑。定制3D数字人传统上要数万元SaaS平台则要你把脸和声音传到别人的服务器。Duix.Avatar 全程本地运行数据不出你的电脑。非技术同学不知道从哪下手。服务端一条 compose 命令拉起来客户端是双击即开的应用界面只有“创建数字人”和“创建视频”两个入口。核心能力一览形象与声音克隆——上传一段带说话声音的10秒视频得到一个可反复使用的数字人模型。文字驱动口播视频生成——输入文案自动合成语音、对口型输出成片。语音驱动——直接上传音频文件用你自己的语气节奏让形象说话。多模型管理——导入多个数字人一键切换按不同选题批量出片。八种语言文案——中、英、日、韩、法、德、阿、西语都支持。本地开放 API——模型训练与视频合成接口在本地端口暴露方便接入自己的系统。图客户端主界面上方是“Create Video / Create Avatar”两个功能区下方为数字人模型列表5分钟跑通部署前置条件Windows 1019042 以上或 Ubuntu 22.04NVIDIA 显卡并装好驱动显存 8GB 以上更稳妥Docker 镜像所在磁盘默认 C 盘留 100GB 以上数据盘默认 D 盘留 30GB 以上。第 1 步克隆仓库# 克隆项目唯一用到的外部操作 git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar第 2 步启动服务端# 进入 deploy 目录一条命令拉起全部 3 个服务lite 版换 docker-compose-lite.yml cd Duix-Avatar/deploy docker-compose up -d⚠️ 命令本身 5 分钟搞定但首次拉镜像约 70GB 流量、耗时半小时左右记得连 WiFi。第 3 步安装客户端Windows 双击官方包的Duix.Avatar-x.x.x-setup.exeUbuntu 双击Duix.Avatar-x.x.x.AppImage启动root 用户需改用终端命令./Duix.Avatar-x.x.x.AppImage --no-sandbox。确认跑通Docker 页面看到 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个容器均为 Runninglite 版只有 gen-video 一个再打开客户端能进入主界面即可。底层是怎么做到的通俗版整条流水线像三个人分工各跑在 Docker 服务里识别ASR听你上传视频里的说话声转写成文字这份转写是声音克隆的参照材料。语音合成TTS从几秒音频里学你的音色之后用你的语气朗读任意文案。视频合成把合成音频叠到原视频画面上驱动嘴部跟随声音动输出成片。客户端只是把这些请求转发给三个服务并跟踪进度的“调度员”任务流转见 src/main/service/video.js三个服务的端口与参数定义在 deploy/docker-compose.yml。配置与性能参考最低/推荐两档项目最低配置推荐配置体验差异CPU4 核通用处理器13 代 Intel i5-13400F 及以上核数越多客户端操作与任务排队越顺内存16GB32GB官方标注必要16GB 时 ASR 服务可能起不来显卡8GB 显存的 NVIDIA 卡社区反馈可用RTX 4070显存更高能扛更长视频与更高输出分辨率存储镜像盘 100GB 数据盘 30GB 空闲NVMe SSD首次镜像约 70GBSSD 大文件读写更快踩坑与排错镜像下载慢、连接失败现象docker-compose up -d报request canceled、超时类错误。原因国内直连 Docker Hub 官方源不稳定。解法在 daemon.json 的 registry-mirrors 添加国内镜像源重启 Docker 再执行。图Docker 镜像加速源配置位置添加后重启 Docker 生效服务启动失败、容器反复重启现象三个容器中某个起不来或不停重启。原因项目算力全在 GPU——没有 NVIDIA 显卡、没装驱动或镜像盘空间不足。解法用nvidia-smi确认显卡磁盘紧张时在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 磁盘镜像位置改到空间更大的盘。图Docker Desktop 中更改 WSL 磁盘镜像位置的入口红框处 Browse 选择新磁盘显存不够、视频生成失败现象生成任务报显存不足而失败。解法调低输出分辨率或缩短单次时长或改用 lite 版只保留视频合成服务docker-compose -f docker-compose-lite.yml up -d。模型克隆失败现象上传视频报错或服务刚起来就报 Connection refused。原因克隆视频必须包含人声声音是克隆素材ASR 服务启动慢16GB 内存可能带不动。解法重录一段 10 秒以上、人声清晰的视频服务端启动后等几分钟再操作内存 16GB 建议升到 32GB。端口冲突现象容器都起来了客户端却连不上本地服务。原因18180、10095、8383 端口被其他程序占用。解法在 deploy/docker-compose.yml 中改端口映射左侧数字如 18180 改 18181右侧容器端口不动。仍定位不了打开三个容器的 Logs 页点右侧复制图标把完整报错文本提出来。图Docker 容器日志页右侧复制图标可提取完整报错文本适合谁、怎么用自媒体创作者克隆自己一次同一选题批量出同音色的口播视频不用反复换场地。培训与课程把标准化课纲做成固定形象的口播视频多期学员反复复用。二次开发者直接调用本地开放 API把“输文案 → 出视频”嵌进自己的产品。进阶方向50 系显卡30/40 系 cuda 12.8 环境也可试可换 5090 专用 compose 文件部署。熟悉模特训练、音频合成、视频合成三个本地接口后可搭自己的批量生成流水线。Duix.Avatar 把“录一条口播视频”变成“输文案 → 拿成片”的本地流程全程不出你的电脑。硬件满足的话建议先克隆一个自己的模型试跑一遍。更多细节看官方文档doc/常见问题.md【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考