8G显存跑通AI数字人:Duix.Avatar本地部署实测
8G显存跑通AI数字人Duix.Avatar本地部署实测【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar上周我接到一个内训视频需求20 节课的口播内容预算只够一张显卡。被一条帖子提到 8G 显存就能跑数字人我把 Duix.Avatar 这套开源 AI 数字人方案在本地跑通了——提交 10 秒视频克隆形象和声音之后输入文案即可离线生成口播视频全程不联网。️ 环境准备与首次运行硬件要求一句话一块装了驱动的 NVIDIA 显卡官方推荐 RTX 4070社区实测8G 显存可用、32G 内存、约100G空闲磁盘。Windows 上最少步骤先装好 WSL 和 Docker Desktop然后进仓库的deploy目录敲两条命令cd deploy docker-compose up -d # 拉取 ASR/TTS/视频合成三个镜像并启动服务首次拉取会消耗约 70G 流量官方说半小时左右实际看网速。成功标志很直观Docker 里三个容器tts、asr、gen-video全部 Running。再装上官方客户端安装包首页就是两个大按钮——Create Video 和 Create Avatar。我在我的数字模特里看到了刚克隆的形象贴一段文案点生成几十秒后我的作品列表里多了一条可预览、可下载的视频。核心能力逐项拆解整条流水线在本地串成一条链看完这个流程基本就懂它怎么工作形象 声音克隆10 秒换一个数字分身解决的是不想真人出镜但又想要固定形象的问题。我录了一段 10 秒正面口播上传客户端自动转 H264、分离音轨再走 ASR 识别和 TTS 声音克隆几分钟内模特就建好了。克隆音色的相似度我觉得够用语速和语调都保留了。注意素材必须有人声且人在说话静音视频会直接报错。操作示例客户端 Create Avatar 页上传视频即可无需其他配置。文本驱动合成输入文案直接出口播视频解决每期都要重新录的问题。填文案点生成后它先调 TTS 把文案念成克隆音色的 wav再交给 face2face 做口型驱动我在作品列表里直接预览下载。一条 60 秒文案的视频等待时间在分钟级文案支持中、英、日、韩、法、德、阿、西 8 种语言也可以跳过 TTS 直接上传音频文件驱动适合已有录音的场景。开放 APIGUI 做不了批量时解决脚本化生产的问题。服务端在本地暴露两个端口18180TTS和 8383视频合成模特训练、音频合成、视频合成各有独立接口。我写脚本串起来之后批量任务就退化成 for 循环。最核心的视频合成接口长这样# 提交口型合成任务 curl -X POST http://127.0.0.1:8383/easy/submit -H Content-Type: application/json \ -d {audio_url:/xx/a.wav,video_url:/xx/b.mp4,code:唯一uuid,chaofen:0,watermark_switch:0,pn:1} # 轮询进度status2 表示完成 curl http://127.0.0.1:8383/easy/query?code唯一uuid实测对比本地部署 AI 数字人 vs 云端 SaaS对比维度Duix.Avatar 本地部署云端 SaaS 数字人服务持续成本一次性硬件投入生成不限次数按分钟/按次持续计费数据流向全程离线素材不出本机原始视频与文案需上传克隆门槛10 秒视频克隆形象声音普遍需更长素材或人工审核口型精调官方自评效果可用官方 API 版更高清差距最大的维度是数据流向内训课件、产品讲解这类素材上不了云这一条对很多团队就是决定性的。但要说口型精调它并不领先——官方自己的对比表都承认本地开源版只是可用要更高效果得走他们的 API 服务。选它本质是用一次性硬件成本换数据主权不是换效果。三个我实际跑通的工作流个人口播号一套素材长期用适合不想露脸、但要固定分身形象的自媒体。录 10 秒正面口播素材客户端 Create Avatar 建模特一次性写好一周文案逐条生成并预览导出 MP4 分发产出素材只录一次之后每条视频只花等待时间。坑克隆视频没声音会被直接打回拍摄前自查。小团队批量生产脚本直连 API适合一次要出几十条的团队GUI 点不过来。模特视频转 H264 并分离音轨调 preprocess_and_tran 克隆声音记录返回的参考音频与文本循环调 /v1/invoke 合成音频提交 /easy/submit 并轮询 query产出几十条任务排队跑完结果路径从 query 接口里拿。坑第一次调 ASR 常遇 Connection refused等它启动完再试。企业内训课件多语言口播适合课件要出多语言版本、又不想录 N 遍的场景。录一段标准口播素材建一次数字模特输入各语言课件文案逐语言生成口播导出后内部分发产出一套素材出 8 种语言版本都由同一张脸驱动。坑16G 内存的机器 ASR 服务可能起不来机房机器建议 32G 起步。部署变体与资源开销仓库deploy目录给了四套 compose按人群选完整版docker-compose.yml三容器功能齐全默认选择轻量版docker-compose-lite.yml单容器只做视频合成入门够用50 系列版docker-compose-5090.ymlRTX 5090 等新卡基于 torch 预览版已测试通过Ubuntu 22.04docker-compose-linux.yml AppImage 客户端官方已做适配验证其他 Linux 未测部署变体磁盘内存启动耗时完整版镜像下载约 70G系统盘留 100G32G 以上拉取约半小时看网速轻量版仅视频合成镜像明显更小32G 以上明显快于完整版50系列版两个 5090 专用镜像32G 以上同完整版量级以上数据来自官方 README 的 Windows 安装章节推荐配置 i5-13400F / 32G / RTX 4070我没有单独计时。硬件提示RTX 50 系卡用普通镜像会因 CUDA 版本不匹配起不来必须走 5090 专用 compose30/40 系卡若已装 cuda 12.8 也可采用该方案。拉镜像最容易卡在网络上配好国内镜像源再动手最省事。 已知边界与我的建议Connection refused服务端刚起来就克隆形象大概率报这个错ASR 启动慢等几分钟再操作16G 内存可能直接起不来32G 是硬门槛别省。素材要求严克隆视频必须有人声且人在说话纯画面或静音视频直接失败拍之前先自查。拉镜像受网络影响大官方源连接不稳定在 daemon.json 里配国内镜像源是最省事的绕法。效果天花板官方自评本地版口型可用商业级画质建议走它的 API 服务客户端对 Windows 优化最好默认依赖 D 盘其他 Linux 未做兼容测试。出问题就去翻三个容器的日志客户端也有本地 log 文件两边对照定位很快。项目地址与延伸资源仓库git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai文档README_zh.md 有完整安装步骤排错先看 doc/常见问题.md社区README 内有技术交流群二维码issue 区更新频繁近期动态已适配 Ubuntu 22.04 桌面版50 系显卡版本基于 5090 测试通过torch 预览版跑通之前先别急着下结论跑不通也别卡着——直接去仓库提 issue附上客户端日志和容器日志大概率有人遇到过你的问题。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考