SadTalker 音频驱动人脸动画部署指南:模型下载与环境配置一次跑通

📅 发布时间:2026/9/12 6:27:59
SadTalker 音频驱动人脸动画部署指南:模型下载与环境配置一次跑通
SadTalker 音频驱动人脸动画部署指南模型下载与环境配置一次跑通【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker一张静态人像配上音频就能开口说话——SadTalkerCVPR 2023做的就是这件事。若你卡在模型下载、依赖报错或显存不足上这份指南把拉代码、建环境、下模型到跑出第一条说话视频的路径拆清楚按自己的节奏取用即可。先想清楚走哪条路动手装环境前先判断自己要哪种结果能省掉不必要的折腾。三条典型路线各有取舍快速体验只想看效果、不折腾本地环境。直接用仓库自带 Gradio 界面或云端 Colab短时间内就能看到说话视频适合先验证思路。稳定部署要长期跑、批量出片。本地 conda 建隔离环境 命令行推理可控、可复现是大多数人的最终落点。质量调优追求人脸细节。在稳定部署之上把渲染分辨率提到 512 并叠加 GFPGAN 人脸增强画面更锐利代价是更吃显存。先定路线后面的底座与命令才能对号入座。通用底座这一节解决装在哪、装什么把前置软件与代码仓库一次性就位。要做什么装 Python 3.8、Conda、Git、FFmpeg 四件套拉下 SadTalker 代码并建一个隔离虚拟环境避免依赖互相污染。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txt为什么是这个顺序先建隔离环境再装 PyTorch 与依赖能防止系统 Python 被污染FFmpeg 单独用 conda 装省掉手动配 PATH 的麻烦。跨平台提示macOS含 M 系列芯片额外执行pip install dlibWindows 建议把 FFmpeg 加进 PATH或改用 WSL。细节见 docs/install.md。三条部署路径按需取用底座就位后按选定路线取对应命令即可不必全跑。快速体验WebUI场景只想点按钮出片。bash webui.sh # Linux/macOSWindows 直接双击 webui.bat预期结果自动建虚拟环境并拉起浏览器界面上传图片与音频点生成即可。若要走 Gradio 脚本先pip install TTS再python app_sadtalker.py。稳定部署命令行推理场景要批量、可复现地出片。bash scripts/download_models.sh这条脚本会自动建checkpoints/与gfpgan/weights/两个目录并拉下全部模型mapping_00109-model.pth.tar、mapping_00229-model.pth.tar、SadTalker_V0.0.2_256.safetensors、SadTalker_V0.0.2_512.safetensors以及 GFPGAN 增强用的GFPGANv1.4.pth等。下载完成后用 inference.py 做命令行推理即可。质量调优高分辨率 增强场景对人脸细节有要求。python inference.py --driven_audio 音频.wav --source_image 图片.png --size 512 --enhancer gfpgan预期结果512 分辨率叠加 GFPGAN 修复的人脸比默认 256 更清晰。首次运行与验收这一节解决怎么算跑通。先下模型再跑一条最短的推理命令bash scripts/download_models.sh python inference.py \ --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results判断成功看两点终端最后打印出The generated video is named: ...且results/下按时间戳生成了.mp4。打开这段视频人像口型跟随音频变化就代表环境、模型、依赖全部就位。素材可随意替换源图与驱动音频都在 examples/ 里。高频翻车点速查遇到报错先对下表多数问题出在模型没下全或依赖缺一项。报错症状可能原因处理办法ffmpeg找不到FFmpeg 未装或没进 PATHLinuxconda install ffmpegmacOSbrew install ffmpegWindows 加入 PATHNo module named ai模型文件缺失或损坏重跑bash scripts/download_models.sh核对checkpoints/内文件大小FileNotFoundError: ...similarity_Lm3D_all.mat3DMM 资源目录不全确认 src/config/ 中该文件存在unexpected EOF ... might be corrupted增强模型没下全补齐gfpgan/weights/下的四个权重文件CUDA out of memory显存碎片化 / 分辨率过高见下方环境变量必要时降回 256音频解码报错输入格式不对只支持wav/mp3转成其一再传入显存不足时先设分配策略再启动推理# Linux / macOS export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 # Windows set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 python inference.py ...更多场景可在 docs/FAQ.md 里继续查。进阶调优跑通之后下面这些开关能让你控制动画的神韵按需叠加。参考视频控姿态用--ref_pose传入一段视频借用人物头部动作--ref_eyeblink单独借眨眼让眉毛更自然。参考视频见 examples/ref_video/。全身/整图动画加--preprocess full --still把裁切区域贴回原图减少头部乱晃适合全身像。表情强度--expression_scale调大让表情更夸张调小更收敛。自由视角--input_yaw -20 30 10之类可指定头部偏航角度序列做 4D 自由视角。完整参数含义见 docs/best_practice.md。收尾到这里从拉代码、下模型到跑出说话视频的路径已经走通剩下的是换素材、调参数出你想要的成片。模型与功能仍在迭代建议定期用git pull同步代码、重跑bash scripts/download_models.sh更新权重遇到更深的依赖或部署问题回到 docs/FAQ.md 与 docs/install.md 对照排查。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考