SadTalker 说话头视频生成入门指南:一张照片配一段音频做出说话视频
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
SadTalker 是一款音频驱动的说话头视频生成开源工具:输入一张人像照片和一段音频,输出人物开口说话、头部带自然运动的视频。全程本地离线运行,适合内容创作者、教育者和没有编程背景的新手。
项目定位:三个值得知道的点
SadTalker 是 CVPR 2023 论文项目,由西安交通大学与腾讯 AI Lab 联合发布,采用 Apache 2.0 许可,可免费商用。核心流程就是:单张肖像 + 音频 = 说话头视频。
- 用音频驱动 3D 运动系数,口型、头姿、表情由音频推算,运动比直接生成更稳定
- 支持 512x512 分辨率面部渲染,可叠加 gfpgan / RestoreFormer 修复面部细节
- 提供 crop / resize / full 三种预处理模式,还能从参考视频借用眨眼与头姿
🚀 3 步跑起本地 WebUI
环境准备一句话带过:装好 Python 3.8、git、ffmpeg 即可。
- 获取代码:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker- 下载模型。Linux/Mac 在仓库目录执行
bash scripts/download_models.sh一键完成;Windows 用户可改从 Releases 页面手动下载后放到对应目录。 - 启动 WebUI:
- Windows:双击
webui.bat,依赖会自动安装,完成后浏览器直接打开 - Linux/Mac:执行
bash webui.sh
- Windows:双击
在页面里上传图片和音频、选择模式、点生成即可。习惯命令行的话,一条命令就够:
python inference.py --driven_audio <audio.wav> --source_image <portrait.png> --enhancer gfpgan结果保存在results/下带时间戳的文件夹里。
⚙️ 速查影响效果的几个参数
| 参数 | 默认值 | 作用 |
|---|---|---|
--preprocess | crop | crop只生成面部区域,最稳定;resize整图缩放,适合证件照式图片;full整图动画,需配合--still |
--still | 关 | 保持原图头部姿态,减少头部运动,全身图模式建议开启 |
--expression_scale | 1.0 | 数值越大表情越夸张 |
--enhancer | 无 | 填gfpgan或RestoreFormer,修复面部细节 |
--ref_eyeblink | 无 | 指定参考视频,借用其中的眨眼动作 |
--result_dir | ./results | 输出目录 |
🖼️ 让效果更好的两处选择
选图
- 优先正面、光线均匀、分辨率高的人像;证件照式图片用 resize 模式
- 官方提供的示例人像长这样:
- 目前只支持真人或写实风格人像,动漫脸暂不支持,官方文档中有说明
选音频与参考视频
- 音频只支持 wav / mp3,底噪越小口型越准
- 默认生成的眨眼和头部动作偏少,可用
--ref_eyeblink指定一段视频借动作,效果对比如下:
适合谁用
- 教育工作者:把静态讲师照片变成课程讲解视频,或做语言发音演示
- 内容创作者:数字人口播、动漫角色配音视频
- 开发者:完全离线本地推理,也可通过 Stable Diffusion WebUI 扩展接入现有工作流
排查清单:遇到问题按序检查
- 提示
ffmpeg不是内部命令:安装 ffmpeg 并加入 PATH - 找不到模型文件(如 BFM、
.mat缺失):重新执行模型下载脚本,确认下载完整 ModuleNotFoundError: No module named 'ai':epoch_20.pth模型损坏,重新下载- Mac M1 报 Illegal Hardware:单独执行
pip install dlib重装 - CUDA 显存不足:运行前设置环境变量
PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128 - 音频解码报错:输入音频不是 wav / mp3,先转换格式
完整问答见 docs/FAQ.md。
查阅更多文档
各模式的官方推荐配置、--ref_pose头姿借用等进阶用法,见最佳实践与配置指南;3D 面部渲染与自由视角生成在 docs/face3d.md 中有专门说明。
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考