SadTalker:1张照片生成说话视频,3步跑通AI口型同步
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
你是否也被一个问题卡住过:想让人物出镜讲段话,却拍不到合适的视频素材?SadTalker 就是干这个的:一张肖像照片加一段音频,就能生成说话视频。它来自西安交通大学和腾讯 AI Lab,已开源。下面带你从零跑通。
🎬 30秒认识它
- 输入:1张照片 + 1段音频
- 输出:口型同步的说话视频
- 支持 256 / 512 像素两种渲染规格
- crop、resize、full 三种预处理模式
- 可选 gfpgan 面部增强
- WebUI 界面与命令行两种用法
它的底层是 3D 面部重建模型,头部动作和表情比纯2D方法更稳,这是最差异化的地方。
🚀 从零到跑通:3步安装步骤
环境要求:
- Python 3.8
- Git
- FFmpeg
启动步骤:
- 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker- 运行
bash webui.sh(Windows 双击webui.bat)启动 WebUI,自动装依赖。 - 一键下载全部模型文件,缺了它跑不出结果:
bash scripts/download_models.sh- 用一条命令生成视频,跑完会提示结果文件路径:
python inference.py --driven_audio ./examples/driven_audio/bus_chinese.wav \ --source_image ./examples/source_image/full_body_1.png \ --enhancer gfpgan- 到
results/目录按时间戳找到生成的 mp4,直接播放检查效果。
⚙️ 出效果的关键:口型同步参数怎么调
默认推荐参数,直接能跑:
| 参数 | 推荐值 | 作用 |
|---|---|---|
--preprocess | crop | 默认模式,只动面部 |
--size | 256 | 渲染分辨率,内存紧张选256 |
--enhancer | gfpgan | 面部细节增强 |
--expression_scale | 1.0 | 表情强度基准值 |
--still | 不加 | 全身图时再加 |
预处理模式怎么选
crop是默认值,只生成面部区域,效果最稳。证件照类的正面图用resize。全身图用full并配合--still。选错模式是效果差的最常见原因。
expression_scale 怎么调
默认 1.0。表情显得平淡就调大到 1.2~1.5,动作过夸张就调小到 0.8。一次只动这一个变量,对比两次结果再定。
全身模式为什么加 --still
--still沿用原图姿态,头部摆动更少,全身画面更自然。再叠--enhancer gfpgan,画质能再上一个台阶,详见 最佳实践文档。
🛠️ 进阶玩法
- 参考视频模式:用
--ref_eyeblink传入一段真人视频,借它的眨眼和眉眼动作,生成的眼神更自然。 - 全身生成:
--preprocess full加--still,人脸动画自动贴回原图,身体部分保持不动。 - 自由视角:
--input_yaw -20 30 10这类参数控制头部朝向变化,单图即可转出多角度说话视频。
💡 它能帮你做什么
- 虚拟主播口播:无需真人出镜,照片角色按音频讲解,批量产出内容
- 课程与教学:讲师照片配一段录音,快速做出发音演示视频
- 电商宣传:店主照片读一段产品介绍,省掉拍摄和后期
🐛 避坑清单
ffmpeg is not recognized→ 安装 ffmpeg 并确认在系统 PATH 中,Linux 可用conda install ffmpegFileNotFoundError: ...similarity_Lm3D_all.mat→ 模型没下载全,重跑scripts/download_models.sh并核对目录- 报
unexpected EOF文件损坏 → 模型没下完整,重新下载 gfpgan 补丁包 - 音频格式不对 → 输入音频请用 wav 或 mp3,其他格式会解码报错
- CUDA 显存不足 → 运行前设置
PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128,或把--size降到 256
更多问题可以先翻 FAQ 文档,多数报错都有现成答案。
🚀 下一步
你现在已经能:装环境、下模型、一条命令出片,还会调预处理模式和表情强度这 3 个关键参数。剩下的就是多换几张图试手感了。
现在就试试,把第一支视频跑出来吧。
- 示例素材目录:examples/
- 项目配置参考:src/config/
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考