SadTalker:1张照片生成说话视频,3步跑通AI口型同步
2026/9/12 16:22:59 网站建设 项目流程

SadTalker:1张照片生成说话视频,3步跑通AI口型同步

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

你是否也被一个问题卡住过:想让人物出镜讲段话,却拍不到合适的视频素材?SadTalker 就是干这个的:一张肖像照片加一段音频,就能生成说话视频。它来自西安交通大学和腾讯 AI Lab,已开源。下面带你从零跑通。

🎬 30秒认识它

  • 输入:1张照片 + 1段音频
  • 输出:口型同步的说话视频
  • 支持 256 / 512 像素两种渲染规格
  • crop、resize、full 三种预处理模式
  • 可选 gfpgan 面部增强
  • WebUI 界面与命令行两种用法

它的底层是 3D 面部重建模型,头部动作和表情比纯2D方法更稳,这是最差异化的地方。

🚀 从零到跑通:3步安装步骤

环境要求:

  • Python 3.8
  • Git
  • FFmpeg

启动步骤:

  1. 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker
  1. 运行bash webui.sh(Windows 双击webui.bat)启动 WebUI,自动装依赖。
  2. 一键下载全部模型文件,缺了它跑不出结果:
bash scripts/download_models.sh
  1. 用一条命令生成视频,跑完会提示结果文件路径:
python inference.py --driven_audio ./examples/driven_audio/bus_chinese.wav \ --source_image ./examples/source_image/full_body_1.png \ --enhancer gfpgan
  1. results/目录按时间戳找到生成的 mp4,直接播放检查效果。

⚙️ 出效果的关键:口型同步参数怎么调

默认推荐参数,直接能跑:

参数推荐值作用
--preprocesscrop默认模式,只动面部
--size256渲染分辨率,内存紧张选256
--enhancergfpgan面部细节增强
--expression_scale1.0表情强度基准值
--still不加全身图时再加

预处理模式怎么选

crop是默认值,只生成面部区域,效果最稳。证件照类的正面图用resize。全身图用full并配合--still。选错模式是效果差的最常见原因。

expression_scale 怎么调

默认 1.0。表情显得平淡就调大到 1.2~1.5,动作过夸张就调小到 0.8。一次只动这一个变量,对比两次结果再定。

全身模式为什么加 --still

--still沿用原图姿态,头部摆动更少,全身画面更自然。再叠--enhancer gfpgan,画质能再上一个台阶,详见 最佳实践文档。

🛠️ 进阶玩法

  • 参考视频模式:用--ref_eyeblink传入一段真人视频,借它的眨眼和眉眼动作,生成的眼神更自然。
  • 全身生成--preprocess full--still,人脸动画自动贴回原图,身体部分保持不动。
  • 自由视角--input_yaw -20 30 10这类参数控制头部朝向变化,单图即可转出多角度说话视频。

💡 它能帮你做什么

  • 虚拟主播口播:无需真人出镜,照片角色按音频讲解,批量产出内容
  • 课程与教学:讲师照片配一段录音,快速做出发音演示视频
  • 电商宣传:店主照片读一段产品介绍,省掉拍摄和后期

🐛 避坑清单

  • ffmpeg is not recognized→ 安装 ffmpeg 并确认在系统 PATH 中,Linux 可用conda install ffmpeg
  • FileNotFoundError: ...similarity_Lm3D_all.mat→ 模型没下载全,重跑scripts/download_models.sh并核对目录
  • unexpected EOF文件损坏 → 模型没下完整,重新下载 gfpgan 补丁包
  • 音频格式不对 → 输入音频请用 wav 或 mp3,其他格式会解码报错
  • CUDA 显存不足 → 运行前设置PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128,或把--size降到 256

更多问题可以先翻 FAQ 文档,多数报错都有现成答案。

🚀 下一步

你现在已经能:装环境、下模型、一条命令出片,还会调预处理模式和表情强度这 3 个关键参数。剩下的就是多换几张图试手感了。

现在就试试,把第一支视频跑出来吧。

  • 示例素材目录:examples/
  • 项目配置参考:src/config/

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询