SadTalker 说话头视频生成入门指南:一张照片配一段音频做出说话视频
2026/9/12 11:35:53 网站建设 项目流程

SadTalker 说话头视频生成入门指南:一张照片配一段音频做出说话视频

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

SadTalker 是一款音频驱动的说话头视频生成开源工具:输入一张人像照片和一段音频,输出人物开口说话、头部带自然运动的视频。全程本地离线运行,适合内容创作者、教育者和没有编程背景的新手。

项目定位:三个值得知道的点

SadTalker 是 CVPR 2023 论文项目,由西安交通大学与腾讯 AI Lab 联合发布,采用 Apache 2.0 许可,可免费商用。核心流程就是:单张肖像 + 音频 = 说话头视频。

  • 用音频驱动 3D 运动系数,口型、头姿、表情由音频推算,运动比直接生成更稳定
  • 支持 512x512 分辨率面部渲染,可叠加 gfpgan / RestoreFormer 修复面部细节
  • 提供 crop / resize / full 三种预处理模式,还能从参考视频借用眨眼与头姿

🚀 3 步跑起本地 WebUI

环境准备一句话带过:装好 Python 3.8、git、ffmpeg 即可。

  1. 获取代码:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker
  1. 下载模型。Linux/Mac 在仓库目录执行bash scripts/download_models.sh一键完成;Windows 用户可改从 Releases 页面手动下载后放到对应目录。
  2. 启动 WebUI:
    • Windows:双击webui.bat,依赖会自动安装,完成后浏览器直接打开
    • Linux/Mac:执行bash webui.sh

在页面里上传图片和音频、选择模式、点生成即可。习惯命令行的话,一条命令就够:

python inference.py --driven_audio <audio.wav> --source_image <portrait.png> --enhancer gfpgan

结果保存在results/下带时间戳的文件夹里。

⚙️ 速查影响效果的几个参数

参数默认值作用
--preprocesscropcrop只生成面部区域,最稳定;resize整图缩放,适合证件照式图片;full整图动画,需配合--still
--still保持原图头部姿态,减少头部运动,全身图模式建议开启
--expression_scale1.0数值越大表情越夸张
--enhancergfpganRestoreFormer,修复面部细节
--ref_eyeblink指定参考视频,借用其中的眨眼动作
--result_dir./results输出目录

🖼️ 让效果更好的两处选择

选图

  • 优先正面、光线均匀、分辨率高的人像;证件照式图片用 resize 模式
  • 官方提供的示例人像长这样:

  • 目前只支持真人或写实风格人像,动漫脸暂不支持,官方文档中有说明

选音频与参考视频

  • 音频只支持 wav / mp3,底噪越小口型越准
  • 默认生成的眨眼和头部动作偏少,可用--ref_eyeblink指定一段视频借动作,效果对比如下:

适合谁用

  • 教育工作者:把静态讲师照片变成课程讲解视频,或做语言发音演示
  • 内容创作者:数字人口播、动漫角色配音视频
  • 开发者:完全离线本地推理,也可通过 Stable Diffusion WebUI 扩展接入现有工作流

排查清单:遇到问题按序检查

  • 提示ffmpeg不是内部命令:安装 ffmpeg 并加入 PATH
  • 找不到模型文件(如 BFM、.mat缺失):重新执行模型下载脚本,确认下载完整
  • ModuleNotFoundError: No module named 'ai'epoch_20.pth模型损坏,重新下载
  • Mac M1 报 Illegal Hardware:单独执行pip install dlib重装
  • CUDA 显存不足:运行前设置环境变量PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128
  • 音频解码报错:输入音频不是 wav / mp3,先转换格式

完整问答见 docs/FAQ.md。

查阅更多文档

各模式的官方推荐配置、--ref_pose头姿借用等进阶用法,见最佳实践与配置指南;3D 面部渲染与自由视角生成在 docs/face3d.md 中有专门说明。

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询