
SadTalker 照片说话视频生成完整指南让一张肖像开口说话【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一款音频驱动的说话头部视频生成开源工具传入一张人像照片和一段音频它会自动生成口型、表情与头部动作同步的说话视频。本文按真实操作顺序带你走完备料 → 部署 → 选模式 → 调画质 → 排错全流程重点讲清三种预处理模式的取舍和最容易翻车的几个坑。先说结论它能做什么、不能做什么核心玩法就一句话一张人像图片 一段音频 会说话的头部视频稳定出活的场景正面、光线均匀的真实人像与真人相像的写实风格插画 / AI 生成图需要配音的虚拟形象、口播素材、课程讲解别指望的场景纯二次元、强卡通化角色官方明确当前模型只作用于真实人像或接近真人的人像多人同框、侧脸过大的图片输入音频只吃wav / mp3两种格式其它格式请先转码。备料一张图和一段音频选图正面、清晰、像真人图片质量直接决定成片下限按这几条挑正面朝向脸部正对镜头避免大角度侧脸光线均匀无强逆光、无大面积阴影遮挡五官分辨率足够脸越大越清楚越好下面这类写实人像就是理想输入风格化但接近真人的图同样能用例如这种 AI 生成写实人像音频干净就行只支持wav / mp3尽量无背景噪声、无杂音项目里自带示例音频在examples/driven_audio/可直接拿来试跑十分钟跑起来两条部署路径先装好三样依赖Python 3.8、Git、FFmpeg再按平台走对应步骤。Windows最省事双击项目根目录的webui.bat依赖会自动安装随后浏览器自动打开界面。Linux / macOS克隆仓库后执行bash webui.sh脚本会拉取依赖并启动 WebUI。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker bash webui.sh模型权重不会自动下载首次使用需执行一键脚本补齐bash scripts/download_models.sh嫌本地折腾docs/install.md里有 macOS、WSL、Docker 的额外方案Docker 一条命令即可起容器。选模式一个参数决定视频形态--preprocess参数控制最终视频的取景方式三选一crop默认最稳只生成脸部区域表情与头部动作最自然适合绝大多数人像full全身自动处理人脸区域再贴回原图适合人物占满画面的全身照务必搭配--still保持原图头部姿态效果更自然resize证件照把整张图缩放到固定分辨率适合证件照这类小图对全身人像会翻车全身模式输入示例人物完整入镜一句话决策拿不准就用 crop想保留完整身体用 full 并加--still小图证件用 resize。调画质四个明显改变效果的参数这些参数是效果分水岭按需叠加参数作用建议--enhancer gfpgan面部修复增强默认开启脸部细节明显更清晰--background_enhancer realesrgan整帧视频超分追求整体分辨率时再加--expression_scale表情强度大于 1.0 让表情更夸张小于 1.0 更收敛--still固定头部姿态全身 / 静帧场景必加减少头部乱动命令行最小可运行示例python inference.py \ --driven_audio 你的音频.wav \ --source_image 你的人像.png \ --enhancer gfpgan结果默认保存在results/下按时间戳建子目录。完整参数表见docs/best_practice.md。避坑清单六个高频报错提前解决出问题时先对照这里能省掉大量排查时间ffmpeg is not recognized→ 没装好 FFmpeg。Linux 用conda install ffmpegmacOS 用brew install ffmpegWindows 确保其在%PATH%中FileNotFoundError ... similarity_Lm3D_all.mat→ 模型没下全重新跑scripts/download_models.shunexpected EOF ... file might be corrupted→ gfpgan 离线包缺失单独把gfpgan/权重补齐CUDA out of memory→ 设置显存分配策略后再跑Windows 用set、Linux 用exportPYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128ModuleNotFoundError: No module named ai→ 多半是epoch_20.pth下载不完整核对文件大小Error while decoding stream ... mp3float→ 音频格式不对确保是 wav 或 mp3更多问题收录在docs/FAQ.md开 issue 前先看一眼。进阶接入 Stable Diffusion WebUI如果你已经在用 SD WebUISadTalker 可以作为扩展直接嵌入省去单独维护一套环境。把权重放进指定目录即可被自动识别或在启动脚本里配置SADTALKER_CHECKPOINTS路径。详细步骤见docs/webui_extension.md。小结SadTalker 的门槛不在模型而在备料和模式选择——挑一张正面清晰的人像、选对 preprocess 模式、再叠一个增强器就能稳定拿到可用的说话视频。把上面四步串起来第一次生成大概率就在十分钟之内。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考