30分钟本地部署Duix-Avatar:一段8秒视频克隆你的数字人,生成口播视频

发布时间:2026/9/11 10:11:41
30分钟本地部署Duix-Avatar:一段8秒视频克隆你的数字人,生成口播视频 30分钟本地部署Duix-Avatar一段8秒视频克隆你的数字人生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想做一个数字人口播视频传统路子要么请真人出镜重录要么按条买商业数字人服务——钱花出去了脸和声音的数据也传到了别人云上。Duix-Avatar 本地部署走的是另一条路这个开源数字人克隆工具跑在你自己的电脑上一段 8 秒以上的视频就能克隆你的形象和声音之后输入文本就出成片全程离线。值不值得折腾一张表说清商业数字人服务Duix-Avatar 本地部署费用按条计费或包月一次性配好硬件之后生成免费隐私脸和声音样本要上传云端素材、模型、成片全在本地用量有额度限制不设限商用免费超 10 万用户或年营收 1000 万美元的企业需签许可协议定制改不了底层源码开放可改可扩说白了你缺的不是一张 NVIDIA 显卡只是一台符合下面清单的电脑。动手前先自查硬件与系统清单逐项打勾全部通过再开始。显卡最低——任意 NVIDIA 显卡推荐——RTX 4070官方推荐配置。AMD 或核显不行本项目全部算力依赖本地 CUDA。显卡驱动最低——已安装且在显卡管理软件里能看到驱动正常推荐——NVIDIA 官网查到的最新版。内存最低——32GBREADME 明确标注必要16GB 机器可能起不来服务推荐——32GB 以上。磁盘Windows最低——D 盘空闲 30GB存数字人和作品数据C 盘空闲 100GB存 Docker 镜像不足时可在 Docker 里另选磁盘推荐——两盘各留 20% 余量。磁盘Ubuntu最低——空闲 100GB推荐——同左。系统最低——Windows 10 19042.1526 或 Ubuntu 22.04 Desktop仅验证过 22.04其他 Linux 未做兼容测试推荐——Windows 10/11 64 位。跟做五步跑通第一条数字人口播视频1. 获取代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar跑通信号当前目录出现README.md、package.json以及deploy、src等文件夹。顺便装好 Node.js 18。2. 装 Docker或 WSLWindowswsl --list --verbose wsl --update再安装 Docker Desktop首次启动接受协议、跳过登录。看到 Docker 的鲸鱼图标在托盘里跑起来就算装好。Ubuntu 先执行docker --version没装则用sudo apt install docker.io docker-compose补上。3. 启动本地服务Windows 进入deploy目录执行docker-compose up -d然后等。镜像约 70GBREADME 给的参考时间是半小时左右全程注意挂着 WiFi。跑通信号Docker Desktop 里出现三个容器duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-videoSTATUS 都是 Running且不再反复重启。想省事可用精简版docker-compose -f docker-compose-lite.yml up -d此时只有一个Duix.Avatar-gen-video容器。Ubuntu 用户执行docker-compose -f docker-compose-linux.yml up -d跑通信号同样是三容器 Running装显卡驱动后记得跑一次nvidia-smi能打出显卡信息才算驱动 OK并额外安装 NVIDIA Container Toolkit 让 Docker 调 GPU。4. 安装并打开客户端从项目的发行版Releases下载客户端安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击Duix.Avatar-x.x.x.AppImage直接启动root 用户跑不起来时在终端加参数--no-sandbox。首次启动会弹用户协议同意进入首页。跑通信号首页左侧有首页入口中间两张大卡片分别是创建视频和快速定制。5. 准备素材生成第一条视频先录一段素材按应用内标准示例的要求来时长至少 8 秒推荐 10-15 秒分辨率 720P 以上格式 MP4/MOV全程有且只有同一个人五官清晰不遮挡头不侧倾手别伸到脸、嘴、脖子前视频里必须有人说话的声音——系统会从视频里提取声音做克隆没声音或多人出框都过不了。在首页点快速定制按上传视频放入素材填模特名称点提交定制。跑通信号模特状态从训练中变为可预览说明形象和声音克隆完成。再点创建视频选刚做的模特在文本框输入文案支持中英文第一次建议 50 字以内点右上角合成视频。跑通信号弹窗提示您的视频已提交随后在我的作品里看到成片能播放、口型对得上。让成片更稳的 4 个实战技巧素材拍摄对着固定镜头说一段完整的文字别中途停也别换场景录完回放一遍确认吐字清楚、背景安静。音频合成不想用克隆音色时可选音频合成上传自己的录音支持 mp3、wav、flac、m4a单条不超过 30 分钟但务必传纯干音——背景噪音会直接带进成片。参数与启动时序服务端刚拉起时 ASR 服务预热较慢README 建议等几分钟再开始定制模特否则可能报 Connection refused16GB 内存机器大概率起不来三个服务32GB 是实际下限Windows 拉镜像超时多为网络问题在 Docker 设置里配国内镜像源具体见 常见问题。开放 API 批量生成Docker 启动后本地暴露了端口视频合成接口是http://127.0.0.1:8383/easy/submitcurl -X POST http://127.0.0.1:8383/easy/submit \ -H Content-Type: application/json \ -d {audio_url: 音频路径, video_url: 视频路径, code: 唯一key, chaofen: 0, watermark_switch: 0, pn: 1}提交后用http://127.0.0.1:8383/easy/query?code任务key轮询进度文本先合成音频由 18180 端口的 TTS 服务负责参数细节可参考 API 说明。循环调用这两组接口就能批量产出一天份的口播视频。卡住了看这里Qdocker-compose up -d 之后三个容器没全 Running 怎么办A先确认 Docker Desktop 正在运行再点进容器看日志若出现registry-1.docker.io ... request canceled这类拉取超时配一个国内镜像源后重新执行docker-compose up -d。Q服务起不来nvidia-smi查不到显卡A驱动没装或没装好。本项目所有算力都在本地没有可用的 NVIDIA 显卡加驱动三个服务根本起不了。装完驱动能打出显卡信息再重试。Q提示端口被占用A本项目占用 8383视频合成、18180TTS、10095ASR三个本地端口查清占用进程后停掉它或改deploy/docker-compose.yml里主机侧的端口映射。Q定制模特时报错A九成是素材问题——视频没声音、多人出镜、脸被遮挡都会失败。按第 5 步的标准重录一段。Q客户端日志和服务端日志去哪看A客户端在右上角设置里点打开日志服务端在 Docker Desktop 中点进对应容器切到 Logs 页签直接复制。接下来可以探索用 8383 开放 API 接进自己的定时任务每天自动推一批口播视频。试试音频合成上传自己录的干音比 TTS 音色更像你本人。疑难杂症翻 常见问题那里沉淀了镜像源、素材、ASR 预热等高频故障的解法。把第一台能跑起来的机器搭好后你手里就多了一条文本进、视频出的本地流水线——剩下的事就是往里灌选题了。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考