Duix.Avatar:本地克隆形象与声音,3条compose命令开跑数字人视频

发布时间:2026/9/12 5:10:54
Duix.Avatar:本地克隆形象与声音,3条compose命令开跑数字人视频 Duix.Avatar本地克隆形象与声音3条compose命令开跑数字人视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想把十秒口播视频变成替你念稿的数字人又嫌云服务商要上传素材Duix.Avatar是一套开源的数字人视频生成工具包形象克隆、声音克隆、口型合成全部在本地显卡上完成。读完全文你能带走1条附三档compose对比的部署路径、3个内容量产场景、4个避坑自查项。一、项目速览 一句话定位上传一段口播视频克隆你的形象和声音之后用文本或录音驱动它说话产出口型对齐的成品视频。指标仓库实际值推荐配置i5-13400F / 32GB 内存 / RTX 4070须装 NVIDIA 驱动磁盘要求WindowsC盘≥100GB存镜像、D盘≥30GB存数据Ubuntu≥100GB空闲首次拉取约70GB流量官方预估半小时视网络文案语言中、英、日、韩、法、德、阿拉伯、西语共8种系统支持Windows 10 19042.1526、Ubuntu 22.04内核6.8.0-52-generic已验证许可证社区许可可商用达到用户规模门槛需签商业许可见 LICENSE当前版本 v1.0.6三个服务端口分别为 ASR 10095、TTS 18180、视频合成 8383全部监听 127.0.0.1。二、核心卖点2.1 算力全在本地素材不出机器三个 Docker 服务FunASR 语音识别、fish-speech 声音合成、视频合成全部绑定本机 NVIDIA 显卡运行不经过任何网络传输。隐私敏感的企业内训、客户案例视频适合走这条路。2.2 一个输入形象和声音同时克隆新建形象只需传一段人在说话的视频。程序把无声画面和声音拆开声音送去克隆画面用于建模。之后文本驱动走 TTS也可直接上传录音数字人按语气和节奏做表情。2.3 桌面客户端管全流程多模型一键切换客户端首页只有两个入口Create Video 和 Create Avatar。克隆好的形象进入My Avatars列表可搜索、可多模型导入不同用途课程、营销、访谈建不同形象互不干扰。三、从0到第一个结果前提本地有 NVIDIA 独显且nvidia-smi能正常输出装好 Docker从源码构建客户端才需要 Nodejs 18。三种 compose 对应不同需求文件都在 deploy/ 目录文件服务数能力适用人群docker-compose.yml3ASRTTS合成形象与声音完整克隆走完整流程的 Windows 用户docker-compose-lite.yml1仅合成已有音频素材只做口型入门体验、只要合成环节docker-compose-5090.yml2TTS合成5090 镜像CUDA 12.8 新镜像RTX 5090 用户30/40 系列同样适用# 完整版 cd deploy docker-compose up -d# 轻量版 docker-compose -f docker-compose-lite.yml up -dUbuntu 22.04 则先装 nvidia-container-toolkit步骤见 README再执行docker-compose -f docker-compose-linux.yml up -d。源码构建客户端git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai两个容易卡住的点C盘剩余不足100GB时在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 换到空间更大的盘拉取过程约70GB流量建议放 WiFi 环境并留出半小时。看到三个容器轻量版一个都 Running服务端就通了客户端从 Releases 下载对应平台安装包Windows 为 setup.exeLinux 为 AppImage装完先建形象、再合成视频。四、场景拆解4.1 课程量产讲师/知识博主输入一段口播视频 一周课程的文案操作Create Avatar 克隆形象与声音 → 逐条文本驱动合成产出同一出镜人的成套课程视频口型与声音一致拍一次口播素材后面只需要改文案出片节奏完全跟得上了。 —— 一位独立编程讲师4.2 多语言版本出海内容团队输入同一产品介绍的 8 种语言文案操作同一形象反复驱动切换文案语言产出多语种短视频不用重新拍摄出镜人保持同一张脸4.3 只有音频素材后期工作室输入现成配音 无声形象视频操作只跑轻量版合成服务提交音频与视频产出口型对齐的成片跳过训练环节显存和磁盘占用都最低五、避坑与排障Qdocker-compose up -d报 request canceled / Client.TimeoutADocker Hub 连接不稳定。在 Docker Desktop 的 Docker Engine 里加国内registry-mirrors仓库 FAQ 文档 附了可直接抄的配置。Q新增形象时上传就报错A素材视频必须包含人在说话的声音程序靠这段声音做声音克隆。静音或纯BGM视频会失败。Q定制形象报 Connection refusedAASR 服务启动慢服务端起来后等几分钟再操作。另外 16GB 内存可能直接起不了服务推荐配置是 32GB。Q服务起不来或反复重启A没有 NVIDIA 显卡或没装驱动三个服务都起不了。按顺序自查nvidia-smi docker ps再看客户端与服务端是否都更新到最新版服务端到 /deploy 重跑docker-compose up -d客户端重新拉取构建。服务端日志可直接点容器复制带出去提问六、路线图与参与方式仓库 Whats New 当前落地的能力Ubuntu 22.04 桌面版正式发布客户端新增英文界面修复 #304、#292 两个已知问题NVIDIA 50 系列验证通过5090 实测30/40 系列用 CUDA 12.8 亦可。实时交互的数字人暂不在离线版范围内仓库说明以官方体验入口为准。参与方式问题直接提项目 Issues官方每天在关单也可以发邮件 jamesduix.com。资源清单完整安装步骤README排障自查与提问模板doc/常见问题.md三档 compose 文件deploy/授权条款LICENSE如果你的机器有 NVIDIA 独显和 32GB 内存可以从轻量版开始先出一支成片看看效果。下期预告本地三个 API模型训练 / 声音合成 / 视频合成怎么被二次开发串成流水线。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考