Duix.Avatar:从10秒视频到数字人口播视频,当天跑通的本地部署路径

发布时间:2026/9/11 18:44:27
Duix.Avatar:从10秒视频到数字人口播视频,当天跑通的本地部署路径 Duix.Avatar从10秒视频到数字人口播视频当天跑通的本地部署路径【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar素材往云端一传就心里打鼓的你是不是也试过为一条口播视频付几千块Duix.Avatar 是套完全跑在本地的数字人开源项目传一段10秒左右的视频就能克隆你的形象和声音再输入文案让数字人替你开口。这篇文章带你从一台裸机走到第一条口播视频生成再顺手教会你它坏掉时该摸哪儿。谁会被这个问题卡住下面三类人你是不是对上了一个独立创作者日更口播你每天早上对着镜头念稿上午录完的素材下午就过时了。想换数字人工具可素材传上云端等审核那几分钟你总觉得心里不踏实。小团队负责人盯商品视频上午九点详情页换了一版下午口播就得跟着换外包报价却是三天起。你只能先用 AI 工具凑一版文件上传的时候眼睛一直盯着进度条。企业培训与内容岗一季度十期新人视频档期要提前一个月约拍完剪辑还得再熬两个晚上。你想让培训负责人自己开口讲可他的日程本从来不对外人开放。这个项目恰好把这件事收进了本地。15分钟跑通最短路径好消息官方最短路径就是一串命令照着 README 走即可。先自查一遍Windows 10 19042 以上、英伟达显卡且驱动是新的、内存 32G、D 盘留 30G、C 盘留 100G镜像默认放 C 盘不够时可以在 Docker 的 Resources 里点 Browse 挪到别的盘。装 WSL 和 Docker Desktopwsl --install装一遍失败就多试几次多半是网络问题。这一步只是给三个服务准备落脚点没有 Docker 后面全白搭。拉取仓库git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar把源码和配置文件放到机器上后面每一步都在这个目录里。 3.启动三个服务cd deploy docker-compose up -d这一条命令会下载三个服务镜像并后台拉起首次约 70G 流量、半小时上下你可以去干点别的。50 系列显卡改跑docker-compose -f docker-compose-5090.yml up -d配置低就上 lite 版只起视频合成这一个服务。 4.装客户端下载官方安装包双击Duix.Avatar-x.x.x-setup.exe装好Ubuntu 用户直接双击 AppImage 启动不用装。客户端只是壳真正的算力在前一步拉起的容器里连上就算成功。 5.建模特再建视频在客户端里上传一段 10 秒左右、人声清晰的视频创建模特系统从中提取你的形象和声音然后进创建视频输入文案点生成口播视频就成了。⚠️ 最容易卡的就是第 3 步首次拉取约 70G 流量官方源连接不稳命令报 timeout 时先去 Docker Desktop 配一个镜像源再重试配法见文末第一处。它到底怎么把事办了机制速拆原理不用深究这个项目的本质是一家小影棚里的三个工种客户端只是前台。速记员asr你把 10 秒样片交过去速记员先逐字记下你说了什么——声音模型只有知道你当时在说什么才能学走你的腔调。技术本质基于 FunASR服务名 duix-avatar-asr本地端口 10095。配音替身tts文案写好后由它开口按你的语速语气把稿子读成一条音轨。技术本质基于 fish-speech服务名 duix-avatar-tts本地端口 18180。出镜演员gen-video拿着你的原视频和新生成的音轨对戏嘴型跟着音频走合成最后的口播成片。技术本质服务名 duix-avatar-gen-video本地端口 8383。三者全程不出你的机器客户端只是往这三个本地端口发请求所以你要是不想要界面直接用 API 调这几个端口就能自己搭流水线。不同配置能跑到什么效果机器能跑到什么程度取决于你手里那张卡。官方 README 把档位写得很直白你的机器部署方式能跑什么大致耗时i5-13400F 32G RTX 4070官方推荐docker-compose.yml全量三服务声音克隆 视频合成全功能首次拉取约半小时英伟达 50 系官方测过 5090docker-compose-5090.yml同上同上低端显卡社区反馈 8G 显存可用docker-compose-lite.yml仅视频合成服务自备音频拉取更快16G 内存或没有英伟达卡没有文件能救三个服务都依赖英伟达卡起不来 我的推荐主流中端配置i5-13400F / 32G / RTX 4070就老老实实用全量三服务且服务起来后先等几分钟再创建模特——ASR 服务启动偏慢刚拉起就建模特是最常见的报错来源。谁已经在跑了项目放出有段时间了这几类人已经把它当日常工具用。做个人口播的人一天录播时间压缩成写文案的时间同一张脸可以无限次日更。关键配置点客户端支持多模型给不同节目各建一个模特换人设不用重做视频。如果你也做个人口播可以先传一段 10 秒视频建出你的第一个模特。跑商品详情页的团队商品一更新午饭前新口播就出来了不用等外包排期。关键配置点机器旧就上 lite 版只跑视频合成自备音频和原片把依赖链砍到最短。如果你也在跑电商商品视频可以先给一批新品各做一条口播试试手感。做出海内容的团队一个数字人能把同一份稿子读成八种语言英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语都支持。关键配置点文案本身不分语言直接写目标语种就行。如果你也在做出海内容可以先拿同一份文案跑两种语言对比效果。跑不动了先查这几处坏的时候别慌十有八九是下面四种之一。容器起不来先确认英伟达显卡和驱动跑一下nvidia-smi报错了那三个服务永远起不来别查别处。报错里出现连registry-1.docker.io超时是拉取环节去 Docker Desktop 的 Docker Engine 配置里加registry-mirrors点 Apply restart。回deploy目录重跑docker-compose up -d拉取会从断点继续。建模特报 Connection refused、进度不动先看三个服务是否都 Runningdocker-compose ps服务刚拉起的话ASR 启动慢官方 FAQ 的原话是等几分钟再试。还不行就确认内存够 32G16G 的机器可能直接起不来。建模特直接报错上传的视频必须有声音、且是人在说话——声音克隆靠的就是这段音频。静音视频或只有 BGM 的片段建模特必挂。某个服务反复重启打开 Docker Desktop 里对应容器的 Logs 页签看它断在哪一行。或者在终端里实时跟docker logs -f duix-avatar-tts客户端侧的日志也能看右上角设置菜单里的打开日志。最后开头那种把素材传上云的心虚现在可以放下了视频、声音、模型全部不出你的机器。开源项目值钱的地方也在这里——整套流程源码摊开给你看社区的问题单每天在更新排错的活由大家一起扛而不是某一家说了算。现在打开终端敲下第一条命令把仓库 clone 下来一小时后你就会拥有一个能替你念稿的数字人。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考