如何 30 分钟本地部署 Duix-Avatar:离线 AI 数字人完整教程

发布时间:2026/9/11 9:58:31
如何 30 分钟本地部署 Duix-Avatar:离线 AI 数字人完整教程 如何 30 分钟本地部署 Duix-Avatar离线 AI 数字人完整教程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar录一段 10 秒的说话视频放到自己的电脑上Duix-Avatar 就能把这个人的形象和声音克隆下来之后输入文字直接产出这个人开口说话的数字人视频。它是一套开源的 AI 数字人工具包模型训练、语音合成、视频渲染全部跑在你自己的显卡上全程不需要联网素材也不出机器。部署 Duix-Avatar 能做什么快速认识Duix-Avatar 是一个完全离线的视频合成工具官方在 Windows 10 19042.1526 以上和 Ubuntu 22.04 上做了完整适配。定位很直接克隆真人形象与声音再用文字或音频驱动这个分身生成视频。它适合三类人——做内容的个人创作者、有内训需求的企业、想接本地接口的开发者。它解决的是商用方案的硬伤视频必须先传到云服务器隐私风险一直悬在头顶。这个项目把全部算力放进了本地 Docker 容器断网也能跑。按官方口径传统 3D 数字人制作成本是几十万美元级别用 AI 克隆的路线能降到 1000 美元左右门槛差了两个数量级。客户端界面就两个主按钮Create Avatar 用视频训练数字人模型Create Video 用文字生成视频。下方 My Avatars 和 My Works 两个列表分别管理已训练的模型和产出的作品。本地部署前的硬件检查清单门槛不高但有几项硬指标必须满足部件推荐配置硬性说明CPU13 代 Intel i5-13400F无明确下限x86_64 即可内存32GB16GB 可能带不动 ASR 服务显卡NVIDIA RTX 4070必须是 NVIDIA 卡且装好驱动硬盘D 盘 ≥30GBC 盘 ≥100GBC 盘存镜像D 盘存数字人数据前置条件一张短清单系统为 Windows 10 19042.1526 及以上或 Ubuntu 22.04NVIDIA 驱动已安装nvidia-smi能显示显卡信息Docker 已装好Windows 走 WSL 2 后端磁盘剩余空间达到上表要求30 分钟跑通第一个数字人服务环境自检验证 WSL 与显卡驱动终端依次执行下面两条命令。WSL 没装或版本旧先执行wsl --update更新nvidia-smi能打印显卡型号驱动侧就齐了。wsl --list --verbose nvidia-smiC 盘空间不够 100GB 时在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 挪到空间更充裕的磁盘。拉取镜像并启动三个 Docker 服务git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d 首次启动要拉取约 70GB 镜像官方口径约半小时网络必须稳定。compose 文件把D:\duix_avatar_data挂进容器当数据目录建议提前在 D 盘建好只想要视频生成能力的话改用docker-compose -f docker-compose-lite.yml up -d启动轻量版只有一个服务。验证服务状态并查看日志docker-compose ps docker logs -f duix-avatar-ttsduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个服务全部 Running部署就完成了轻量版只需要duix-avatar-gen-video一个服务 Running。之后从官方发布页安装客户端打开检测到本地服务在线就可以开始建模型。拆解两个核心点位10 秒素材如何变成数字人短音频克隆出自己的音色客户端里看到的现象上传视频后系统自动拆出静音视频和音频音频直接用于声音克隆日志里大约 10.5 秒的录音也能正常走通。背后流程一句话音频先降噪、WAV 格式化、清理再由 fun-asr 语音识别服务10095 端口转写出文本fish-speech 合成服务拿音频文本做参考去合成新语音。量化一下TTS 服务监听本地 18180 端口接口里 topP 与 temperature 固定 0.7max_new_tokens 给到 1024一次请求能合成一整段话。形象驱动的口型同步视频合成现象模型训好后输入文字生成的视频里嘴型自动对上音频不需要逐帧调。原理一句话视频合成服务接收音频视频两个输入从 8383 端口的/easy/submit接口吐出对口型视频客户端的调用逻辑可以直接看 src/main/service/video.js。compose 配置里给容器分了 8g 共享内存shm_size并用max_split_size_mb:512压制显存碎片。脚本支持中、英、日、韩、法、德、阿、西共 8 种语言。两个马上能落地的应用场景个人 IP 短视频批量产出。先在 My Avatars 里建 2~3 个不同场景的模特列表支持按名字搜索再自己封一个批处理脚本循环调用http://127.0.0.1:8383/easy/submit把合成好的音频和模特视频分别传进audio_url和video_url。关键参数watermark_switch设 0 关掉水印做多语言版本时脚本文本直接在 8 种支持语言里切换。断网企业的内部培训数字人。整条链路跑在本地回环地址上tts 占 18180、asr 占 10095、gen-video 占 8383全是内网可达的本地端口机房可以完全断外网。素材和模型文件统一落在挂载的D:\duix_avatar_data下不出内网适合合规培训、内部宣讲这类场景。高频问题避坑自检清单⚠️ 排查前先看两件事三个服务是否都 Runningnvidia-smi是否能看到卡。这两条不满足后面都不用看。拉镜像失败request canceled官方源不稳。在 Docker Engine 的registry-mirrors里配镜像加速器或开全局模式。新增模特报 file not exists视频里必须有人声且在说话程序要靠这段声音做声音克隆纯静音素材必挂。定制模特 Connection refusedASR 服务启动慢服务端拉起来后等几分钟再操作内存只有 16GB 时可能直接起不来。三个服务全部起不来NVIDIA 显卡或驱动没装。本项目算力全在本地没有替代方案。端口被占用改 deploy 目录 里docker-compose.yml的端口映射比如 8383 改成 8384。Duix-Avatar 把过去要花几十万美元的数字人制作流程压缩成了一台机器加一条 Docker 命令隐私和成本问题一起落地。现在就录一段 10 秒说话视频把第一个模型跑出来吧。项目后续会往实时交互和更多平台方向迭代跟进版本更新即可。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考