普通电脑搭建AI数字人系统:Duix.Avatar本地部署完整指南

发布时间:2026/9/11 9:17:58
普通电脑搭建AI数字人系统:Duix.Avatar本地部署完整指南 普通电脑搭建AI数字人系统Duix.Avatar本地部署完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar如果你是要天天产出产品讲解视频的电商主播外包一条口播视频动辄几百块、排期还要等好几天那这套方案值得看。Duix.Avatar 是一款全离线的 AI 数字人开源工具本地部署后上传一段10秒左右的真人视频就能克隆形象和声音再输入文案即可驱动数字人说话、自动产出对口型的数字人视频全程不联网。本文从硬件门槛讲到第一条视频导出照着做就能跑通。硬件门槛这台电脑能不能跑AI数字人先说结论英伟达显卡驱动是唯一的硬性门槛其他配置决定的是快慢能不能跑主要看这一条。项目所有算力都在本地没有 NVIDIA 显卡或服务起不来AMD 卡暂时用不了。项目要求说明显卡NVIDIA 且驱动装好50 系列如 5090需用专用 compose 文件30/40 系列走常规流程内存32G 及以上必要16G 机器连 ASR 服务都可能起不来CPU推荐 i5-13400F 级别官方推荐配置参考值硬盘C 盘空闲 100GWindows存储服务镜像D 盘需 30G 存数字人数据和作品系统Windows 10 19042.1526 或 Ubuntu 22.04两个系统都做了完整测试C 盘空间不够 100G 也有办法装完 Docker 后在 Docker Desktop 设置里把 Disk image location 指到一块空间充足的磁盘上即可不用换机。环境准备WSL与Docker的安装顺序Windows 用户按这个顺序走每一步都很快命令行执行wsl --list --verbose能列出子系统就说明 WSL 已装好没有的话执行wsl --install过程中设置的 WSL 用户名密码要记下来。执行wsl --update把 WSL 内核升到最新网络不稳就多试几次。从 Docker 官网下载 Windows 版安装包按自己 CPU 架构选包装完看到 Docker 主界面即为成功。首次启动 Docker接受用户协议、跳过登录之后保持 Docker 常开。Ubuntu 22.04 的路子不同多两个环节先用sudo apt install docker.io docker-compose装好 Docker装完用docker --version确认再装 NVIDIA 驱动执行nvidia-smi能显示显卡信息才算过最后装 NVIDIA Container Toolkit 并执行sudo nvidia-ctk runtime configure --runtimedocker、sudo systemctl restart docker——这一步是让 Docker 能调 GPU漏了后面三个服务照样起不来。三步启动数字人服务环境就位后服务端就是一条命令的事。先克隆项目git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar然后进入deploy目录完整部署Windowsdocker-compose up -d轻量部署docker-compose -f docker-compose-lite.yml up -d只拉起视频合成服务Duix.Avatar-gen-video一个容器适合只想跑合成分环节的场景Linuxdocker-compose -f docker-compose-linux.yml up -d50 系列显卡docker-compose -f docker-compose-5090.yml up -d该方案基于 torch 预览版30/40 系列 CUDA 12.8 环境也可用这里有个坑要提前说首次拉镜像会消耗70G 左右流量官方建议挂 WiFi 并预留半小时左右。拉完后打开 Docker 查看容器标准版应该看到三个服务全部 Runningduix-avatar-asr语音识别ASRduix-avatar-tts语音合成TTSduix-avatar-gen-video数字人视频渲染lite 版本只有一个Duix.Avatar-gen-video。客户端则是下载官方构建的Duix.Avatar-x.x.x-setup.exeWindows或Duix.Avatar-x.x.x.AppImageLinuxUbuntu root 用户下双击打不开时终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox即可双击安装无需其他配置。启动验证三个检查点确认跑通了服务拉起后别急着创作先确认这三件事看容器状态Docker 里三个服务都是 Running有一个反复重启基本就是显卡或驱动问题。看端口Docker 启动后会在http://127.0.0.1暴露本地端口其中18180对应 TTS/ASR 服务8383对应视频合成服务。看客户端启动应用我的数字人和我的作品页面能正常加载即通。如果连接报错先回 Docker 看服务状态九成问题出在那边而不是客户端。上手创作10秒视频克隆形象文案一键出片跑完部署真正有意思的部分开始了。整条主线是上传一段视频 → 得到数字人模型 → 输入文案 → 得到口播视频。训练你的第一个数字人点创建数字人上传一段10 秒左右的正面视频这里有两个参数建议画面光线均匀、面部无遮挡、人在正常说话——注意视频必须带声音系统要从中提取音频做声音克隆纯无声素材会直接报错。素材规格客户端会自动把视频转成 H.264 并用 ffmpeg 分离出音频你只管上传不用自己预处理。提交后系统在后台完成形象建模 语音训练模型会出现在我的数字人列表里之后可以建多个模型按场景选用多模型管理是内置能力不是社区魔改。从文案到成片进入视频创作模块选择刚训好的数字人二选一提供内容直接输入文案或上传现成音频。文案模式下 TTS 服务先把文字合成语音再交给8383端口的合成服务做口型驱动音频模式则跳过合成环节直接进入对口型渲染。成片在我的作品里排队生成进度条实时刷新多个任务会依次串行执行。脚本内容支持中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语八种语言跨语种出片不用换工具。耗时方面官方没有给统一基准跟显卡和文案长度直接相关参考值可以按推荐配置下单条任务分钟级到十几分钟来预期想批量出片就排好队等即可。原理速览10秒视频是怎么变成数字分身的三句话讲清它做了什么形象克隆上传的真人视频被建模成你的外观模板之后任意新音频都能驱动这张脸做出对应的表情和动作输入一段 10 秒视频、得到的是一个可反复复用的数字分身。短样本语音克隆系统从视频里分离出的音频经 ASR 识别出参考文本再交给 TTS 服务建立声纹参考输入一句text 参考音频得到的是带原声语调、语速特点的合成人声。口型对齐TTS 产出的音频与形象模板一起送入 face2face 渲染服务画面口型按音频节奏逐帧驱动最终音视频同步输出成片。三个服务ASR/TTS/渲染各自独立成容器也意味着你可以只调用其中某一段这就引出了下面的进阶玩法。进阶与定制API接口和场景化配置三个接口端点接进你自己的工作流Docker 起来后本地就能调这三组接口客户端源码src/main/service/下的model.js、voice.js、video.js就是现成的调用范例环节端点用途模型训练http://127.0.0.1:18180/v1/preprocess_and_tran提交参考音频format、reference_audio、lang返回asr_format_audio_url和reference_audio_text后两者是下一步的入参语音合成http://127.0.0.1:18180/v1/invoke传入speaker、text和上一步的两个返回值得到 wav 音频视频合成http://127.0.0.1:8383/easy/submit提交audio_url、video_url、唯一code再用http://127.0.0.1:8383/easy/query?codexxx轮询进度示意调用curl -X POST http://127.0.0.1:8383/easy/submitbody 带上音频路径、形象视频路径和唯一 code 即可返回后用 code 查进度。不同场景怎么用同一套部署场景建议用法用到的内置能力教育/课程批量产出多数字人模型分学科复用长文案直接走文案驱动多模型管理 8 语种脚本电商产品讲解同一模型换不同文案批量排产成片带进度排队任务串行队列 作品列表管理对外交付/内容分发合成参数里预留了水印开关watermark_switch交付前按需处理合成接口参数硬件有限的团队只保留合成环节跑 lite 版ASR/TTS 复用已有环境docker-compose-lite.yml隐私敏感场景全程离线素材不出本机全离线架构避坑指南高频故障对照表现象原因解决docker-compose up -d报request canceled/context canceledDocker Hub 官方源连接不稳定Docker Desktop → Settings → Docker Engine 里配置registry-mirrors国内镜像源后重启或开全局代理三个服务起不来 / 客户端连不上没有 NVIDIA 显卡或驱动没装好16G 内存也可能拉不起 ASRnvidia-smi验证驱动内存升到 32G新增模特报错上传的视频没有声音或不是人在说话重录一段带正常说话的正面视频声音是克隆的原料缺一不可定制模特报Connection refusedASR 服务启动慢服务端刚拉起就操作了启动完等服务几分钟再克隆这也是 16G 内存机器的典型死法其他怪异问题项目更新频繁老版本可能已有修复服务端到deploy目录重跑docker-compose up -d客户端更新后重新构建再查官方常见问题文档写在最后一台带 N 卡的游戏本 半小时下载时间本地部署 AI 数字人就不再是专业团队的事形象、声音、成片全部留在本机边际成本趋近于零。接下来值得试的是把三个本地接口接进自己的内容管线让数字人真正量产起来 【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考