Duix.Avatar 本地部署完整指南:30 分钟跑通离线 AI 数字人视频生成
做口播视频要么找真人出镜,要么自己对着镜头念,费时又费精力。其实只要有一段十秒左右的说话视频,就能让一个会开口的数字人替你出镜。Duix.Avatar 是开源的数字人项目,把它部署到本地电脑后,可以先克隆你的形象和声音,再用文本或音频驱动它生成口播视频,全程离线运行,素材不离开你的机器。
三分钟跑起来
跟着做完,你会得到一个客户端窗口,加上本地 Docker 里跑着的三个后端服务,所有 AI 计算都发生在你自己的显卡上。
动手前确认硬件:NVIDIA 显卡(装好驱动,nvidia-smi 能显示显卡信息)、32GB 内存、100GB 空闲磁盘,并已安装 Node.js 18。
- 克隆仓库:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar
cd Duix-Avatar
- 安装依赖:
npm install
- 启动客户端:
npm run dev
窗口弹出即成功,主界面有"Create Video"和"Create Avatar"两个入口。
- 启动服务端:进入
deploy目录执行
docker-compose up -d
Ubuntu 22.04 下换成 docker-compose -f docker-compose-linux.yml up -d。
提示:首次启动要下载约 70GB 镜像,用 WiFi 并预留半小时,三个服务都显示 Running 即成功。
它能帮你做什么
下面三个场景串起来,就是一条完整的口播视频生产线:从素材到模型,从文稿到成片。
上传 10 秒说话视频,克隆自己的数字人
输入一段十秒左右、人在说话的视频。系统自动把它拆成"无声视频+音频",用画面建面部模型,用声音克隆你的音色,训练完成后模型会出现在客户端的"My Avatars"列表里。
提示:素材必须带人声,否则声音克隆这一步无法进行。
输入文案,AI 念稿生成口播视频
输入一段文字,系统先把它合成自然的语音(这一步叫语音合成),再驱动形象对口型,输出口型同步的口播视频。文案支持中、英、日、韩、法、德等八种语言。
带自己的录音来,音频文件直接驱动
已有录音文件可以跳过文本环节,直接用音频驱动形象,系统自动对齐口型和语气,成片可直接使用。
绕开这些坑
以下三条是部署中出现频率最高的问题,每条按"现象 → 原因 → 解决"给出一句话方案。
docker-compose up -d连接超时、镜像拉不下来 → Docker Hub 官方源不稳定 → 开启全局模式或给 Docker 配置国内加速镜像。- 服务起不来,或三个服务只有部分在跑 → 本项目算力全在本地显卡,缺 NVIDIA 显卡或驱动 → 装好驱动并用
nvidia-smi确认。 - 新增模特报错 → asr 服务启动慢,或素材没有说话声音 → 确保素材带人声,服务端启动后等几分钟再克隆。
拿不准时先看容器日志:在 Docker Desktop 里点开正在运行的服务,直接复制输出内容。
更细的情况见常见问题。
进阶路线
标准版跑通后,这一节选读,帮你省磁盘、提速度。
- Windows 的 C 盘小于 100GB:在 Docker Desktop 的 Settings - Resources - Advanced 里,把 WSL 镜像位置指到大分区。
- RTX 5090 显卡用
deploy目录里的docker-compose-5090.yml;想省资源可用docker-compose-lite.yml起精简版(只有一个服务)。 - Docker 起来后本地暴露语音合成(18180 端口)和视频合成(8383 端口)接口,可被自己的程序调用,参数示例在
src/main/service/下。
更多部署参数见 deploy 目录 下的各配置文件。
现在去克隆仓库,先执行 npm run dev 让客户端跑起来,看看你的显卡是否满足条件。
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考



