一段10秒视频克隆你的脸和声音:开源数字人 Duix.Avatar 本地部署完整教程

发布时间:2026/9/20 8:33:17
一段10秒视频克隆你的脸和声音:开源数字人 Duix.Avatar 本地部署完整教程 一段10秒视频克隆你的脸和声音开源数字人 Duix.Avatar 本地部署完整教程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar如果你做过数字人视频多半有过这样的顾虑要克隆自己的形象和声音就得把视频和音频上传到别人的服务器——你的脸、你的声音就这样过了一遍别人的机器。Duix.Avatar 把这件事反过来做了这是一个真正开源的 AI 数字人工具包整条链路形象克隆、声音克隆、口型驱动、视频合成全部在你自己的电脑上跑全程离线。它的工作方式很直接你提交一段 10 秒左右的视频它从中提取你的外貌特征和声纹之后你只需要输入一段文案或者上传一段音频它就能生成一段你在说话的口播视频。先说结论帮你判断值不值得折腾你关心的事云端数字人服务Duix.Avatar 本地部署数据去向视频、音频要上传全部留在本机断网可用使用成本按量/按次计费长期用不便宜一次性买好硬件之后零边际成本定制能力只能调 API完整源码可改从 Electron 客户端到服务编排都是 src/ 里看得见的代码部署门槛零门槛需要一台带 NVIDIA 显卡的机器 Docker 基础适用人群偶尔用一次的业务方高频生产视频、对隐私敏感、或想二次开发的团队一句话判断如果你每天要产出多条口播视频或者数据绝不能出内网本地部署的账算得过来如果只是做一条视频玩玩云端 API 更省事。开工前先把三件事确认掉这个项目所有算力都在本地所以硬件不是选配而是硬性条件。照这个清单过一遍系统Windows 10 19042.1526 或更高版本Linux 侧官方验证过的是 Ubuntu 22.04 Desktop内核 6.8.0-52-generic磁盘C 盘空闲 100G 以上存 Docker 镜像Windows 下还要有 D 盘且空闲 30G 以上存数字人和作品数据数据目录约定为D:\duix_avatar_data硬件参考配置 i5-13400F 32G 内存 RTX 4070必须有 NVIDIA 显卡且驱动装好——没有 N 卡后面的三个服务根本起不来软件DockerWindows 下先确认 WSL 可用开发环境才需要 Nodejs 18Windows 下装 Docker 时用wsl --list --verbose查一下 WSL 是否已装没有就wsl --install装完记得wsl --update。C 盘吃不下 100G 镜像的话Docker Desktop 安装后可以进设置把镜像存储位置挪到别的盘最短路径从 clone 到出片只需要三步第一步拿代码。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy第二步起服务端。项目用 Docker Compose 编排deploy/ 目录下有四个 compose 文件对应不同硬件# 完整版ASR TTS 视频合成共三个容器 docker-compose up -d # 轻量版只有视频合成一个容器适合只想驱动现成音频的场景 docker-compose -f docker-compose-lite.yml up -d # RTX 50 系显卡经测试 30/40 系 CUDA 12.8 也可用 docker-compose -f docker-compose-5090.yml up -d首次拉取镜像大约70G 流量耐心等半小时左右建议连 WiFi。完整版成功标志是容器列表里出现三个服务duix-avatar-asr语音识别基于 FunASR、duix-avatar-tts语音合成基于 fish-speech、duix-avatar-gen-video口型驱动视频生成lite 版则只有一个duix-avatar-gen-video。第三步装客户端。从 Release 页面下载官方构建包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Linux 下载Duix.Avatar-x.x.x.AppImage双击运行即可root 用户下需要用命令行加--no-sandbox参数启动。客户端启动后会自动检测本地服务状态看到服务在线就可以开始创作了。核心能力拆解一次克隆两种驱动打开客户端首页两个入口就是它的全部核心Create Avatar形象克隆是入口里的入口。上传一段 10 秒左右的视频后背后发生的事分三段先用 ffmpeg 把视频转码成 H264 并分离出音轨见 src/main/util/ffmpeg.js再走 ASR 服务对音频做识别和标准化得到声音克隆需要的参考音频最后形象文件和声纹信息一起入库成为一个可复用的数字人模特。这里有个极易翻车的细节素材视频里必须有人说话的声音静音视频或背景音乐视频都会让克隆失败——因为程序要靠这段声音做声音克隆。克隆出来的模特支持多个并存、按名字检索之后做视频时随时切换。Create Video口播生成支持两种驱动方式对应不同生产习惯文本驱动输入文案 选一个克隆好的声音TTS 服务合成出 WAV再交给视频合成服务驱动口型音频驱动直接上传已有录音跳过 TTS让口型跟着你的原声音频走任务提交后客户端会轮询合成进度完成后视频进入 My Works 列表支持导出到本地。整套流程对 8 种语言的脚本做了适配中、英、日、韩、法、德、阿拉伯、西语其中中文效果最稳。界面不顺手的地方右上角设置菜单基本都能兜住看用户协议、打开客户端日志排查问题第一步、中英语言切换三个值得抄作业的落地场景1. 课程批量生产教育。把标准课程讲稿整理成文本模板为不同学科各克隆一个虚拟教师模特同一份讲稿换模特、换文案即可批量出片。做过这类生产的人都知道最贵的不是算力而是真人反复录 剪辑的时间本地跑通后这条链路可以无限复制。2. 口播带货视频矩阵电商。商品介绍文案天然就是口播格式一个数字人模特 一批文案 一批视频。多平台分发要求每条素材略有差异时微调文案 换音色即可不需要重新拍任何东西。3. 内部培训与操作规范宣贯企业。把培训材料转成数字人口播视频员工随时回看口型和语气始终一致。敏感的内网环境下数据不出公司这一点本身就让采购和安全团队好过多了。进阶三个 API 让你把它接进自己的系统Docker 启动后会在本机暴露端口通过http://127.0.0.1直接调用。客户端里这套调用逻辑都是现成的想看实现直接读 src/main/service/ 下的 model.js、voice.js、video.js照着改就能接入自己的后端① 声音预处理与训练TTS 服务18180 端口POST /v1/preprocess_and_tran参数大致是{ format: .wav, reference_audio: xxxxxx/xxxxx.wav, lang: zh }返回两个字段asr_format_audio_url和reference_audio_text务必记下来下一步合成要用。② 文本合成语音TTS 服务18180 端口POST /v1/invoke核心参数speaker一个唯一 UUID、text要合成的文案、reference_audio和reference_text上一步的返回值其余如topP: 0.7、temperature: 0.7、max_new_tokens: 1024按客户端的固定值传即可产出 WAV 文件。③ 驱动数字人合成视频合成服务8383 端口POST /easy/submit传audio_url音频路径、video_url模特视频路径、code唯一任务码然后GET /easy/query?code任务码轮询进度拿到结果文件。这套接口意味着你可以完全绕开客户端写一个自己的网页或脚本后台定时批量生成、接入内容管理系统、按模板自动出片客户端只是它最傻瓜的一个前端。避坑清单部署失败时按这个顺序查坑 1docker-compose up -d报连接失败 / context canceled。基本是 Docker Hub 官方源拉不动。进 Docker 的 Docker Engine 配置加国内镜像源registry-mirrors字段改完点 Apply restart坑 2克隆形象时报file not exists或Connection refused。两个常见原因一是素材音频不在约定目录完整版下是D:\duix_avatar_data\voice\data在 compose 里改过挂载的要看自己的配置二是ASR 服务启动很慢服务端刚起来时别急着克隆等几分钟再试。另外内存如果只有 16GASR 服务可能根本起不来32G 才是比较稳的底线。日志长这样坑 3服务起来了但就是不对日志怎么找先确认三个容器都是 Running 状态再用nvidia-smi确认 GPU 驱动正常。服务端日志在 Docker 容器面板里点开对应容器点复制客户端日志在设置菜单里点打开日志会直接定位到logs/main.log坑 4问题迟迟不解决。这个项目更新很频繁提问前先升级服务端到 deploy/ 重新docker-compose up -d拉新镜像客户端拉新代码重新构建——你的问题很可能在新版本里已经修掉了。写在最后Duix.Avatar 用一段 10 秒视频换来了形象 声音的完整数字分身而且把整条生产链留在了你自己的硬件里隐私上数据不出门成本上硬件折旧完就是纯赚源码上从客户端到服务编排每一层都能改。下一步建议很具体先按上面的最短路径把服务跑起来用一段自己的 10 秒视频克隆出第一个模特产出一条口播视频验证效果跑通之后再决定要不要碰那三个 API把它变成自己内容流水线里的一环。更多细节可以看仓库里的 常见问题文档 和 LICENSE——注意商用授权边界全球免费商用但用户量超过 10 万或年营收达 1000 万美元以上的企业需要另行签署商业许可协议。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考