Duix.Avatar 数字人克隆完整指南:10秒视频克隆形象,本地免费生成口播视频

发布时间:2026/9/11 9:10:49

Duix.Avatar 数字人克隆完整指南:10秒视频克隆形象,本地免费生成口播视频 Duix.Avatar 数字人克隆完整指南10秒视频克隆形象本地免费生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款免费开源的 AI 数字人项目上传一段 10 秒左右的视频即可克隆你的形象和声音输入文案或上传音频就能离线生成口播视频。所有计算在本机完成不依赖网络商用也免费。为什么值得在本地跑一套数字人成本、隐私与免费商用市面上做一个 3D 数字人形象动辄数十万元还要持续为云端 API 付费而 Duix.Avatar 把这套技术直接开源给你下面几点对普通用户最实在。制作成本降到一段 10 秒视频Duix.Avatar 背后团队用真人视频数据训练数字人模型已有 7 年官方 README 称该技术开源前已服务过 1 万多家企业、生成 50 万多个数字分身。现在你只需要一段 10 秒左右、带人声的视频程序会自动把它拆成静音视频 音频分别用于形象克隆和声音克隆。全离线运行素材不出你的电脑视频合成、语音克隆、语音识别全部在本地 GPU 上执行日常使用不需要联网。唯一需要网络的环节是首次部署下载镜像约 70GB 流量。如果你有不想上传到任何云端的素材客户资料、内部课件、未发布内容这一点很关键。免费商用有一个上限条件按项目协议全球范围内免费商用但用户量超过 10 万或年营收超过 1000 万美元的企业需要签署商业许可协议仓库内附《Duix.Avatar model community Licensing Agreement》。个人和小团队基本不受影响。不用懂技术也能出片客户端提供图形界面首页左侧是我的作品右侧是我的数字人新建数字人、输入文案、生成、回放都在界面上点几下一步完成脚本支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言。三步跑通部署硬件自查、启动三个服务、产出第一条视频这一节按环境要求 → 部署 → 出片的顺序走。只要硬件过关整个流程其实就三条命令的事。第一步先确认硬件达标项目要求说明系统Windows 10 19042.1526 或 Ubuntu 22.04内核 6.8.0-52-generic 已验证其他 Linux 发行版官方未测试显卡NVIDIA 显卡 正确驱动必要全部算力在本地没有 GPU 三个服务直接起不来推荐 RTX 4070内存32GB 及以上必要16GB 可能启动失败官方常见问题里有明确提示磁盘WindowsC 盘 ≥100GB 存 Docker 镜像D 盘 ≥30GB 存数字人数据数据目录D:\duix_avatar_data在 docker-compose 中可改其他源码构建客户端需 Node.js 18直接下官方安装包则不需要显卡驱动装好后用nvidia-smi能看到显卡信息即为成功。第二步配置 Docker启动服务端Windows 上先确认 WSL2 可用wsl --list --verbose # 查看是否已安装 WSL wsl --update # 更新 WSL然后按 CPU 架构安装 Docker Desktop安装时首次启动接受协议、跳过登录即可。如果 C 盘空闲不足 100GB可以在 Docker 设置里把磁盘镜像目录挪到别的盘打开 Settings → Resources → Advanced在 Disk image location 处 Browse 选择新位置并 Apply restart。Ubuntu 用户直接装 Docker 和 NVIDIA Container Toolkit 即可sudo apt install docker.io docker-compose再装nvidia-container-toolkit并执行sudo nvidia-ctk runtime configure --runtimedocker。接着克隆仓库并启动服务git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -ddocker-compose.yml 里定义了三个服务这就是你要等的对象duix-avatar-asr语音识别基于 fun-asr端口 10095duix-avatar-tts语音克隆合成基于 fish-speech端口 18180duix-avatar-gen-video视频合成端口 8383首次拉取约消耗 70GB 流量耐心等待约半小时。看到 Docker 里三个服务都变为 Running 状态即成功。两种可选方案只有音频和现成模型、只想要视频合成能力docker-compose -f docker-compose-lite.yml up -d单服务Duix.Avatar-gen-video50 系列显卡5090 已验证30/40 系列开 CUDA 12.8 也可用docker-compose -f docker-compose-5090.yml up -dUbuntu 系统服务端docker-compose -f docker-compose-linux.yml up -d第三步装客户端生成第一条视频Windows下载官方构建的Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu下载 Linux 版Duix.Avatar-x.x.x.AppImage双击即可运行无需安装在首页点创建数字人上传那段 10 秒带人声的视频训练完成后它就会出现在我的数字人列表里。之后进入创作页输入文案走 TTS 转语音或直接上传音频选定数字人即可合成口播视频口型与语音自动对齐。进阶玩法三个 API 端点与合成参数调整客户端只方便个人使用如果你要把数字人能力嵌进自己的系统项目开放了完整的本地 HTTP API——Docker 启动后端口直接暴露在127.0.0.1上无需任何鉴权。三个端点串起完整工作流模型训练声音预处理http://127.0.0.1:18180/v1/preprocess_and_tran。先自行把视频拆成静音视频 音频音频放到D:\duix_avatar_data\voice\data该目录是客户端与 TTS 服务约定的路径可在 docker-compose 中修改然后提交训练。注意保存返回值里的asr_format_audio_url和reference_audio_text下一步要用。音频合成http://127.0.0.1:18180/v1/invoke。请求体里除text、speaker和上一步的两个返回值外其余参数topP0.7、temperature0.7、max_new_tokens1024 等均为固定值照抄即可。视频合成http://127.0.0.1:8383/easy/submit传入audio_url、video_url和唯一code随后用 GET 请求http://127.0.0.1:8383/easy/query?code你的code轮询进度。客户端是如何调用这些接口的可以直接看源码模型训练服务、音频合成服务、视频合成服务跟着主进程 → api → service 的调用链读一遍就能掌握全部细节。视频合成请求体里可调的两个开关提交视频合成时请求体中除路径参数外还有两个控制项watermark_switch水印开关和chaofen超分开关超分指提升输出画质的上采样处理。README 示例里两者均传固定值0做批量生产时值得留意它们的作用。硬件不达标时的替代路线如果你不想买 GPU 服务器官方同时提供商业化的数字人/克隆音 API 接口服务无需本地显卡、口型效果更好、维护简单代价是不能改源码、口型效果与本地版不同。README 里有一张完整的对比表技术门槛、定制能力、维护成本、迭代速度等可以按自己的情况对号入座。排坑速查连接失败、训练报错与日志定位以下全部来自官方 常见问题文档 和高频 Issue统一按现象 → 原因 → 解决整理提问前先过一遍。docker-compose up -d拉镜像超时报 request canceled现象三个服务全部 Error提示Get https://registry-1.docker.io/v2/: ... request canceled原因Docker Hub 官方源连接不稳定解决打开代理全局模式或在 Docker Engine 配置里加国内镜像加速器registry-mirrors改完点 Apply restart新增模特创建数字人直接报错现象上传视频后训练失败原因用于创建模特的视频没有声音或没有人在说话——声音克隆需要真实人声解决换一段人声清晰的视频10 秒左右即可定制模特报 Connection refused现象日志出现建立funasr连接异常[Errno 111] Connection refused原因ASR 服务启动慢服务端刚拉起来就立刻克隆形象语音识别端口还没就绪内存只有 16GB 的机器也可能起不来解决启动后等几分钟再操作内存尽量 32GB 起视频生成卡在某一步不动社区反馈最多的卡点是生成停在 20% 左右通常与显存/内存不足有关增大虚拟内存、降低输出分辨率、或改用轻量版部署单服务都能缓解。三个服务起不来 / 客户端连不上自查顺序三个服务是否都是 Running 状态是否有 NVIDIA 显卡且驱动正常nvidia-smi验证服务端、客户端是否都是最新版服务端到/deploy重新执行docker-compose up -d客户端拉最新代码重新构建报错日志去哪里找客户端右上角设置菜单 → 打开日志日志文件在Roaming\heygem.ai\logs目录下的main.log服务端在 Docker 中点开对应容器的 Logs 页签点右上角复制图标即可整段复制适用场景与社区谁该用、卡住了去哪里问适合你如果你是内容创作者、讲师、电商或企业运营需要批量产出数字人口播内容或是开发者想拿开放 API 做二次集成又或者你处理的是隐私敏感素材必须离线。不适合你如果机器没有 NVIDIA 显卡服务无法启动或不想折腾 70GB 部署——直接走官方 API 服务更省心。求助渠道官方 常见问题文档 和 GitHub Issues 更新很勤提问前先看一眼你的问题大概率已被解决官网 duix.com 可以在线体验数字人对话能力技术交流与商务合作邮箱jamesduix.com一段 10 秒视频、三条命令就能在自己电脑里跑起一套可商用的数字人产线。部署卡住时别慌回到三步跑通一节核对硬件和 WSL再对照排坑速查表逐项过90% 的问题都出在这两步上。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 9:05:48

AI Agent开发实战:从核心原理到架构选型与工程落地

最近不管是刷技术社区还是看朋友圈,你大概都会有一种感觉:好像一夜之间,所有人都在聊Agent。GitHub Trending上Agent项目快占掉一半,开源社区隔三差五冒出新的Agent框架,昨天的热搜词是Agent,今天又变成Age…

2026/9/11 10:16:29

ML-KWS-for-MCU源码深度评测:边缘AI关键词唤醒在Cortex-M上的实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 10:16:28

51单片机+DS18B20+LabVIEW温度采集与上位机显示全攻略

简介:面向51单片机初学者、嵌入式爱好者以及LabVIEW上位机开发者,这份资源提供了一套基于STC单片机与DS18B20传感器的环境温度采集及上位机显示方案,解决从底层驱动、串口通信到上位机实时监测与数据存储的完整联动问题。压缩包内共2个文件&a…

2026/9/11 10:16:28

Context-Mode:智能体上下文调度引擎实战指南

1. 项目概述:Context-Mode 不是玄学,而是现代智能体系统里最务实的“上下文调度引擎” “context-mode”这个词最近在开发者社区里频繁冒头,尤其和 MCP、SQLite、FTS5、BM25 这几个词绑在一起出现——它既不是某个开源项目的官方命名&#xf…

2026/9/11 10:16:28

PoolFormer:用池化替代注意力的轻量图像分类模型

简介:本资源是一份基于PoolFormer架构的图像分类实战项目包,面向深度学习初学者与计算机视觉方向实践者,帮助快速掌握MetaFormer系列模型的核心思想与工程实现。资源完整复现了PoolFormer论文中以池化操作替代注意力机制的轻量级建模思路&…

2026/9/11 10:11:27

GPT-4o工具调用实战:构建可中断、可修正的智能体工作流

我不能按照您的要求生成关于“GPT-6 Astra”的博文内容。原因如下:事实层面严重失实:截至2024年7月,OpenAI 官方从未发布、命名或确认存在名为“GPT-6”或“Astra”的模型。所有公开信息显示,OpenAI 当前最新发布的旗舰模型为GPT-…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码