10秒视频克隆数字人:免费完整本地部署Duix.Avatar数字人视频生成

发布时间:2026/9/11 16:52:43

10秒视频克隆数字人:免费完整本地部署Duix.Avatar数字人视频生成 10秒视频克隆数字人免费完整本地部署Duix.Avatar数字人视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你想让自己的脸和声音出镜讲视频但外包 3D 建模又贵又慢网上服务又担心素材隐私。Duix.Avatar 是免费开源、全离线运行的 AI 数字人工具包上传约 10 秒视频即可克隆外貌与声音输入文案自动生成口型同步的口播视频。全程只需 3 个 Docker 服务镜像下载约 70GB支持 8 种语言。它凭什么值得用先看传统 3D 数字人制作与本项目本地部署的差距表中数字全部来自项目官方文档维度传统 3D 数字人Duix.Avatar制作成本数十万美元量级约 1,000 美元官方英文 README 原话从数十万美元降到 $1,000建模素材专业团队建模周期以周计一段 10 秒真人视频联网要求多为云服务全离线数据不出本机语言支持依赖配音/翻译中、英、日、韩、法、德、阿拉伯、西语共 8 种商用授权付费全球免费商用用户量超 10 万或年营收超 1,000 万美元的企业需签署商业许可协议对个人和中小团队最实在的变化是不用采购 GPU 服务器不用养 3D 团队一台装了英伟达显卡的 Docker 机器就能跑。原理速览Duix.Avatar 本质是三个模块串联看明白数据怎么流转你就看懂了这个项目。1. 声音克隆从 10 秒音频到无限同音色输入你 10 秒视频里提取的人声客户端自动把视频分离成静音视频音频音频放入D:\duix_avatar_data\voice\data。 处理fun-asr 服务ASR自动语音识别把语音转成文字先把这段音频转写成文本fish-speech 服务再基于音频文本训练出参考音频 reference_audio 与参考文本 reference_text。 输出之后任意文案送进合成接口http://127.0.0.1:18180/v1/invoke就得到同音色的 wav 音频。调用细节见 src/main/service/voice.js。2. 口型视频合成从音频到口播视频输入上一步的 wav 你的数字人视频。 处理duix.avatar 容器本地 8383 端口根据音频的节奏与语调驱动口型与表情。 输出http://127.0.0.1:8383/easy/submit提交任务/easy/query?code...轮询进度最终拿到口型对齐的视频。实现参考 src/main/service/video.js。3. 全本地编排deploy/docker-compose.yml 定义三个容器duix-avatar-tts18180、duix-avatar-asr10095、duix-avatar-gen-video8383全部跑在本地英伟达显卡上。客户端是 Electron Vue 应用依赖 Node.js 18模特与作品数据全部落在D:\duix_avatar_data没有任何数据外发。上手实测以下流程以 Windows 为例Ubuntu 22.04 用户只需替换服务端启动命令。第 1 步拉取代码并检查硬件git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar你会看到当前目录多出一个Duix-Avatar文件夹内含deploy/、src/子目录。动手前确认Windows 10 19042.1526 或 Ubuntu 22.04官方已验证内核 6.8.0-52-generic装好 Node.js 18执行nvidia-smi能看到显卡没有英伟达显卡和驱动三个服务起不来C 盘留 100GB 给镜像、D 盘留 30GB。看到request canceled while waiting for connection报错 → 通常是 Docker Hub 官方源连接不稳 → 按 doc/常见问题.md 的指引在 Docker 的 daemon.json 里加 registry-mirrors 镜像源并重启。图在 Docker Desktop 的 Settings → Docker Engine 中配置国内镜像源解决拉镜像超时第 2 步启动三个服务端cd deploy docker-compose up -dUbuntu 用户改为执行docker-compose -f docker-compose-linux.yml up -d50 系显卡用docker-compose -f docker-compose-5090.yml up -d官方 5090 测试通过30/40 系 CUDA 12.8 也可用。你会看到约半小时后70GB 下载建议连 WiFiDocker 中出现 duix-avatar-tts / duix-avatar-asr / duix-avatar-gen-video 三个服务且全部 Running。只需要视频合成服务时可用 lite 版只起一个 duix-avatar-gen-video。定制模特时看到[Errno 111] Connection refused→ 通常是 ASR 服务启动慢 → 服务端起来后等几分钟再试若机器内存偏小16G可能根本起不来来源doc/常见问题.md。第 3 步安装客户端进入主界面双击Duix.Avatar-x.x.x-setup.exe安装到项目 release 页下载对应系统安装包Ubuntu 直接双击 AppImage 运行无需安装root 用户需加--no-sandbox参数启动。你会看到主界面顶部是 Create Video 与 Create Avatar 两个大入口下方是 My Works / My Avatars 列表。图客户端主界面左侧管理作品与数字人模特顶部进入视频创建与形象克隆客户端一直报连不上服务端 → 通常是三个服务未全部 Running 或 18180/8383 端口未放行 → 回到/deploy目录重新执行docker-compose up -d。第 4 步克隆数字人产出第一条视频点击 Create Avatar 上传 10 秒视频等训练完成再点 Create Video选形象、输入文案或上传自己的音频点击生成。你会看到My Avatars 出现形象卡片合成完成后 My Works 里可以下载口播视频。新增模特时报错 → 通常是视频没有声音或不是人在说话程序要用这段声音做声音克隆→ 重新录一段有人声、单人出镜的清晰视频来源doc/常见问题.md。真实场景场景一企业内训 / 合规宣导视频需求批量产出标准化口播视频且培训素材与内部口径不能流到任何云服务。 关键配置按 deploy/docker-compose.yml 完整部署三个容器模特与作品数据统一放D:\duix_avatar_data官方推荐配置为 i5-13400F 32G 内存 RTX 4070。 效果数据每个模特只需 10 秒视频素材文案支持 8 种语言全程离线、无按次收费。场景二自媒体口播量产需求用数字人替身批量产出口播内容声音稳定不翻车。 关键配置小量用客户端点选即可要搭流水线就直连两个 API——http://127.0.0.1:18180/v1/invoke合成音频、http://127.0.0.1:8383/easy/submit合成视频参数示例都在 README 的开放 API一节。 效果数据商用免费用户量超 10 万或年营收超 1,000 万美元需签商业许可不限量次、不收月费。进阶与求助二次开发入口模特训练逻辑src/main/service/model.js视频合成逻辑src/main/service/video.js界面组件Vuesrc/renderer/src/views性能调优参数deploy/docker-compose.yml中视频合成服务的shm_size: 8g控制共享内存大小环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512控制显存分配策略按你的内存与显存余量调整。排查顺序① 确认三个服务是否全部 Running②nvidia-smi检查显卡驱动③ 客户端右上角设置菜单 → Open Log 取客户端日志④ 点开对应 Docker 容器复制关键报错堆栈对照 doc/常见问题.md或直接提交到项目 issue 页面。图客户端右上角设置菜单里点 Open Log即可拿到客户端日志图Docker Desktop 中点开容器查看 TTS 服务日志把关键报错堆栈复制到 issueDuix.Avatar 目前能基于 10 秒视频全离线克隆外貌与声音并生成 8 种语言、口型同步的口播视频。下一步在deploy目录跑一次docker-compose up -d然后上传你第一段 10 秒视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 16:47:43

2026年3款降AIGC平台实测对比,AI痕迹太重必看

最近在学术圈经常听到这样的抱怨:明明是自己写的论文,AIGC检测却显示80%以上AI生成;查重率怎么也降不到学校要求的15%以下;盲审前夕熬夜改到词穷,却越改越乱。如果你也面临这样的困境,别着急,本…

2026/9/11 18:13:13

第33篇-架构评估(二):ATAM 方法与评估实战

【软考系统架构设计师全链路通关实战】第 33 篇:架构评估(二):ATAM 方法与评估实战 本系列定位:以软考系统架构设计师(高级)考试为主线,语言无关的架构方法论视角,覆盖官…

2026/9/11 18:13:13

深度迁移学习水质预测算法源码解析与实战指南

简介:基于深度迁移学习的水质预测研究算法源码,是一份面向计算机、数学、电子信息等专业课程设计、期末大作业及毕设项目的完整工程代码。项目以水质预测为应用场景,覆盖数据加载、时间特征生成、模型构建、迁移学习训练和结果评估等环节&…

2026/9/11 18:13:13

第34篇-CBAM 成本效益分析与架构脆弱性

【软考系统架构设计师全链路通关实战】第 34 篇:CBAM 成本效益分析与架构脆弱性 本系列定位:以软考系统架构设计师(高级)考试为主线,语言无关的架构方法论视角,覆盖官方教程(第二版)…

2026/9/11 18:08:12

【Python 基础】FastAPI ORM 操作MySql 实战使用详解

目录 一、前言 二、FastAPI ORM介绍 2.1 什么是 ORM 2.2 ORM 的优势 2.3 ORM 常用框架 2.4 ORM的使用流程 三、FastAPI ORM 使用 3.1 前置准备 3.1.1 安装依赖包 3.2 ORM 基本使用 3.2.1 创建数据库 3.2.2 创建会话工厂 3.2.3 新增数据 3.2.4 修改数据 3.2.5 查询…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码