Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频

发布时间:2026/9/11 6:20:30

Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频 Duix.Avatar本地数字人视频生成完全指南一段10秒视频克隆自己免费生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款真·开源的本地数字人项目。你只需提供一段 10 秒左右、自己出镜说话的视频就能完成形象和声音的双克隆之后输入文案它会自动生成口型对得上的口播视频。全程在你的电脑上离线运行素材不会上传到任何云端。如果你需要做产品口播、课程录课或个人短视频又不想为付费数字人服务掏钱这篇指南带你从零跑到第一个成片。它到底能帮你解决什么先说清楚它值不值得你花时间装下面三个场景有一个对上号就值得动手。把出镜这件事一劳永逸拍口播视频最贵的是人打光、布景、重录、后期。用 Duix.Avatar 克隆一次自己的形象和声音后数字人模型会一直存在我的形象列表里以后写什么文案就说什么文案不再需要真人站在镜头前。批量产出数字人口播视频同一形象可以反复使用。今天生成产品介绍明天生成课程讲解后天生成节日问候——画面人物始终是你只有文案在变内容产出的边际成本接近于零。素材和数据留在本机从视频分离、声音克隆到音视频合成整条链路都在本地 GPU 上完成。对不能把人脸、声音素材交给云服务的团队和个人来说这是选择本地部署而不是在线 SaaS 的关键理由。动手前的准备这一段核对硬件配置、装好依赖并拉起服务端是后面一切的地基。机器要求硬性一块英伟达显卡且已正确安装显卡驱动——全部算力在本地 GPU 上没有它服务起不来内存 32G 及以上参考配置i5-13400F RTX 4070磁盘Windows 下需要 D 盘存放数字人和作品空闲 30G 以上Docker 镜像默认写在 C 盘空闲 100G 以上首次启动要下载约 70G 镜像系统Windows 10 19042.1526 及以上或 Ubuntu 22.04装软件Windows 先在终端执行wsl --install装好 WSL再安装 Docker Desktop 并首次启动接受协议、跳过登录即可安装最新的英伟达显卡驱动装完执行nvidia-smi能显示出显卡信息就算成功如果打算从源码构建客户端另外装 Node.js 18直接用官方打包好的客户端则不需要获取项目并启动服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆完成后进入项目的 deploy/ 目录执行下面这条命令启动服务端cd deploy docker-compose up -d首次拉取镜像约需半小时建议连 WiFi。在 Docker 里看到 asr、tts、gen-video 三个服务都变为 Running服务端就就绪了。显存紧张可以改用轻量版只启动视频合成一个服务在命令里加-f docker-compose-lite.ymlUbuntu 用户则用docker-compose-linux.yml。C 盘空间不够的话不要硬装打开 Docker Desktop 的设置 → Resources把磁盘镜像位置改到剩余空间 100G 以上的磁盘。客户端从项目 Releases 获取官方安装包Windows 是 .exe 安装程序Ubuntu 是 AppImage双击即可启动。第一次跑通目标只有一个四步生成第一条数字人视频。先看到成片再回头研究细节。打开客户端点Create Avatar创建形象上传一段 10 秒左右的说话视频注意两个硬性条件视频必须有声音且必须是本人在说话——程序要用这段声音做声音克隆等模型生成完毕我的形象里会出现你的数字人点Create Video创建视频选中刚建好的形象输入一段文案点击生成成片会出现在我的作品里可以直接预览和保存。到这里最小闭环已经跑通。核心能力拆解下面三个能力就是这个项目值钱的地方逐个讲清它是什么、怎么用、适合谁。声音与形象双克隆你上传的说话视频会被拆成两路处理一路分离出纯语音送入语音服务基于 fish-speech 模型完成声音克隆同时用语音识别基于 fun-asr把视频里的话转成文字作为参考另一路无声视频用于构建形象模型。两条结果都会留存供后续合成时反复调用。适合想拥有一个可长期复用的数字分身的人——克隆一次无限次使用。文字与语音驱动视频生成克隆完成后生成视频有两种入口输入文字系统先用你的克隆音色合成语音再由视频服务驱动数字人做口型并合成音视频或者直接上传现成的音频文件跳过文字转语音这一步让它按音频的节奏驱动口型。脚本支持中、英、日、韩、法、德、阿拉伯语、西班牙语共 8 种语言。适合做系列口播、多语言内容搬运和日常播报视频。开放 API接入你自己的系统服务端启动后会在本机暴露端口声音克隆与语音合成走 18180 端口视频合成任务提交和进度查询走 8383 端口。想集成进自己的产品调用代码就在客户端源码 src/main/service/ 里照着写就行。适合需要把数字人能力嵌进自有业务系统的开发者。让效果更好的调优清单克隆素材光线均匀、正面出镜、无遮挡、人声清晰稳定宁可重录 10 秒干净的也别用带环境音的长视频长文案分段生成再拼接别一次塞超长文本排队50 系列显卡在 deploy/ 目录改用docker-compose -f docker-compose-5090.yml up -d30/40 系列配 CUDA 12.8 也可用这套磁盘镜像下载约 70GC 盘不够就按前文改 Docker 磁盘位置不要边下边清理保持更新项目更新频繁不少问题新版已修服务端到 deploy 目录重新执行docker-compose up -d客户端拉取代码后重新构建卡住了怎么办按问题—原因—解法速查这四条更多细节看 常见问题文档。问题一docker-compose up -d报连接 registry-1.docker.io 超时原因Docker Hub 官方源连接不稳定。 解法开全局代理或在 Docker 的 daemon.json 里给registry-mirrors配置国内镜像源保存、重启 Docker 后重新执行命令。问题二新增模特克隆形象时直接报错失败原因上传的视频没有声音或画面里没有人说话声音克隆无料可用。 解法重录一段 10 秒左右、人声清晰的说话视频再上传。问题三三个 Docker 服务起不来或反复重启原因缺英伟达显卡或驱动没装好本地 GPU 算力无法挂载。 解法执行nvidia-smi确认能显示显卡信息安装或更新驱动后重启服务。问题四报错信息看不明白定位不到原因解法两端都看日志。客户端点右上角设置里的Open Log查看本地日志Docker 中点进对应服务打开日志面板把关键几行复制出来对照排查。你的本地数字人工作台已经搭好。先去生成一条口播视频感受一下嘴型与声音的效果再尝试 8 种语言脚本和开放 API让它慢慢变成你的内容生产线。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/11 6:15:30

AIGCPanel体验SenseNova-U1.5:文生图与图生图全流程实操指南

最近在整理手上几个AIGC工具合集的时候,发现 AIGCPanel 又上新了,这次带来的是 SenseNova-U1.5,入口直接就标了“文生图 / 图生图”两套能力,而且挂着“免费体验”的按钮。作为一个平时要跑不少素材图、概念图的人,我对…

2026/9/11 10:51:39

AI原生应用后端实战:FastAPI异步、流式输出与并发控制全解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 10:51:39

Java基础:对象序列化详解

在我们平日开发中,经常让PO类去实现Serializable接口,然后让其可序列化。不过有时我们并不是特别清楚为什么要序列化,特别是对于纯Web项目开发的同学来说,需求环境不一定能用上。下面我简单和大家分享下自己对序列化的认知。一、什…

2026/9/11 10:51:39

Django多功能校园网站毕设全攻略:从选题到部署的完整复盘

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/11 10:51:39

数据安全:通用的数据加密方法(AES、RSA、数字签名和数字证书)

在日常的接口交互中,数据的安全性是优先考虑的问题之一。那么一般我们在实际工作中如何去保证数据的安全呢?一般是通过数据加密的方式来处理。加密算法,如果按是否可以把密文还原成明文来划分的话,可以分为可逆加密和不可逆加密。…

2026/9/11 10:51:39

消息队列:MQ架构设计优化

消息队列,在复杂系统中应用广泛。虽然说加入mq后,系统的复杂度提高、系统可用性也变低而且可能引发数据出现一致性的问题,那么为什么还要用MQ呢?其实主要是其在特殊的场景下能解决我们很多问题。一、MQ使用的主要场景使用MQ主要场…

2026/9/11 10:46:34

基于STM32的鱼缸水质监测系统DIY设计与实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码