尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Duix.Avatar 开源数字人克隆工具:10秒视频离线生成口播视频的完整方案
Duix.Avatar 开源数字人克隆工具:10秒视频离线生成口播视频的完整方案【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款完全开源的数字人克隆工具:提交一段 10 秒左右的真人视频,即可离线克隆你的形象和声音,再用文字或语音驱动,自动合成口型对齐的口播视频。它专为 Windows 设计,也支持 Ubuntu 22.04 桌面版,全程无需联网,素材和成片都不出本机。先看一个真实问题我刚跑完docker-compose up -d,三个服务都显示 Running,新增模特训练却报 Connection refused,是网络不通吗?大概率不是网络问题。原因有两个:一是Duix.Avatar-asr服务启动比较慢,服务端刚起来时 ASR 还没就绪,标准做法是等几分钟再执行克隆形象;二是机器内存太小(比如 16G)时服务可能根本拉不起来。另外还有一个容易忽略的前置条件:用来创建模特的视频必须有声音,且是人在说话,因为程序要拿这段声音做声音克隆。遇到报错时,客户端日志和服务端 Docker 日志都要看,常见问题文档里给出了两者的获取方式。 服务 Running 不等于立即可用:克隆前先确认三个服务都启动完成,再检查源视频有人声、在说话这两个硬条件。它到底是什么Duix.Avatar 是一个数字人克隆加离线视频合成的桌面工具:客户端是 Electron Vue 3 应用,后端是 3 个 Docker 服务(语音合成、语音识别、视频生成)组成的本地推理栈,当前客户端版本为 1.0.6。全离线运行:所有算力都在本地,无需联网,素材隐私不出机器形象声音双克隆:高精度捕捉五官轮廓,同时还原人声的语调与节奏特征文字/语音双驱动:输入文案直接合成语音,或直接上传音频驱动数字人多语言脚本:文案支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语 8 种语言能力清单:从克隆到合成的 5 项能力能力说明形象克隆基于真人视频训练专属数字人模型,支持导入多个模型管理声音克隆由 fish-speech 引擎克隆音色,本地服务端口 18180语音识别由 fun-asr 引擎将人声转成文本,用于声音克隆的文本对齐口播视频合成文字或音频驱动数字人,自动完成口型同步与音视频对齐,端口 8383开放 API模型训练、语音合成、视频合成三步均提供本地 HTTP 接口,可嵌入自有业务你还可以直接丢给它的问题镜像拉取超时,卡在部署第一步docker-compose up -d一直报 request canceled / context canceled,怎么解决?这是 Docker Hub 官方源连接不稳定的典型表现。两条路:开启全局代理直连,或者给 Docker 配置镜像加速源(改daemon.json里的 registry-mirrors)。另外首次部署会下载约 70GB 镜像,官方建议挂 WiFi 并预留大约半小时。 拉镜像阶段耗时长是正常现象,三个服务(精简版只有 1 个)全部 Running 才算部署完成。把合成功能接进自己的业务系统我不想只用桌面客户端,想把数字人视频合成嵌进自己的 App,有接口吗?有。Docker 启动后三个服务都在http://127.0.0.1上暴露端口:语音合成走18180/v1/invoke,视频合成提交走8383/easy/submit,再配8383/easy/query轮询任务进度。客户端源码里src/main/service/下的 model.js、video.js、voice.js 就是完整的调用示范,照着抄即可。⚠️ 本地部署要求你自备 NVIDIA 显卡服务器并承担维护成本;如果追求更高清的口型效果和 SLA 保障,官方另有商业 API 服务方案,README 里有两种路线的逐项对比表。RTX 50 系列新显卡能不能跑我新机器是 RTX 5090,官方镜像能直接用吗?可以,但不要用默认的 compose 文件。50 系列走deploy/docker-compose-5090.yml,对应镜像换成guiji2025/fish-speech-5090和guiji2025/duix.avatar-5090,官方已基于 5090 实测通过;30/40 系列配合 CUDA 12.8 也验证可行。它明确不做什么实时交互数字人:本项目只做数字人克隆和非实时视频合成。想要实时对话式的数字人,官方指向 duix.com 官网的在线体验/商业方案,不在开源范围内。无 GPU 环境运行:三个服务全部依赖 NVIDIA 显卡,没有 N 卡或驱动没装好,服务直接起不来,官方也不提供纯 CPU 部署路径。商业级口型效果与 SLA:开源本地版的口型效果官方定性为可用,惊艳级高清效果和专业技术响应团队归属于商业 API 服务,不在开源仓库的责任边界内。找资料:文档与源码中文总览与部署说明:README_zh.md,英文版见 README.md常见部署问题与排查步骤(镜像超时、新增模特报错、服务连接拒绝等):doc/常见问题.mdDocker 编排文件,含标准版、Ubuntu 版、精简版和 5090 版共 4 套:deploy/客户端开放 API 的调用实现:src/main/service/商用授权条款:LICENSE 及仓库根目录的中英文模型社区许可协议 PDF三步开始上手准备一台 Windows 10 19042.1526 或 Ubuntu 22.04 机器,确认 NVIDIA 显卡驱动可用(nvidia-smi能输出显卡信息),D 盘留 30GB、C 盘留 100GB 以上;然后克隆仓库:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar进入/deploy目录执行docker-compose up -d(磁盘紧张或只需合成功能时用docker-compose -f docker-compose-lite.yml up -d只起 1 个服务),等待约 70GB 镜像下载完成、服务全部 Running安装官方客户端,上传一段 10 秒左右、有清晰人声的真人视频完成形象和声音克隆,再输入文案或上传音频,即可生成第一条口播视频收尾Duix.Avatar 把形象克隆、声音克隆、口型合成这条完整链路做成了可以离线跑通的开源工具,一条 compose 命令就能搭起本地数字人生产线。对内容创作者和企业来说,它意味着素材隐私不出本机、视频量产不再按次付费。从第一条口播视频开始,这套本地栈可以长期成为你的数字人基础设施。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

ToF相机全链路解析:从VCSEL硬件到ROS2点云的工程实践

ToF相机全链路解析:从VCSEL硬件到ROS2点云的工程实践

1. 项目概述:为什么“ToF相机从底层硬件到上层应用整体链路”这个标题值得深挖?如果你是做过嵌入式视觉、工业检测或机器人导航的工程师,大概率踩过这样的坑:买回来一块标称“支持ToF测距”的模组,接上开发板后v4l2-li…

📅 2026/9/11 6:07:50
Onyx CLI Agent 接入指南:让 AI 智能体检索企业知识库的完整配置与命令手册

Onyx CLI Agent 接入指南:让 AI 智能体检索企业知识库的完整配置与命令手册

Onyx CLI Agent 接入指南:让 AI 智能体检索企业知识库的完整配置与命令手册 【免费下载链接】danswer Open Source AI Platform - AI Chat with advanced features that works with every LLM 项目地址: https://gitcode.com/GitHub_Trending/da/danswer ony…

📅 2026/9/11 6:02:50
深入解析RP2040看门狗:从时钟链到寄存器调试实战

深入解析RP2040看门狗:从时钟链到寄存器调试实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/11 6:02:50
MORE NEWS

更多资讯

📰

SmartMediaKit与YOLO融合:低延迟播放+实时目标检测一体化实践

之前做安防监控项目对接的时候,我一直在琢磨一件事:播放这套东西和检测这套东西,到底能不能真正揉到同一个工程里,而不是各干各的、中间隔着一层人肉转发。后来把 SmartMediaKit 和 YOLO 硬凑到了一个项目里,边踩坑边调…

📰

小应用数据库选型决策指南:自建MySQL vs 阿里云RDS

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

医院低代码选型实战:信通院白皮书框架与POC测评避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

宏内核与微内核:两种设计哲学的对比

090 宏内核与微内核:两种设计哲学的对比 上一篇文章我们提到了内核的几种类型。今天我们来深入对比最经典的两种:宏内核和微内核。 这两种设计代表了计算机系统设计中最核心的一个哲学问题:是把所有功能集中在一起,还是分散开来? 宏内核:大一统的设计 架构 宏内核(…

📰

如何快速搭建移动测试自动化:Maestro 端到端测试完整落地指南

如何快速搭建移动测试自动化:Maestro 端到端测试完整落地指南 【免费下载链接】Maestro Painless E2E Automation for Mobile and Web 项目地址: https://gitcode.com/GitHub_Trending/ma/Maestro 做移动测试自动化,最该先问的不是"上哪套框…

📰

基于STM32的智能热水器恒温控制系统设计与实现

简介:这是一份基于STM32的智能热水器系统完整设计资源,适合嵌入式方向的学生、毕业设计者及电子竞赛参与者。方案主控采用STM32,通过PCF8591芯片加滑动变阻器模拟温度、水位检测,配合光敏电阻判断光照强度,并利用DS130…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬