尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
HeyGem.ai 数字人本地部署完全指南:10 秒素材克隆出会说话的口播视频
HeyGem.ai 数字人本地部署完全指南10 秒素材克隆出会说话的口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.aiDuix.Avatar是一套可完全离线运行的开源数字人视频生成工具给它一段 10 秒左右的出镜视频它就能克隆你的形象和声音之后只要输入文字或音频就能驱动这个数字人口型对轨产出口播视频。整个数字人本地部署流程不需要上传任何素材到云端隐私和算力都留在自己的机器里。动手前确认你的电脑跑得动在装任何东西之前先对照这份清单缺了硬件是省不掉的——本项目的全部推理算力都在本地 GPU 上跑。项目要求显卡英伟达 N 卡 正确安装的驱动nvidia-smi能看到显卡信息才算数内存32G 及以上16G 机器连 ASR 服务都可能起不来系统Windows 10 19042 或 Ubuntu 22.04其他 Linux 未验证磁盘Docker 镜像约 100G 空闲作品数据目录 30G 空闲运行时DockerWindows 上走 WSL2 后端 Node.js 18仅自己构建客户端时需要一个容易踩的坑Windows 上 Docker Desktop 的镜像默认存在 C 盘如果你 C 盘不够安装 Docker 之后要提前把存储位置改到别的盘否则拉镜像会直接把 C 盘撑爆。跑通服务端三步起三个 Docker 服务服务端由三个容器组成duix-avatar-tts语音合成端口 18180、duix-avatar-asr语音识别端口 10095、duix-avatar-gen-video视频合成端口 8383定义都在 deploy/docker-compose.yml 里。Windows 流程先用wsl --install装好 WSL2再装 Docker Desktop然后在仓库目录下执行cd deploy docker-compose up -dUbuntu 22.04 流程装好 Docker 和 NVIDIA Container Toolkit让容器能用上显卡后执行cd deploy docker-compose -f docker-compose-linux.yml up -d配置文件对应 deploy/docker-compose-linux.yml。首次拉取镜像大约消耗 70G 流量建议连 WiFi 等半小时左右。怎么算成功了Docker 里三个容器都变成 Running 状态服务端就就绪了。接下来打开客户端下载官方构建的安装包直接装或在仓库里npm install后npm run dev跑开发版能看到首页并成功创建第一个数字模特说明端到端全通了。打开客户端产出第一条口播视频客户端首页就两块区域对应两条主线任务Create Video制作视频选择已克隆的数字人 输入文案或上传音频 → 生成口播视频。Create Avatar定制模特上传一段出镜视频 → 克隆形象 声音得到一个可重复使用的数字模特。推荐先走第二条准备 10 秒左右的视频要求画面里的人在说话声音会用于克隆音色背景安静、人脸清晰。训练完成后My Avatars 列表里就会出现你的数字模特之后每次生成视频只需换文案形象不用重新训。它能替你干的活儿把功能名词翻译成实际能交付的东西大概是这四件事口播视频量产写一段稿子几十秒后得到一条人物口型对轨的播报视频适合短视频、课程、产品介绍这类真人出镜但懒得拍的场景。声音克隆10 秒声音样本就能复刻音色之后合成语音都带你的声线脚本支持中、英、日、韩、法、德、阿、西 8 种语言。多模特管理客户端支持导入多个模型不同栏目、不同出镜人分开管理一键切换。接口化集成服务端 Docker 起来后在127.0.0.1上暴露了模特训练、音频合成、视频合成和进度查询四组接口可以直接接进自己的业务系统。调用逻辑参考 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。让它跑得更快更稳版本选择与调优50 系显卡专用方案RTX 5090 等新卡默认 compose 可能起不来官方提供了基于 torch 预览版 CUDA 的 deploy/docker-compose-5090.yml30/40 系使用 cuda12.8 的机器也可以借用这套cd deploy docker-compose -f docker-compose-5090.yml up -d轻配机器用 Lite 版显存吃紧时执行docker-compose -f docker-compose-lite.yml up -d只启动视频合成一个服务配置见 deploy/docker-compose-lite.yml。磁盘规划Docker 镜像放 C 盘空间充足的位置数字人和作品数据放独立盘默认约定D:\duix_avatar_data。需要搬家时在 Docker Desktop 的 Settings → Resources → Advanced 里改 Disk image location拉镜像慢给 Docker 配置 registry-mirrors 加速Linux 改/etc/docker/daemon.jsonWindows 在 Docker Engine JSON 里加同名字段可用镜像源列表见 doc/常见问题.md。视频质量源素材决定上限——照片/视频越清晰、声音越干净克隆效果越好批量生成时按条排队提交避免多条任务挤占同一块显存。遇到报错怎么修①docker-compose up -d拉镜像超时Get https://registry-1.docker.io/v2/: request canceled官方源连接不稳定。打开 Docker Desktop 的 Settings → Docker Engine在 JSON 里加入registry-mirrors字段Apply restart 后重试② 新增模特时训练失败上传的视频必须包含人声且人在说话——程序要从这段声音里做声音克隆纯画面视频会直接失败。③ 定制模特报Connection refused或 asr 相关错误ASR 服务冷启动偏慢服务端刚拉完容器别急着建模特等几分钟再操作内存只有 16G 的机器可能根本拉不起来建议 32G 起步。④ tts 容器日志刷File not exists一般是数据卷挂载路径不对比如非 Windows 环境照抄了d:/duix_avatar_data/...的卷映射检查 compose 文件里的 volumes 是否指向了真实存在的数据目录⑤ 问题难定位时先取日志客户端日志在设置菜单 打开日志 里文件位于Roaming\heygem.ai\logs\main.log服务端日志直接在对应容器的 Logs 页签复制更多报错和解决方案翻 doc/常见问题.md 基本都有覆盖。下一步部署跑通之后值得花时间的方向有三个用 API 把文案进、视频出接进自己的发布流程实现无人值守的批量生产针对常用出镜场景沉淀 2~3 个固定模特减少重复训练显存充裕的话试试完整版与 Lite 版在生成速度上的差距给自己的机器定一个最优配置。整套流程走完你会发现一段 10 秒素材换来了一个随时能开口说话的数字分身而且全程数据不出本机。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

C语言Hello World程序解析与开发环境配置指南

C语言Hello World程序解析与开发环境配置指南

1. 为什么Hello World是编程入门的必修课 第一次接触C语言的新手往往会对"Hello World"程序的价值产生疑问——这个只能输出一行文字的小程序,真的值得专门学习吗?实际上,这个看似简单的程序蕴含着编程最基础的逻辑结构。1978年&am…

📅 2026/9/11 23:26:43
Vue3自定义Tabs组件实现与翻页交互优化

Vue3自定义Tabs组件实现与翻页交互优化

1. 项目概述:自定义Tabs组件的翻页交互设计在前端开发中,Tabs(标签页)组件是最常用的UI控件之一。当标签数量超出容器宽度时,传统的滚动条方案既不美观也不符合移动端交互习惯。我最近在Vue3项目中实现了一个带翻页按钮…

📅 2026/9/11 23:21:43
10 分钟实战 OpenMetadata:把散落各处的表变成可搜索的数据目录

10 分钟实战 OpenMetadata:把散落各处的表变成可搜索的数据目录

10 分钟实战 OpenMetadata:把散落各处的表变成可搜索的数据目录 【免费下载链接】OpenMetadata The Open Context Layer for Data and AI , OpenMetadata is the open platform for building trusted data context and business semantics for humans, AI assistant…

📅 2026/9/11 23:21:43
MORE NEWS

更多资讯

📰

SSM校园点餐系统源码详解:从数据库设计到部署压测实战

简介:面向高校 Java 课程设计与毕业设计的 SSM 校园在线点餐系统源码,基于 Spring Spring MVC MyBatis 整合框架,前端采用 Layui、JSP 与 jQuery,提供用户注册登录、购物车、订单评论、校园资讯以及后台用户/商品/订单/评论等完…

📰

MATLAB实现ASK无线通信系统仿真:从参数设置到误码率分析

简介:利用MATLAB设计并仿真无线通信系统的完整方案,主要面向通信工程专业学生及MATLAB仿真入门者,解决ASK调制在噪声信道下的建模与验证问题。资源围绕单音频信源产生、振幅键控调制和加性高斯白噪声信道展开,覆盖信号生成、调制映…

📰

如何把上百个种子站的搜索聚合成一个Jackett面板:新手上手指南

如何把上百个种子站的搜索聚合成一个Jackett面板:新手上手指南 【免费下载链接】Jackett API Support for your favorite torrent trackers 项目地址: https://gitcode.com/GitHub_Trending/ja/Jackett Jackett 是一个专门给种子跟踪站(tracker&a…

📰

Element Plus TimeSelect 时间选择器完全指南:从固定时间点到联动时间范围

Element Plus TimeSelect 时间选择器完全指南:从固定时间点到联动时间范围 【免费下载链接】element-plus 🎉 A Vue.js 3 UI Library made by Element team 项目地址: https://gitcode.com/GitHub_Trending/el/element-plus TimeSelect 是 Elemen…

📰

Ente Photos 安全与隐私实战指南:端到端加密、密钥管理与账户防护全解析

Ente Photos 安全与隐私实战指南:端到端加密、密钥管理与账户防护全解析 【免费下载链接】ente 💚 End-to-end encrypted cloud for everything. 项目地址: https://gitcode.com/GitHub_Trending/en/ente 本指南以 Ente Photos 官方「Security an…

📰

AionUi 多语言架构指南:基于 i18next 的国际化实现与源码解析

AionUi 多语言架构指南:基于 i18next 的国际化实现与源码解析 【免费下载链接】AionUi Open-source 24/7 Cowork app for OpenClaw, Hermes, Claude Code, Codex, OpenCode and 20 more CLI Agent | Customize your assistants | Team them up|Star if y…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬