尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
LiveTalking:5 步让数字人在浏览器里开口对话,本地跑、免费开源
LiveTalking5 步让数字人在浏览器里开口对话本地跑、免费开源【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream昨晚开播你不想自己出镜想让数字分身坐在镜头前替你实时接话或者线上培训里需要一个随问随答、还能被打断的讲师LiveTalkingmetahuman-stream就是一个实时交互流式数字人引擎输入文字或语音它把虚拟形象驱动着实时说话音视频同步地流到你眼前。它免费开源Apache 2.0、本地跑你的形象和语音数据不用出机器。读完这篇你能在 5 步内让数字人在浏览器里实时开口之后接 LLM 对话、RTMP 直播、虚拟摄像头都是拧参数的事。装环境前先做硬件体检对直播、客服、培训这类场景它做的事很直接文字或语音进来数字人开口说话支持随时打断重说内置 wav2lip、musetalk、ultralight 三套口型模型按显存选档位支持声音克隆一段参考音频就能让数字人换个音色多路并发一个服务端同时接多个用户WebRTC、RTMP、虚拟摄像头三种输出浏览器到直播平台全覆盖上传一段视频就能生成新的数字人形象还能编排不说话时播放的自定义动作。先看这张配置表够格再往下走项目最低推荐系统Ubuntu / Win / macOSUbuntu 22.04Python3.103.12PyTorch2.x2.9.1 CUDA 12.8显卡6GB 显存 N 卡12GBRTX 3060 起步内存8GB16GB一句话判断wav2lip 在 RTX 3060 上实测 60 FPS够实时musetalk 画质更好但建议 RTX 3080Ti 以上。先跑起来再说装依赖和第一次出效果是一条线5 步走完把仓库拿下来git clone https://gitcode.com/GitHub_Trending/me/metahuman-streamcd 进目录建环境装依赖conda create -n livetalking python3.12 conda activate livetalking pip install torch2.9.1 torchvision0.24.1 torchaudio2.9.1 --index-url https://download.pytorch.org/whl/cu128 pip install -r requirements.txt按 README 指引下载 wav2lip256 模型和 avatar1 形象包网盘地址在 README 里模型文件放进models/目录并改名为wav2lip.pth形象文件夹整个放进data/avatars/启动服务python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1服务端需要开放 TCP 8010 和 UDP 1~65536。启动后浏览器打开http://服务器IP:8010/index.html文本框里打一句话点发送——看到数字人视频动起来、口型跟着语音走的那一刻整条链路就通了。这个首页就是日常主阵地WebRTC 连接、文本/音频驱动、打断、录制控制都在上面。旁边还有两个页面值得知道avatar.html上传视频生成新形象admin.html监控会话状态和全局配置。环境通了接下来才是正事。生成你自己的数字人形象内置形象只能算试吃用自己的脸才算正式上桌。整条数据流不长四段话讲完拍视频1~2 分钟正面说话即可安静环境、光线均匀语速自然上传处理在avatar.html页面上传视频创建生成任务进度查询接口见 docs/avatar_api.md出形象任务跑完你会拿到一个 avatar_id形象落在data/avatars/下--avatar_id指向它就能用上线重启服务或直接在浏览器指定这个形象新数字人登场。形象是视频驱动的源视频多清晰数字人就是多高清口型只改嘴、身体动作全靠原视频。所以拍的时候别用糊镜头。三个场景各取所需场景一实时对话问答最快上手用默认 webrtc 模式启动浏览器连上文本驱动选 chat 模式回复交给 LLM默认接通义千问provider 在 config.yaml 里切对方说话时你随时点打断播报立刻停、新内容顶上。想让数字人接得住话LLM 那一段基本零配置默认就能聊。场景二无人值守直播 / 会议替身虚拟摄像头把启动参数换成--transport virtualcam数字人会输出到 OBS Virtual Camera首次先装并打开一次 OBS 激活设备之后不用开着 OBS腾讯会议、Zoom、OBS 里把摄像头选成虚拟摄像头画面音频都自动接上。输出方式启动参数适用虚拟摄像头--transport virtualcam直播推流、会议替身RTMP--transport rtmp推流到直播平台WebRTC--transport webrtc浏览器实时对话详细步骤在 docs/virtualcam_guide.md。场景三批量出镜视频 / API 驱动不发浏览器请求直接 HTTP 调/human让数字人说话配合/record开始和停止录制拿到data/record/sessionid.mp4换一批文案循环提交就是一条批量生产口播视频的流水线。完整接口参数见 docs/api.md。参数手感手册参数不用全懂调了有明显差异的就这五个你遇到显存报 OOM → 拧--batch_size从默认 16 减到 8 或 4帧率几乎无感你遇到推流掉帧 → 先看日志里inferfps和finalfps两者都 ≥25 才算实时低了就换更快的模型或降分辨率你遇到并发会话不够 → 拧--max_session记住不说话的路费 CPU、同时说话的路费 GPU你想让数字人换个音色 → 请求参数里带参考音频和对应文本16kHz 单声道 wav 效果最稳你要压并发上限 → 模型档位先定死wav2lip 便宜、musetalk 贵再谈并发。调参纪律一次只动一个参数用同一段文本对比两次的帧率日志手感很快就有了。翻车急救包症状原因解法端口 8010 被占服务没退干净或别的程序占着杀掉旧进程或--listenport换个端口CUDA out of memory显存不够减--batch_size或换 wav2lipPyTorch CUDA 报错PyTorch 的 CUDA 版本和显卡驱动不匹配对照nvidia-smi右上角版本重装 PyTorch口型对不上音频模型或形象没放对位置确认models/wav2lip.pth和data/avatars/结构完整浏览器连不上UDP 端口段没放行按 README 放行 UDP 1~65536更细的排查思路看 docs/ 下的 API 和管理文档。源码地图选看app.py # 入口装配模型、会话、推流 config.py # 参数与 config.yaml 的优先级 llm.py # 大模型回复 server/ # WebRTC、会话、任务管理 avatars/ # wav2lip、musetalk、ultralight 三套模型推理 tts/ # 十几种 TTS 引擎可插拔 streamout/ # webrtc、rtmp、virtualcam 输出 web/ # 前端页面三个先看avatars/ 管数字人怎么动起来tts/ 管声音从哪来registry.py 是插件注册机制——想加自己的 TTS 或数字人模型照格式写一个模块挂上去就行。你的下一步新手1 按顺序装环境、放模型、跑通浏览器对话2 确认实时后上传自己的视频生成形象3 接虚拟摄像头推到 OBS 试一场直播。进阶1 接上 LLM让数字人自己接话2 用/human/record批量出视频3 压并发盯inferfps和finalfps找瓶颈。跑通第一路实时对话之后打断、换音、并发这些能力叠上去就是这套引擎真正值钱的地方 【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

产品经理也能 AI 绘图?Free AI Courses Nano Banana 模块入门

产品经理也能 AI 绘图?Free AI Courses Nano Banana 模块入门

产品经理也能 AI 绘图?Free AI Courses Nano Banana 模块入门 【免费下载链接】free-ai-courses Interactive course teaching Product Managers how to use Claude Code effectively 项目地址: https://gitcode.com/GitHub_Trending/cl/free-ai-courses Fre…

📅 2026/9/18 4:49:26
uni-app自定义数字键盘从零封装:跨端开发避坑指南

uni-app自定义数字键盘从零封装:跨端开发避坑指南

1. 为什么原生键盘和第三方库在支付场景里集体“翻车”如果你做过一段时间的 uni-app 跨端开发&#xff0c;肯定遇到过这样的需求&#xff1a;页面上需要一个“输入金额”或者“输入支付密码”的输入框。大多数新手的第一反应是——直接用<input type"digit" />…

📅 2026/9/18 4:49:26
Unity Shader入门精要实战笔记:从基础到光照纹理

Unity Shader入门精要实战笔记:从基础到光照纹理

不知不觉入行Unity开发也有几年了&#xff0c;真正让我下决心啃Shader&#xff0c;不是书上那些炫酷的截图&#xff0c;而是项目里一个绕不过去的需求&#xff1a;UI上要做一个边缘泛光效果&#xff0c;美术给了一堆序列帧&#xff0c;怎么做都像贴纸&#xff0c;粒子也叠不出那…

📅 2026/9/18 4:49:26
MORE NEWS

更多资讯

📰

从 Trace 到时间序列:Grafana Tempo TraceQL Metrics 指标查询的设计与实现

从 Trace 到时间序列&#xff1a;Grafana Tempo TraceQL Metrics 指标查询的设计与实现 【免费下载链接】tempo Grafana Tempo is a high volume, minimal dependency distributed tracing backend. 项目地址: https://gitcode.com/GitHub_Trending/tempo1/tempo 导读&a…

📰

打通ADTF与ROS:ADAS测试数据采集与回放适配层实践

做 ADAS 测试的兄弟应该都有这种体会&#xff1a;车上跑的感知算法栈&#xff0c;越来越像是 ROS 的天下&#xff1b;而做数据采集、场景回放和整车信号级分析的一套工具体系&#xff0c;又绕不开 ADTF。这两套东西一个偏“算法表达”&#xff0c;一个偏“工程数据流”&#xf…

📰

gogcli 实战:使用 `gog sites url` 一键输出 Google Sites 编辑器链接

gogcli 实战&#xff1a;使用 gog sites url 一键输出 Google Sites 编辑器链接 【免费下载链接】gogcli Google Workspace in your terminal. 项目地址: https://gitcode.com/GitHub_Trending/gogcl/gogcli 本文以 gog sites url 子命令为核心&#xff0c;讲解 gogcli&a…

📰

AI写作工具长期使用效果与优化策略

1. 项目概述&#xff1a;AI写作工具长期使用观察去年三月&#xff0c;我开始系统性地使用某款主流AI写作辅助工具处理日常工作文档。最初只是抱着试试看的心态&#xff0c;没想到这一用就是整整十四个月。这段时间里&#xff0c;我完成了超过200份商业文案、技术文档和个人创作…

📰

DeepSeek Harness插件接入实操:原理、开发与部署全流程

DeepSeek Harness 接入插件&#xff1a;从零到一的全流程实操记录这应该是 Harness 系列里最被问爆的一篇了。前面几篇我们聊了 DeepSeek Harness 的部署、基础推理能力和 API 服务怎么开&#xff0c;但说实话&#xff0c;真正让 Harness 从“一个能用的大模型推理工具”变成“…

📰

OpenReel 形状图层升级指南:Shape Groups 与 Merge Paths 的实现路线图

OpenReel 形状图层升级指南&#xff1a;Shape Groups 与 Merge Paths 的实现路线图 【免费下载链接】openreel-video OpenReel Video - Professional browser-based video editor. Open source CapCut alternative. 100% browser-based, no installation, no cloud uploads, no…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬