免费数字人直播搭建:OBS画面与音频去重实操指南 数字人直播这两年热度一直不低但很多人第一次搭的时候往往卡在同一个地方数字人视频生成出来了OBS也装好了结果一开播要么画面重复叠影要么声音像山洞里放炮一样带回声甚至口型对不上。这个问题的核心并不是数字人工具不够好而是你还没把“画面链路”和“音频链路”拆清楚。这篇内容专门讲怎么用免费数字人制作工具、免费口播配音方式再配合 OBS 把 AI 数字人直播和 AI 数字人视频制作完整跑通。重点会放在 OBS 画面去重、音频去重这两个容易被忽略的环节。适合刚开始接触数字人直播、想用低成本先验证效果的新手也适合已经跑通过一次但想解决音画质量和素材重复问题的同学。我先把整套搭建流程按实际落地顺序拆一遍从工具选型、画面源配置、音频链路到单条口播视频和直播推流最后是常见故障排查。看完你至少能判断自己到底应该怎么搭踩坑时先查哪里。1. 先想清楚数字人直播到底需要哪几块1.1 数字人直播的四个核心部分第一次搭数字人直播的人最容易犯的错是以为“装一个数字人软件开播就完事”。实际上一套能正常走的数字人直播链路至少包含四块第一数字人形象。这个形象可以是一张静态图、一段预先渲染好的数字人视频也可以是一个实时驱动的虚拟形象。免费方案里最常见的是用在线数字人视频生成平台做出一段真人感数字人出镜视频然后把视频导入 OBS 当作直播画面源。第二语音合成。数字人说话的声音不是靠麦克风实时讲而是通过 TTS 文字转语音生成。你可以提前把直播话术、口播文案转成音频文件也可以让数字人工具在生成视频时自动合成语音。第三视频合成。把数字人形象、语音、背景、字幕合成一个完整视频片段。这个环节通常在数字人工具里完成输出 MP4 或透明背景视频。第四OBS 推流或录制。OBS 负责把数字人视频作为画面源把音频作为音源混合后推到直播平台或者录制成口播视频文件。这四个部分缺一块链路就走不通。你遇到的“口型对不上”“声音重复”“画面模糊”绝大多数问题都出在第三和第四块的衔接上。1.2 画面去重和音频去重到底是什么场景标题里常提到的“OBS画面去重、音频去重”说白了就是不要让同一份素材、同一个声音在直播画面里出现两次或多次。画面去重最常见的场景有三个数字人视频里已经带背景图你又在 OBS 场景里加了一张相同的背景结果背景看起来重影或者两层画面叠在一起。你用一个视频作为数字人画面源但这个视频里有字幕你又单独加了一个字幕源导致文字叠文字。同一个媒体源被重复添加或者窗口采集时把两个包含相同内容的窗口同时采集进来。音频去重的场景更常见数字人视频自带一条音轨你又单独添加了一份语音文件声音就会重。桌面音频采集到了系统正在播放的数字人视频声音麦克风或浏览器窗口又采集了一遍于是出现双重音和回声。OBS 的监听设置开了“监听并输出”而外部声卡或虚拟声卡又把这路声音返送回直播形成回声循环。换句话说画面去重和音频去重本质上是在做“素材源和播放源的管理”。你先把源管住再去追求画质音质才有意义。1.3 免费方案和付费方案怎么判断标题强调“免费数字人直播软件、免费数字人制作工具”这里先给一个务实的判断标准免费不等于零成本更不等于零学习成本。在线数字人平台通常提供免费额度和试用版但一般有这些限制生成视频带平台水印、单次生成时长有限、每天生成次数有限、导出分辨率有限。如果你是第一次做测试免费额度够用如果你要长期批量生产口播视频建议先把免费额度能生成的素材种类摸清楚再决定是否需要付费。本地开源方案的优势是可控性强可以批量生成、不依赖平台额度但需要你自己准备模型环境、依赖库、GPU 资源。低配机器也能跑只是生成速度和分辨率会有明显瓶颈。所以我的建议是先在线工具跑通流程再决定要不要上本地方案。不要一开始就陷入环境配置的泥潭。2. 免费数字人制作工具怎么选先看这五个点2.1 在线生成数字人视频的常见判断标准选免费数字人工具不要只看界面好不好看要看五个关键点是否支持自定义形象。有些平台只能选预设数字人有些支持上传照片或视频生成形象。能自定义意味着你的数字人更有记忆点。是否支持输入文案自动生成语音。支持这个功能你做口播视频会省很多事不需要额外合成音频再上传。是否支持音频驱动口型。你上传一段自己的配音数字人根据音频生成口型动作这对做真实感内容很重要。导出格式是否支持透明背景。如果需要把数字人叠加到自己的背景上尽量选支持绿幕或透明视频的工具后期在 OBS 里用色度键处理。是否有免费额度限制以及导出视频是否带水印。水印会影响成片观感如果你的使用场景是测试水印可以接受如果是正式直播建议找无水印方案。实际测试时我会先用一段 30 秒左右的文案跑一遍生成后重点检查三个地方口型是否与语音同步、画面边缘是否有锯齿、文件体积是否过大。如果这三个都没问题再进入 OBS 集成。2.2 本地开源方案适合什么配置如果你不想受在线平台限制也可以考虑本地数字人方案。常见思路是输入一张人像图或一段视频配合音频驱动生成口型同步的视频。这类方案对硬件的敏感度比较高。CPU 环境下可以跑但生成速度会很慢一分钟的视频可能要等很长时间而且分辨率通常不高。如果你有 NVIDIA 显卡显存至少在 6GB 以上就能跑相对完整的流程显存低于 4GB 的话建议把视频分辨率降到 512 或 256先保证流程跑通。请注意本地开源方案没有统一版本依赖环境经常变化。你装的时候如果遇到缺库、版本冲突、模型下载失败不是你电脑的问题而是环境兼容问题。不要硬啃先确认 Python 版本、CUDA 版本、模型文件路径是否对得上。2.3 免费口播配音怎么处理数字人口播视频的音频一般来自三个地方数字人平台自带的 TTS 语音。优点是方便缺点是音色有限部分平台语音偏机械。系统自带 TTS 引擎。比如 Windows 的语音合成完全免费但音色自然度一般。在线 TTS 工具的免费试用额度。生成后下载音频再导入数字人工具或 OBS。我建议把配音和数字人形象分开看待。先用文本转语音工具生成一段干净的口播音频再让数字人根据这段音频做口型驱动可控性最强。如果直接在生成数字人视频时合成语音后期换音频就得重新生成视频素材复用率低。3. OBS画面搭建避免重复素材和画面层级错乱3.1 场景和来源的基本关系OBS 的基本单位是“场景”和“来源”。场景可以理解成一块画布来源是画布上的元素比如图片、视频、窗口、文本、摄像头。数字人直播的画面搭建思路应该是建一个“数字人直播”场景。在这个场景里添加数字人视频来源。在视频上方或下方添加字幕、Logo、背景装饰。OBS 的来源有层级关系列表越靠上显示时越靠前。如果你发现数字人画面被背景图挡住了不是因为视频坏了而是来源顺序不对。把背景图往下放把数字人视频往上拖问题就解决。这里需要注意OBS 的场景是可以切换的。你可以建“直播场景”和“录制场景”两个场景里面放不同的来源组合而不是在一个场景里堆满所有素材。这样直播时只显示直播需要的画面录制口播视频时只显示录制需要的画面避免素材冗余。3.2 画面去重的具体操作画面去重我一般按这个顺序检查在来源列表里看有没有重复添加同一个文件。特别是同一个数字人视频如果不小心拖进去两次画面会叠影而且视频播放不同步会更明显。检查数字人视频是否自带背景。如果视频素材本身是完整背景加数字人那就不要再添加背景图如果视频素材是绿幕或透明背景再单独放背景图。检查字幕是否重复。数字人平台生成视频时如果已经烧录了字幕OBS 里就不要加文本来源反之如果视频没有字幕你可以在 OBS 里加一个文本来源并调整好字体大小和位置。窗口采集时只采集目标窗口。如果采集了整个桌面任务栏、其他窗口都可能入镜如果同时打开了两个同一页面的窗口画面就会重。有一个小技巧在做画面调整时可以暂时把不需要的来源眼睛图标关掉逐个确认每个来源单独显示时是否正常。全部单独正常再全部打开看混合效果。这样做能快速定位是哪一层出了问题。3.3 绿幕抠像和滤镜配置如果你拿到的数字人视频是绿幕背景需要在 OBS 里加“色度键”滤镜把绿色抠掉。操作路径是选中数字人视频来源右键选择“滤镜”点击“添加”选“色度键”默认的绿色抠像参数通常能用。微调时关注两个参数相似度控制抠像的严格程度调太高会把数字人身体边缘也抠掉平滑度控制边缘柔和度调太低边缘会发毛调太高会有半透明残影。滤镜的顺序也很重要。比如你加了裁剪、缩放、色彩校正、色度键这些滤镜是从上到下叠加处理的。色度键建议放在输出前的位置不要在裁剪之前做抠像否则边缘处理可能受影响。另外数字人视频的播放帧率和 OBS 画布分辨率要尽量匹配。你生成的是 1920x1080 的视频OBS 画布也设为 1920x1080就不会出现被拉伸变形的问题。如果视频是竖屏 1080x1920OBS 画布也要改竖屏否则两边会有黑边。4. OBS音频搭建防回声、防双声道、防重复播放4.1 数字人直播的音频链路音频比画面更隐蔽因为画面错了你能看到音频错了往往要等观众反馈才意识到。数字人直播的音频链路大概是这样的数字人视频来源自带音轨这是主要人声。背景音乐通常单独添加一个媒体源或音频源。如果需要真人实时互动麦克风是第三个声音。这三个声音在 OBS 里会混合在一起最终进入直播输出。如果同一个声音出现在多个源里就会出现重复或回声。最常见的坑是你把数字人视频放进了 OBS视频自带人声然后你又添加了一个桌面音频采集而桌面正在播放这个数字人视频的声音。这样一来人声被采集了两次直播里听到的就是“回音叠音”。所以数字人直播的音频管理第一原则每个声音只从一个来源进入 OBS。4.2 音频去重和降噪实操音频去重按下面这个顺序处理选中数字人视频来源在来源列表里确认它自带的音轨是开启的。如果视频没有音轨再单独添加音频文件。检查桌面音频是否开启。如果数字人视频声音是通过系统播放组件输出的桌面音频会把它再采集一遍。这种情况下要么关闭桌面音频要么把数字人视频来源静音二选一。检查麦克风。真人互动时麦克风会采集到扬声器播放的声音如果直播用的是外放音箱很容易形成回声。建议用耳机监听避免音箱声音进入麦克风。不要把同一个音频文件添加到多个来源。比如背景音乐只放一次不要既放在媒体源里又放在音频源里。降噪部分OBS 自带滤镜就够用。选中麦克风来源添加“噪声抑制”滤镜算法选 RNNoise强度默认就可以。如果环境噪音大再加一个“噪声门”滤镜设置一个阈值低于阈值的声音直接关掉。要注意噪声门阈值调太高说话声音会断断续续调太低噪音又会混进来。4.3 高级音频属性与监听设置音频去重还有一个隐蔽环节监听设置。点击 OBS 左下角“设置”进入“音频”板块里面有“桌面音频设备”“麦克风辅助音频设备”。这里要明确哪些设备是“输出到直播”哪些是“仅监听”。在“混音器”面板里每个音源右边有个小齿轮图标点进去能找到“高级音频属性”。里面有三个关键选项音频轨道默认会勾选轨道1直播和录制都用轨道1这是最保险的。如果你要分开录人声和背景音乐可以把不同源分配到轨道1和轨道2但录制时要指定输出多个轨道。监听方式可选“关闭监听”“仅监听”“监听并输出”。如果选“仅监听”本地能听到声音但直播推流出去不会包含这个声音如果选“监听并输出”本地和直播都能听到。音量数字人视频人声和背景音乐的音量需要单独调不要让背景音乐盖过人声。一般背景音乐音量先压到 0.1 到 0.3再根据实际听感微调。我建议用耳机监听来检查音频问题。开播前放一段数字人视频耳机里听一遍人声是否清晰、是否有重复、是否有背景杂音。这一步能帮你避免大部分音质翻车。5. 免费数字人直播和口播视频的完整落地流程5.1 准备文案和口播音频不管做直播还是录口播视频文案都是第一步。文案写得好数字人只是表现层文案不清晰画面再精致也没用。写文案时要注意数字人直播和真人直播的差异数字人语调相对统一不适合太多即兴发挥。所以文案段落要短每段尽量 100 字以内逻辑直接一句话一个信息点。适合口语表达不要写长定语从句。文案定稿后用 TTS 工具生成口播音频。生成时注意语速一般控制在每秒 3 到 4 个字左右比较自然。语速太快数字人口型容易跟不上语速太慢观众会觉得拖沓。如果你用的是在线数字人工具可以直接把文案粘贴进去生成视频和语音一起出来。如果你想把声音和画面分开控制就先生成音频再上传音频驱动口型。5.2 生成数字人视频素材生成数字人视频素材时我建议一次性把多个版本都生成出来方便后面测试。比如同一段文案可以生成竖屏版本和横屏版本。竖屏用于短视频平台横屏用于直播或长视频。生成时注意背景颜色尽量选纯色或绿幕方便后期处理。视频时长不要过长单个视频控制在 1 到 3 分钟为宜。超过 3 分钟的生成任务免费工具通常容易失败而且后期修改成本高。生成完成后检查导出文件的编码格式。OBS 对 H.264 编码的 MP4 兼容性最好。如果导出的视频是 MOV 或编码特殊播放时可能出现画面黑屏或无法加载建议先用格式工厂或剪映转成 H.264 的 MP4。5.3 导入OBS并完成直播或录制素材准备好后进入 OBS 操作打开 OBS设置画布分辨率。直播横屏用 1920x1080竖屏用 1080x1920。在“来源”里添加“媒体源”选择刚才生成的数字人视频勾选“循环播放”。添加背景图、Logo、字幕等装饰源按需要调整层级。在“混音器”里设置音源音量数字人视频人声尽量保持在 -6dB 到 -3dB 之间。点“预览”看一遍画面用耳机听一遍声音确认无异常。直播推流时把平台提供的推流地址和推流密钥填进“设置-直播”码率建议 6000 到 8000 Kbps。录制口播视频时推荐使用“高级输出”模式设置录制的码率和编码器。我习惯在正式推流前先录一分钟本地视频把数字人视频循环播放两遍再回看录制的文件检查画面、声音是否正常。确认没问题再开始推流或录制完整内容。5.4 批量生成口播视频的稳定做法如果你要做多期数字人口播视频不建议每期都手动重搭 OBS 场景。更稳妥的做法是把 OBS 场景固定好只替换数字人视频媒体源文件。媒体源的视频路径指向固定目录新视频生成后覆盖到同一个文件名或者新建媒体源指向新文件。脚本化生成数字人视频时统一命名规则比如“日期_主题_序号.mp4”。每个批处理任务结束后检查几个关键指标视频文件是否生成、文件大小是否正常、音频轨道是否存在、是否有水印。批量处理最怕的不是慢而是素材之间互相污染。生成失败的任务如果重试逻辑不好可能把旧视频当新视频输出。所以每次批量处理完一定要抽查开头、中间、结尾各一段确认内容是对应文案。6. 常见故障和排查顺序6.1 画面异常排查画面异常最常遇到的是几个现象黑屏、叠影、绿幕没抠干净、视频不动。排查顺序可以固定下来先看媒体源有没有加载。如果视频文件名变了或路径移动了OBS 会提示找不到文件。重新选择文件即可。看视频是否处于播放状态。媒体源如果没勾循环播放视频播完就停在最后一帧虽然画面还在但看起来像“死机”。数字人直播建议勾选循环播放。看层级关系。视频是否被其他来源遮挡是就把视频拖动到更上层。看滤镜。绿幕边缘发绿把色度键的相似度微调高一点画面发虚把视频分辨率调高或关闭过度缩放。如果视频本身播放正常只是画面模糊多半是分辨率问题。OBS 画布分辨率、视频原始分辨率、推流分辨率三者不一致就会出现模糊。统一到 1920x1080 是最省事的方式。6.2 音频异常排查音频问题排查顺序先确认数字人视频源是否勾选了“循环播放”视频停止时音轨也会消失。在混音器里看音量条是否有波动。如果视频播放时音量条没动说明音频没进到 OBS检查媒体源属性里的音轨是否启用。如果有回声先关掉桌面音频或麦克风交替排查是哪个源重复采集。打开“高级音频属性”确认没有把同一个视频同时路由到多个音频轨道并重复输出。麦克风有噪音先加噪声抑制滤镜还有噪音再加噪声门。我个人建议常备三段验证音频一段人声朗读、一段纯音乐、一段数字人合成语音。每次搭新场景时用这三段音频快速过一遍链路能节省大量排错时间。6.3 运行卡顿和资源占用排查数字人视频一般比普通视频更依赖系统资源。如果 OBS 预览卡顿或推流掉帧按顺序排查看数字人视频编码。优先用 H.264不要用高码率的 HEVCOBS 解码压力会小很多。看 OBS 的“视图-统计”面板。如果掉帧明显降低输出分辨率或码率。关掉不必要的来源。能合并成一张图片的就不要用多个来源叠加。看后台是否有多个数字人工具、浏览器、剪映同时运行。视频渲染类软件很吃内存后台拥堵时OBS 会跟着卡。如果用的是本地开源数字人方案做实时驱动同时对 GPU 显存和 CPU 占用要求都很高建议先关掉 OBS 的预览用手机或另一台设备看直播效果。这台机器如果配置不高可以用“先合成视频再进 OBS”的方式而不是让数字人实时渲染。实时驱动看着很炫但免费方案在低配机器上的稳定性通常不如预渲染视频。稳定压倒一切。数字人直播和 AI 数字人视频制作本质上是素材生产、素材管理、推流输出三件事的配合。工具只是入口真正的分水岭在于你有没有把画面源、音频源、场景层级、输出参数管清楚。先把单条口播视频从头到尾跑通再扩展直播和批量生成这是最省成本的路径。真遇到问题也别急着怀疑数字人工具先回看输入格式、音频通道和 OBS 源列表大概率能找到原因。