尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
3秒参考音频就能改词换句:VoiceCraft 零样本语音编辑与TTS
3秒参考音频就能改词换句VoiceCraft 零样本语音编辑与TTS【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 是一个神经声码器语言模型专攻两件事零样本语音编辑和零样本 TTS。给它几秒参考音频加对应文本就能把录音里指定的词改掉或直接用那个人的声音念一句新话。训练数据是播客、有声书、网络视频这类真实场景语音不是录音棚数据。 它到底能帮你做什么功能输入说明零样本语音编辑原音频 原文本 改后文本替换/修改指定词音色和节奏自然衔接零样本 TTS数秒参考音频 目标文本克隆没听过的人的声音长文本 TTS长文本 参考音频Gradio 界面里分段拼接生成训练与微调自己的音频转写提供数据准备和训练脚本一句话概括同一个模型、同一套推理代码既能当音频 PS用也能当声音克隆器用。另外提醒一下README 末尾明确写了不能未经本人同意编辑他人语音商用前先看 LICENSE-CODE 和 LICENSE-MODEL。 最值得看的设计一个模型同时干编辑和 TTS很多方案里改词编辑和念新句TTS是两套流程VoiceCraft 把它们统一成了同一个训练目标token 填充infilling。音频先被 Encodec 编码成 4 个 codebook 的离散 token 序列训练时随机挖掉序列中的几段空位让模型根据上下文把空位补回来。补中间空位就是语音编辑从头生成、只留前几秒参考音频做提示就是 TTS——机制完全一样只是空位挖在哪不同。这套逻辑集中在 models/voicecraft.py 的prepare_mask_intervals和rearrange两个函数里值得逐行读。生成阶段每个 token 怎么采样的看这段就明白了def topk_sampling(logits, top_k10, top_p1.0, temperature1.0): if temperature ! 1.0: logits logits / temperature logits top_k_top_p_filtering(logits, top_ktop_k, top_ptop_p) token torch.multinomial(F.softmax(logits, dim-1), num_samples1) return token来自 models/modules/sampling.py 的核心采样逻辑。有个实用细节项目 2025 年 3 月把推理默认采样从 top-p 改成 top-k40编辑和 TTS 质量都明显提升说明这类模型调参时采样策略比换结构更有用。还有一个容易被忽略的工程点切参考音频不是按时间硬切而是先跑 MFA 强制对齐找到词边界再下刀所以克隆的几秒提示片段干净利落不会在词中间断掉。⚖️ 和同类项目比它强在哪维度VoiceCraft早期 VALL-E 类复现传统 TTS 引擎语音编辑原生支持改词后自然衔接以生成为主编辑需自行拼基本不支持训练数据播客/有声书等真实场景语音多为干净数据集录音棚录制克隆所需参考数秒通常更长时间段需专人录制注册上手方式命令行 / Gradio / Docker论文级复现成熟但多闭源换角度说它的护城河不是参数量而是野生数据 编辑和 TTS 共用一套目标。想体验完整流程可以看 inference_speech_editing.ipynb 和 inference_tts.ipynb 两个示例。 怎么开始用克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft按 README 的 Environment setup 一节建 conda 环境注意 MFA 强制对齐依赖是单独安装的直接跑python tts_demo.py不改参数就用仓库自带演示音频结果存到./generated_tts想要界面就pip install -r gradio_requirements.txt后运行python gradio_app.py浏览器打开 127.0.0.1:7860想训自己的数据照着 README 的 Training 一节准备 manifest再看 z_scripts/e830M.sh 和微调脚本 z_scripts/e830M_ft.sh先跑通tts_demo.py听个默认输出再回去读rearrange和insert_mask两段代码半天就能搞清楚编辑和 TTS 是怎么共用一套训练的。跑完顺手改改-co参数试试不同长度的参考音频是理解这个模型最便宜的方式。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

数据资产管理平台选型:从元数据到数据标准的供应商横评与PoC验证思路

数据资产管理平台选型:从元数据到数据标准的供应商横评与PoC验证思路

简介:面向企业数据资产管理平台选型场景,这份竞品分析报告从数据语言不统一、数据找不到读不懂、数据不可信、数据不可联等痛点出发,梳理出数据标准、元数据、数据质量、数据安全与主数据管理五大需求方向,并对A、B、C、D四家主流…

📅 2026/9/19 21:13:49
N_m3u8DL-RE 速览:3 条命令搞定 DASH/HLS/MSS 流媒体下载

N_m3u8DL-RE 速览:3 条命令搞定 DASH/HLS/MSS 流媒体下载

N_m3u8DL-RE 速览:3 条命令搞定 DASH/HLS/MSS 流媒体下载 【免费下载链接】N_m3u8DL-RE Cross-Platform, modern and powerful stream downloader for MPD/M3U8/ISM. English/简体中文/繁體中文. 项目地址: https://gitcode.com/GitHub_Trending/nm3/N_m3u8DL-RE…

📅 2026/9/19 21:13:49
QMK 固件中的 Boardsource 5x12 正交线性键盘:配置解析与固件构建指南

QMK 固件中的 Boardsource 5x12 正交线性键盘:配置解析与固件构建指南

QMK 固件中的 Boardsource 5x12 正交线性键盘:配置解析与固件构建指南 【免费下载链接】qmk_firmware Open-source keyboard firmware for Atmel AVR and Arm USB families 项目地址: https://gitcode.com/GitHub_Trending/qm/qmk_firmware 导读 Boardsourc…

📅 2026/9/19 21:08:49
MORE NEWS

更多资讯

📰

Julia 排序与排序相关函数完全指南:sort / sortperm / searchsorted 与 Ordering 机制深入解析

Julia 排序与排序相关函数完全指南:sort / sortperm / searchsorted 与 Ordering 机制深入解析 【免费下载链接】julia The Julia Programming Language 项目地址: https://gitcode.com/gh_mirrors/ju/julia 本文以 Julia 官方文档 doc/src/base/sort.md 为核…

📰

Arthas memory 命令详解:查看 JVM 堆、非堆与缓冲区内存信息

Arthas memory 命令详解:查看 JVM 堆、非堆与缓冲区内存信息 【免费下载链接】arthas Alibaba Java Diagnostic Tool Arthas/Alibaba Java诊断利器Arthas 项目地址: https://gitcode.com/gh_mirrors/ar/arthas Arthas 的 memory 命令用于查看目标 JVM 的堆&a…

📰

你的文献综述,可能一直在“假装学术”

官网:www.shujiangce.com | 微信 公众号 :书匠策AI 你有没有发现一个诡异的现象: 你明明读了二十篇文献,每一篇都做了笔记,每一篇的核心观点你都能复述出来。但你写出来的文献综述,读起来就是“不对劲…

📰

text-to-audio:基于 gTTS 的文本转语音实战指南

text-to-audio:基于 gTTS 的文本转语音实战指南 【免费下载链接】Python My Python Examples 项目地址: https://gitcode.com/gh_mirrors/py/Python 导读 text-to-audio 是当前仓库 gh_mirrors/py/Python 下的一个轻量级文本转语音(TTS&#xff…

📰

数据编排技术在大数据分析中的效率与准确性优化

1. 数据编排的本质与大数据分析痛点数据编排(Data Orchestration)本质上是一种将分散的数据处理任务串联成有机工作流的技术体系。我在金融行业的数据中台建设项目中发现,传统大数据分析流程中普遍存在三个典型问题:资源闲置与过载…

📰

多模态不是智能核心:推理架构才是关键

1. 多模态热潮下的冷思考:为什么说它不是智能的核心这两年多模态大模型的热度几乎盖过了所有其他方向。随便打开一个技术社区,满屏都是图文对齐、视频理解、跨模态检索的讨论。各路产品发布会也把“支持多模态输入输出”当作核心卖点反复强调。但我自己在…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬