
电子书转有声书保姆级教程ebook2audiobook 如何三步跑通支持语音克隆与 1158 种语言【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobookebook2audiobook 是一款开源的电子书转有声书工具把 EPUB、MOBI 或 PDF 丢进它的 Web 界面就能得到带章节标记的 M4B 有声书。它支持语音克隆、OCR 识别扫描版、1158 种语言最低 2GB 内存、1GB 显存就能跑。本文带你三步跑通完整流程。 拆解核心能力24 种输入格式与 8 种 TTS 引擎先说结论它做的事就是把文字变成带章节的音频中间环节全部替你处理。输入侧支持 EPUB、PDF、MOBI、AZW3、FB2、TXT、DOCX、HTML、RTF、ODT 等 24 种格式完整清单在 lib/conf.py 的ebook_formats里。EPUB 和 MOBI 能自动识别章节结构效果最好。扫描版 PDF、JPG、PNG、TIFF、BMP 也能处理——内置 OCR 会把图片里的文字认出来再合成输出侧有 m4b、mp3、flac、wav、ogg 等 10 种音频格式默认 m4b 单声道——这是有声书专用格式自带章节标记。合成引擎共 8 种XTTSv2、Bark、VITS、YourTTS、Tacotron2、Fairseq、Tortoise、GlowTTS界面会按语言自动推荐。还有三件事值得记住上传音频即可语音克隆仓库里也自带一组内置音色支持 SML 标签用[pause:3]这类标记精确控制停顿和换声可以批量转换整个文件夹还能先机器翻译再合成 三步跑通从克隆仓库到第一本有声书第 1 步准备环境。硬件门槛不高最低 2GB 内存、1GB 显存推荐 8GB 内存、4GB 显存。CPU、NVIDIACUDA、AMDROCm、苹果 MPS、Intel XPU、Jetson 都能跑。Python 不用你操心脚本会自动装好 3.10–3.12 的运行环境。git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook第 2 步启动 Web 界面。./ebook2audiobook.commandWindows 用户直接双击ebook2audiobook.cmd。首次运行会自动安装依赖耐心等几分钟启动成功后浏览器打开http://localhost:7860/。第 3 步上传并转换。在 Input Options 页签里操作左侧上传电子书epub、mobi、pdf、txt 等右侧可选地上传一段录音做语音克隆不传就用内置音色Processor Unit 选 CPU 或 GPU下方选语言默认 English也可以传一个自定义模型 zip需包含 config.json、model.pth 等文件点底部的 Convert转完的有声书可以直接在页面里试听和下载两个坑提前说停掉脚本再启动时网页要手动刷新才能重连GPU 没被识别就先检查驱动实在不行退回 CPU 也能用。️ 调节合成参数温度、语速与文本分割切到 Audio Generation Preferences 页签可调的旋钮都在这里Temperature0.1–10默认 0.65。调高更有创造性但容易失控叙事类建议留在默认值附近Repetition Penalty1–10默认 2.5防止语句重复Top-k / Top-p调低输出更稳定生成速度也更快Speed0.5x–3x 调节语速Enable Text Splitting把长文本切句分块合成长书建议打开代价是效率一般短文本不必开输出格式默认 m4b带章节想换 mp3、flac 在设置里选单声道/立体声也可切换。如果合成的音频被截断多半是分句逻辑没适配你那种语言——建议直接提 issue团队需要不同语言用户的反馈来修。️ 克隆你的声音上传音频与 SML 标签想用自己的声音上传一段录音就行。wav、mp3、m4a、ogg 等 17 种音频格式都收时长以 1–5 分钟为宜。录音带背景噪声、甚至夹着音乐也没关系它会先做降噪再克隆。想要更细的控制可以在文本里插 SML 标签[break]0.3–0.6 秒短停顿[pause]1.0–1.6 秒长停顿[pause:3]固定 3 秒停顿[voice:音频路径]...[/voice]段落内临时切换声音想更进一步可以用仓库里的微调工具训练自己的 XTTSv2 模型Notebooks/finetune/xtts/ 下有现成的 WebUI 笔记本训完打包成 zip 传到界面即可其中的 ref.wav 会成为该模型的固定音色。⚡ 批量转换headless 命令行模式不想点界面headless 模式一条命令直接出书。单本转换./ebook2audiobook.command --headless \ --ebook ./ebooks/tests/test_eng.txt --language eng整个文件夹一起转把--ebook换成--ebooks_dir./ebook2audiobook.command --headless \ --ebooks_dir ./my_books --language eng --tts_engine XTTS常用组合--voice 路径指定克隆声音--output_format mp3换输出格式--translate fra先机器翻译再合成用 ISO 639-3 语言代码--session记录会话中断后可接着转。注意--ebook和--ebooks_dir二选一全部参数加--help可查。 评估适用场景四类用户与三条边界通勤党技术文档、网文转成 m4b 丢进播放器章节跳转是现成的视障用户EPUB、MOBI 的章节结构自动保留不用手工切分播客与视频创作者SML 标签 语音克隆能做出带停顿节奏的旁白语言学习者1158 种语言里挑目标语言再配--translate先译后听三条边界提前知道只用于无 DRM 的合法电子书DRM 内容别碰EPUB 没有统一的章节标准前言、版权页这类不想要的文字要先手动删掉纯 CPU 跑大引擎很慢建议选 YourTTS、Tacotron2 这类轻量引擎GPU 下才能接近实时。 现在动手转换你的第一本书git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook敲完启动脚本把仓库自带的ebooks/tests/test_eng.txt拖进界面点 Convert——听完整本书之前先换上你自己的书和声音。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考