news 2026/9/7 15:55:11

Ebook2Audiobook 快速指南:3条命令把电子书变成有声书

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ebook2Audiobook 快速指南:3条命令把电子书变成有声书

Ebook2Audiobook 快速指南:3条命令把电子书变成有声书

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

通勤路上不想再干瞪着屏幕?Ebook2Audiobook 把电子书转有声书:本地一键生成带章节的 m4b/mp3 音频,还能用你自己的声音朗读。

能力速览

  • 电子书转有声书,自动分章输出
  • 支持 epub、mobi、azw3、pdf、txt 等格式
  • 🗣️ 覆盖 1158 种语言
  • 语音克隆:1 到 5 分钟录音即可
  • 内置 XTTSv2、Bark、VITS 等 8 种 TTS 引擎
  • 无图 PDF 自动 OCR 识别成文字

3条命令跑通:从克隆到第一段音频

最低配置 2GB 内存、1GB 显存,CPU 也能跑(建议换轻量引擎)。

  1. 克隆仓库:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook
  1. 首次启动 GUI 模式(Linux/Mac 与 Windows 二选一)。脚本会自动装好 Python 环境和依赖,浏览器打开http://localhost:7860/即进入转换界面:
./ebook2audiobook.command # Windows 用:ebook2audiobook.cmd

之后每次运行都是这一步,上传文件、点按钮就能听到第一段音频;嫌麻烦的话也可以跳过界面,看下面「界面走读」。

界面走读:从上传到试听

主界面只有一个 Dashboard 标签页,点几下就能开始转换:

  1. Import 区域上传电子书(epub、mobi 章节识别最准)。
  2. Language 选语言,Voices 试听内置音色,也可以上传一段自己的录音。
  3. 点 📚 开始转换;切到 XTTS Settings 标签页只盯一个参数:Temperature 建议 0.65 左右,太低机械、太高跑偏。

  1. 完成后在 Audiobook 区域在线试听,点 ↧ 下载最终文件。成品默认 m4b,统一放在audiobooks/目录下。

它底层怎么干活:章节怎么切、引擎怎么选

章节怎么切:epub、mobi 这类格式本身就带章节结构,工具直接按结构拆段;txt、pdf 没有结构,就靠文本特征自动切块,纯图片的 PDF 先走 OCR(光学字符识别,把图片里的字认成文字)再切。每块文本逐句送给 TTS 引擎合成音频,中间自动插入停顿,最后拼成一整本书,并写入章节标记和元数据,播放器里能按章跳转。

引擎怎么选:内置 XTTSv2、Bark、VITS、Fairseq、Tacotron2 等 8 种 TTS 引擎(把文字读成语音的模型),界面按语言自动推荐默认引擎。其中 XTTSv2 带零样本语音克隆(给一段录音就能模仿那个音色,不用专门训练),想要更贴近真人就选它;纯 CPU 机器建议换 YourTTS、Tacotron2 这类轻量引擎,速度快很多,只是音色偏" Siri 味"。

想再玩深一点?

如果你有"用自己的声音读整本书"的需求:录一段 1 到 5 分钟的清晰录音上传即可,有背景噪声也没关系,工具会自动降噪。命令行模式下加一个参数:

./ebook2audiobook.command --headless --ebook 书.epub --language eng --voice 你的录音.mp3

如果要音色更贴:仓库里自带 Universal_TTS_Finetune 微调工具,在 Google Colab 或 Kaggle 上跑 kaggle-xtts-finetune-webui-gradio-gui.ipynb 训练自己的 XTTSv2 模型,把模型打成 zip 后用--custom_model指向它即可。批量转一整柜书,把--ebook换成--ebooks_dir指向目录就行。

踩坑速查:

  • GPU 识别不到 → 先nvidia-smi确认驱动,不行就加--device CPU回退
  • 转换中途被打断 → 加--session恢复上次会话,不用从头再来
  • EPUB 转出来混着前言、版权页 → epub 没有标准章节结构,转换前先手动删掉不想要的文字

它替你省掉的是"找真人朗读或自己啃"的那部分。现在就去终端跑第一条命令,装完打开浏览器,第一个章节马上出声。

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 15:53:36

FanControl 风扇曲线设置:不碰 BIOS 也能静音

FanControl 风扇曲线设置:不碰 BIOS 也能静音 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitcode.com/GitHub_Trending/fa/FanCont…

作者头像 李华
网站建设 2026/9/7 15:53:22

Trae AI编程实战:从踩坑到玩转,提升开发效率

1. 一次失败的“Hello World”,成了我和Trae的起点去年这个时候,我刷到一个视频,博主对着一个对话框说了一句话,然后屏幕上自动蹦出了一整段网页代码。我当时的第一反应是:这又是剪辑出来的特效吧。因为在此之前&#…

作者头像 李华
网站建设 2026/9/7 15:51:57

AI Slop内容泛滥怎么办?从识别特征到平台治理的完整方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 15:50:47

向量记忆检索调优:余弦相似度、点积与动态相似度截断阈值

向量记忆检索调优:余弦相似度、点积与动态相似度截断阈值在智能体(Agent)系统的长期记忆中枢(Long-Term Memory)与知识召回中,向量检索(Vector Retrieval)是系统调取历史事实、用户画…

作者头像 李华
网站建设 2026/9/7 15:49:07

从旁观者到贡献者:开源项目完整参与指南

刚接触开源的时候,我其实走过不少弯路。那时候总觉得“给开源项目提交代码”是一件门槛特别高的事,得把整个项目的源码啃完、把issue列表翻个底朝天,才有资格动手。直到后来被一个项目的维护者“带”了一程,才发现真相完全不是这样…

作者头像 李华
网站建设 2026/9/7 15:48:51

逻辑回归与SVM中的最优化方法:从损失函数到参数求解

逻辑回归和SVM,这两个名字在机器学习里出现频率实在太高。很多人把它们当黑盒工具,调个库、跑个训练、看个准确率就完事了。但真正有意思的,是它们背后那套数学逻辑:为什么损失函数长这样?为什么SVM讲究“间隔最大化”…

作者头像 李华