文本转有声书指南用 abogen 把 EPUB、PDF 生成带同步字幕的语音【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen把一篇长文变成「能听又能看」的内容卡在两件事上文字转语音只是第一步字幕要和语音逐句对齐才是难点。手工对时间轴既慢又容易错。abogen 是一个开源的有声书生成工具能直接从 EPUB、PDF、纯文本、Markdown 和字幕文件生成音频并自动输出同步字幕覆盖文本转有声书、字幕语音生成的完整流程。快速上手安装 abogen 并启动界面abogen 通过 pip/uv 发行依赖 espeak-ng。以下命令按系统选择其一官方说明见 README。Linux 安装sudo apt install espeak-ng # 先装语音依赖 uv tool install --python 3.12 abogen # 安装 abogenWindows 上如果你用 NVIDIA 显卡CUDA 12.8 环境uv tool install --python 3.12 abogen[cuda] --extra-index-url https://download.pytorch.org/whl/cu128 --index-strategy unsafe-best-matchWindows 也可以下载仓库里的 WINDOWS_INSTALL.bat 双击运行它会在独立的嵌入式 Python 环境里装好全部依赖无需单独安装 Pythonespeak-ng 需要自行安装其最新的 .msi 包。Mac 用户先brew install espeak-ng再执行仓库 README 中给出的 uv 命令。安装方式与显卡型号对应关系请以官方文档为准。装完后有两条启动路径命令各一行abogen # 启动桌面端PyQt 图形界面 abogen-web # 启动 Web 端浏览器打开 http://localhost:8808桌面端适合单台电脑上的日常转换Web 端功能更新多几个桌面端还没有的能力见后文「进阶用法」。遇到问题时用abogen-cli从命令行启动可以看到详细报错。桌面端跑通一次完整转换从拖入文件到拿到带字幕音频这一节用一次真实转换演示桌面端的主线操作你看到什么界面、点哪里、最后得到什么。打开abogen后主窗口就是一个输入框加一组配置项。把 EPUB、PDF、.TXT、.MD、.SRT、.ASS、.VTT文件直接拖进去也可以在内置文本编辑器里直接粘贴文字然后依次做三件事在 Speed 里调语速范围 0.1x 到 2.0x在 Select Voice 里选发音人第一个字母代表语言a美式英语、b英式英语、e西班牙语、f法语、h印地语、i意大利语、p巴西葡萄牙语、z普通话等第二个字母m/f代表男女声在 Generate subtitles 里选字幕粒度Line、Sentence、Sentence Comma、1 word、2 words、3 words等档位再选音频输出格式WAV、FLAC、MP3、OPUS、带章节的 M4B和字幕格式SRT或多种 ASS 排版最后确认保存位置。点 Start 后左侧日志区滚动输出处理过程界面如下图abogen 桌面端实际转换过程从文本输入到音频与字幕产出官方演示的数据可以参考在低端笔记本 GPURTX 2060 Mobile上约 3000 字符的文本用了 11 秒转成 3 分 28 秒的音频另一段演示里 5 秒生成了约 1 分钟带精确同步字幕的音频。你的硬件不同耗时会有差异。在 Web 界面里创建并管理转换任务Web 端把「转换」变成了「任务」。浏览器打开首页后上半部是统计卡总任务数、已完成、转换中、等待、失败中间是一张上传卡把文件拖进虚线区或点Open upload settings按钮随后在分步向导里确认章节和角色配置任务提交后立即进入队列。图abogen Web 端仪表盘文件上传、任务队列与实时进度同屏显示任务由后台 worker 顺序执行浏览器里的进度条和日志会自动刷新完成后直接下载音频与字幕文件也可以随时取消、删除或下载日志排查问题。页面顶部有Browse Calibre library入口可以直接从 Calibre 书库挑书不用手动下载文件。它能帮你做什么字幕、批量队列和混合语音字幕粒度可按内容类型选。做教学视频、课程口播时选Sentence Comma或按单词档位字幕切换更细做整段朗读选Sentence即可。注意一个限制按单词切分的档位只对英语可用Kokoro 的单词级时间戳只支持英文其他语言会回退到句级或逗号级字幕。批量转换靠队列而不是重复操作。桌面端有独立的 Queue Manager.txt和字幕文件可以直接点Add files加入队列EPUB、PDF、Markdown 文件则从主窗口输入框点Add to Queue加入。图abogen 队列管理界面多个文件按顺序排队转换悬停可查看各文件当时的配置队列里每个文件保存的是加入那一刻的设置之后你在主窗口改配置不会影响已入队的文件如果就是想统一改可以勾选Override item settings with current selection让所有队列项强制使用当前配置。语音混合器用来调出固定的「个人声线」。在 Voice Mixer 里给多个发音人模型配权重合成试听后存成一个 profile之后选语音时直接选这个 profile不用再手动调。图abogen 语音混合器可调整各语音模型权重并保存为可复用的 profile章节控制让长文档可拆可并。处理 EPUB、PDF、Markdown 时你可以只选部分章节转换勾选「Save each chapter separately」把每章存成独立音频再勾「Create a merged version」额外生成合并版。M4B 输出还会自动带上标题、作者、封面等元数据封面从 EPUB/PDF 自动提取放进支持元数据的有声书播放器里信息就是完整的。进阶用法GPU 加速、章节标记、LLM 文本整理与 AudiobookshelfGPU 加速看你的卡。NVIDIA 显卡选对应 CUDA 的安装方式即可12.6/12.8/13.0 按驱动选AMD 显卡只支持 Linux ROCm。没有 GPU 也能跑只是速度降到 CPU 水平。启动后如果日志提示 CUDA 不可用按 README 的排错小节重装对应版本的 PyTorch 即可。章节标记可以让重做只花一次成本。EPUB/PDF/Markdown 转换后会自动写入形如CHAPTER_MARKER:Chapter Title的标记纯文本里你也可以手动加。有了标记某一章出错时只需重转那一章。类似地文本开头支持METADATA_TITLE:...等元数据标签用于生成带完整信息的 M4B。另外带HH:MM:SS时间戳的文本文件会被自动识别可直接按你给定的时间点朗读适合做需要精确控制节奏的解说稿。以上标记写法见 README 的 Core Features 小节。Web 端独有能力值得单独看一眼。LLM 文本整理在Settings → LLM里填一个 OpenAI 兼容端点比如本地 Ollama让模型在生成前处理引号、缩写这类棘手文本Audiobookshelf 集成在Settings → Integrations里填好地址、库 ID、文件夹和 API token转完的有声书可以直接推送到你的 Audiobookshelf 库。这两个能力目前只在abogen-web可用官方说明会逐步合并进桌面端以官方文档为准。部署给团队可以用 Docker。仓库自带 Dockerfile 和 docker-compose.yamldocker compose up -d --build即可在带 GPU 的主机上跑 Web 端上传文件落在/data/uploads成品音频和字幕输出到/data/outputs。如果你是为课程、播客或短视频持续做「能听能看」内容的人现在就可以按上面两条路径装一次把手头一份 PDF 丢进去跑完第一次转换——从上传到下载成品音频和字幕通常只需要几分钟。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
STM32驱动GP2Y1010AU0F红外PM2.5传感器实战 1. 项目缘起与整体设计思路红外PM2.5传感器在空气质量监测类项目里属于性价比极高的一类器件,尤其是GP2Y1010AU0F这款夏普经典型号,几十块钱就能拿到,配合STM32最小系统板就能搭出一套能用的颗粒物浓度检测装置。我最早接触这个组合是在做一个… · 2026/9/26 10:03:35
plannotator 下拉菜单组件迁移实录:从 Radix 到 Base UI 的 DropdownMenu 改造指南 【免费下载链接】plannotator Annotate and review coding agent plans and code diffs visually, share with your team, send feedback to agents with one click. 项目地址: https://gitcode.com/gh_mirrors/pl/plannotator 点击查看 免费下载 本篇技术指南以 p… · 2026/9/26 10:03:35
CAD 装配图读图:第一角与第三角投影的区分方法与核查步骤 这篇写给需要在 CAD 里读外文装配图的人:出口设备、海外项目的图纸,视图摆法和国内习惯不一致时,怎么快速判断这张图按哪套投影制式画的,以及翻成中文之后该核哪几处。一、两种制式的差别只有一个要点投影就是把三维零件往平面上投… · 2026/9/26 10:03:29
STM32F103C8T6型号后缀与最小系统设计深度解析 1. 为什么一块“蓝板子”能卖到五块钱,而另一块却要二十块?——从型号后缀看懂STM32F103C8T6的底层差异你拆开过手头那块最便宜的STM32F103C8T6最小系统板吗?不是看它焊得漂不漂亮,而是翻过来看背面——有没有那个小小的、印着“S… · 2026/9/26 10:42:57
AT_arc114_e [ARC114E] Paper Cutting 2 可以先完成:AT_agc049_a Erasing Vertices
一个 trick E(X)∑i1nxipiE(X)\sum_{i1}^n x_i p_i E(X)i1∑nxipi 上面是期望的定义式。对于这种题目,每次切纸对答案步数的贡献都固定为 111,所以上面的式子可以变成: E(X)∑i1n… · 2026/9/26 10:42:57
Gaia2 与 ARE 智能体评测:用 TaoToken 统一 Key 跑通社区基准测试 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 10:42:51
大语言模型(LLM)分类详解:从架构到应用场景的完整梳理 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 10:42:51
知识库与工具链整合:用 TaoToken 统一 Key 打通 AI 测试知识底座 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 10:42:51
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46