目录
有人问,PDF 转 EPUB 到底该用哪个工具。
我的第一反应通常不是推荐工具,而是先看文件:文字能不能选中?是不是双栏?公式多不多?能不能上传?手上还有没有原始 DOCX?
这些问题比排行榜有用。下面列出 5 条常见路线,重点说清各自适合什么文件、容易坏在哪里。需要一步一步照着操作,可以另看 PDF 转 EPUB 分步教程。
有源文件时,不要从 PDF 开始
如果你仍有生成 PDF 时使用的 DOCX、HTML、Markdown、InDesign 或其他源文件,优先从源文件生成 EPUB。源文件通常保留标题、段落、列表、链接和图片之间的关系,而这些语义结构在 PDF 中可能已经丢失。
PDF 是为固定页面准备的,源文件才保留标题、段落、列表和链接之间的关系。已经有 DOCX 或 HTML,再从 PDF 反推一次,相当于把原有结构先压平,再费力猜回来。
快速选择表
| 你的输入和限制 | 优先尝试 | 原因 | 重点检查 |
|---|---|---|---|
| 仍有原始源文件 | 源文件 → EPUB | 保留最多语义结构 | 标题层级、CSS、图片 |
| 简单文字 PDF,必须离线 | Calibre 直转 | 免费、本地处理 | 段落拼接、页眉、目录 |
| 以文字为主,需要转换前编辑 | PDF → Word/DOCX → EPUB | 中间文件可人工修订 | 表格、脚注、分页 |
| 已在使用 Acrobat | PDF → DOCX/RTF/HTML → EPUB | 可比较多种中间格式 | 阅读顺序、列表、图片 |
| 扫描页,没有可用文字层 | OCR → 可编辑源 → EPUB | 必须先识别文字 | 识别错误、页面顺序 |
| 复杂排版,传统路线失败 | 结构感知转换 → EPUB | 尝试从视觉页面恢复结构 | 表格、公式、图注、隐私 |
表格只能用来排除明显不合适的路线。真正决定前,先取几页最难的内容做一次同源测试。
路线一:Calibre 直接转换
路径: PDF → EPUB
Calibre 免费、开源并在本地运行。对单栏、以连续正文为主的数字原生 PDF,它适合作为第一轮低成本测试。
- 把 PDF 加入 Calibre。
- 选择“转换书籍”,输出格式选 EPUB。
- 检查结构检测和 PDF 输入设置。
- 在桌面阅读器和目标设备上分别打开结果。
Calibre 自己的转换常见问题把 PDF 列为最不理想的输入格式,并明确提醒 PDF 很难转换。遇到双栏、表格、脚注、公式和重复页眉时,应把输出当作待校对草稿。
适合: 文件不能离开本机、版式简单,并且可以人工检查。
路线二:以 Word 作为可编辑中间格式
路径: PDF → DOCX → EPUB
桌面版 Word 可以打开 PDF 并建立可编辑副本。微软的官方说明也提醒,这种方式最适合以文字为主的文件;复杂图形和版式不一定能还原。
- 在 Word 中打开 PDF 的副本。
- 先检查阅读顺序,再调整样式。
- 给标题应用真正的标题样式,而不只是加粗。
- 删除混入正文的页眉、页脚和页码。
- 修复列表、表格、注释和图注。
- 保存为 DOCX,再用 Calibre 等支持 EPUB 的工具转换。
适合: 文档以文字为主,而且逐段编辑的能力比自动化更重要。
路线三:Acrobat 导出中间格式
路径: PDF → DOCX、RTF 或 HTML → EPUB
Acrobat 当前官方文档列出的可复用导出格式包括 Word、RTF、XML 和 HTML,没有把 EPUB 列为直接导出格式,所以这条路线仍然需要第二个转换步骤。
- 先把少量代表页分别导出为 DOCX、RTF 或 HTML。
- 比较阅读顺序、链接、表格、图片和标题信息。
- 选择最干净的中间结果并人工修订。
- 把中间文件转换为 EPUB。
具体格式以 Adobe 当前的导出格式说明为准。软件菜单会变,不必死记旧教程里的位置。
适合: Acrobat 已经是现有工作流的一部分,而且它对目标 PDF 的中间格式导出比 Word 更干净。
路线四:先 OCR,再转换 EPUB
路径: 扫描 PDF → OCR 文字层或可编辑文档 → 校对 → EPUB
如果无法选中有意义的文字,文件可能是纯图片扫描件,也可能存在损坏的文字层。此时必须做 OCR,但 OCR 只解决“识字”,不会自动恢复书籍的标题层级、表格语义和脚注链接。
本地路线可以使用 OCRmyPDF 给扫描 PDF 增加可搜索的 OCR 文字层,再检查文字并进入编辑或转换步骤。完整判断流程见扫描 PDF 转 EPUB 指南。
重点检查识别语言、旋转、倾斜、阅读顺序、断词和形近字符。姓名、数字、公式和引文尤其容易造成实质错误,应该单独抽查。
适合: 输入是扫描页,而且需要本地处理或可独立审校的 OCR 阶段。
路线五:结构感知或多模态转换
路径: PDF → 视觉与结构分析 → EPUB
结构感知系统尝试从页面视觉信息推断标题、栏目、表格、图注、公式和脚注,而不只读取 PDF 的文字流。它可能更适合复杂版式,但不同文件的效果差异很大,结果仍需检查。
PDF2EPUB.ai 是我们的产品,这一点需要说明。与其相信我们给自己的评价,不如拿最复杂的代表页做样张,再和 Calibre 或 Word 的结果并排看。文件含有机密内容时,先确认云端处理是否符合要求。
适合: 传统文字提取丢失结构,并且可以接受云端处理。
用少量代表页完成有效测试
建议样本至少包含:
- 一页普通正文;
- 最复杂的一页表格或双栏内容;
- 一页图片与图注;
- 一页脚注或尾注;
- 如有公式或代码,再各取一页。
让候选路线处理同一份样本,然后逐项比较:
- 文字是否存在、可选中且顺序正确。
- 标题层级能否形成合理导航。
- 表格在窄屏上是否仍能理解。
- 图片是否靠近对应正文,图注是否保留。
- 脚注能否往返跳转。
- 公式是否可读,并尽可能有无障碍替代信息。
- 页眉、页脚和页码是否混入正文。
比较完以后,选关键错误少、修起来快的那条。别被首页截图替自己的文件做决定。
使用前验证 EPUB
EPUB 能打开,不代表结构正确。
- 用 EPUBCheck 检查封装与规范错误。
- 如果要分发,至少在两种阅读系统中打开。
- 测试目录、链接、图片、字体缩放、深色模式和窄屏显示。
- 分别搜索书籍开头、中间和结尾的一段原文。
- 保留原始 PDF 和可编辑中间文件。
我自己的选择顺序
有源文件,就回到源文件;简单文字 PDF,先开 Calibre;需要边转边改,用 Word 或 Acrobat 做中间稿;纯扫描先解决 OCR;双栏、公式和表格已经把传统路线弄乱,再试结构感知转换。
这套顺序没有什么神秘之处,只是把便宜、可控的办法放在前面,把更复杂的办法留给真正难处理的文件。
如果要试我们的路线,可以用 PDF2EPUB.ai 转几页代表内容。样张最有用的地方,是尽早告诉你这条路走不走得通。