目录
先说结论。
如果 PDF 是单栏小说,文字可以正常复制,又不想上传文件,先用 Calibre。它免费、离线,几分钟就能知道结果是否可用。
如果文件有双栏、公式、表格、脚注,或者本身就是扫描件,就不要在参数上花太久。取几页最难的内容,换一种转换路线试一遍,通常更省时间。
问题不在于哪个工具“更高级”。两者做的其实不是同一件事。
Calibre 为什么值得先试
Calibre 首先是一套电子书管理工具。整理书库、修改元数据、同步阅读器,以及在 EPUB、MOBI、AZW3、DOCX 等格式之间转换,都是它的长项。
而且它有三个很实际的优点:
- 免费、开源;
- Windows、macOS 和 Linux 都能用;
- 文件留在本机,适合不能上传云端的资料。
很多 PDF 用 Calibre 就够了。比如排版规整的小说、报告和讲义,转换后只需删掉页眉、页码,再检查一下段落。
PDF 为什么难转
PDF 记录的是“这一页应该怎样画出来”,EPUB 记录的是“这篇文章由哪些标题、段落、图片和注释组成”。前者强调页面,后者强调结构。
因此,转换器必须反过来猜:
- 相邻的两行是不是同一段;
- 左栏读完后该不该接右栏;
- 字号较大的文字是不是标题;
- 页面底部的小字是脚注,还是页脚。
Calibre 的官方转换文档也把 PDF 列为很不理想的输入格式,并列出了多栏、图片型页面、表格、目录和数学排版等限制。这不是 Calibre 做得不好,而是输入文件通常没有留下足够的结构信息。
两种路线的区别
Calibre 读取 PDF 内部的文字、坐标和字体信息,再用规则整理段落和阅读顺序。
PDF2EPUB.ai 则先看页面的视觉结果,再重建标题、正文、表格、公式和图片等结构。它适合原始结构已经丢失,单靠文字坐标不容易还原的页面。
可以把区别简单写成这样:
| 项目 | Calibre | PDF2EPUB.ai |
|---|---|---|
| 运行位置 | 本地 | 云端 |
| 费用 | 免费 | 按当前方案计费,可先试样张 |
| 简单单栏 PDF | 值得先试 | 可以处理,但未必有必要 |
| 扫描 PDF | 依赖已有文字层 | 可直接识别页面 |
| 双栏、表格、公式 | 容易需要人工修复 | 更适合做结构恢复测试 |
| 手工控制 | 设置多,可编辑转换结果 | 自动化程度较高 |
| 隐私 | 文件不离开本机 | 上传前应确认隐私要求 |
这张表不是胜负表。对一份排版简单的 PDF,Calibre 往往就是更合适的答案。
用 Calibre 转一次,应该检查什么
操作本身很简单:
- 把 PDF 加入书库。
- 选中书籍,点击“转换书籍”。
- 将输出格式设为 EPUB。
- 在“PDF 输入”里查看段落展开设置。
- 转换后同时检查目录、正文中段和结尾。
不要只翻第一页。最好专门看下面几个地方:
- 跨页的段落有没有被截断;
- 页眉和页码有没有混进正文;
fi、ff等连字有没有变成乱码;- 图片前后的文字顺序是否正确;
- 章节标题有没有进入目录;
- 在手机或阅读器上调大字号后,段落是否还能正常回流。
两个常见修补办法
第一是调整“行展开因子”。如果每一行都被当成新段落,可以逐步调低;如果不同段落被粘在一起,则反向调整。不要一次改太多,先用短文档看效果。
第二是用“搜索与替换”清理重复页眉、页脚。它适合格式稳定的页码和书名,但正则表达式写错会误删正文,转换前要保留原文件。
如果修补的项目已经扩展到双栏顺序、几十个公式或整本书的标题层级,就该停下来算一笔账:继续改参数,是否比换路线更快?
哪些文件适合 Calibre
下面这些情况,我会先用 Calibre:
- 数字原生 PDF,文字可以正常选择;
- 单栏、连续正文为主;
- 表格、脚注和公式很少;
- 文件不能上传;
- 愿意在转换后做一次人工校对。
还有一种情况也适合:你手上有 DOCX、HTML 或 Markdown 源文件。此时不要从 PDF 开始,直接把结构化源文件交给 Calibre,通常会干净得多。
哪些文件值得换路线
这些信号出现两个以上,就应该先做样张对比:
- 扫描页没有可靠文字层;
- 页面是双栏或多栏;
- 公式、表格、代码块很多;
- 脚注会跨页;
- 页眉、水印和边注反复出现;
- Calibre 输出的阅读顺序明显错乱。
PDF2EPUB.ai 主要处理的就是这类文件。它并不保证每一页都无需校对,模糊扫描、手写批注和罕见符号仍可能出错。它的价值是先把结构恢复出来,减少逐页重排的工作。
一个比较稳妥的工作流
我更推荐把两者放在一起用:
- 先截取三到五页代表内容,必须包括最复杂的一页。
- 用 Calibre 转一次。
- 用 PDF2EPUB.ai 的样张再转一次。
- 比较阅读顺序、标题、公式、表格和错字,而不是只看页面“像不像原稿”。
- 选定路线后再处理全书。
- 最终 EPUB 放进 Calibre 管理,并在目标阅读器上复查。
这样做的好处是,十分钟内就能发现方法选错了。一本几百页的书转换完才发现双栏顺序全乱,代价要大得多。
常见问题
PDF2EPUB.ai 生成的文件能放进 Calibre 吗?
可以。输出是标准 EPUB,可以继续用 Calibre 修改元数据、换封面、编辑内容或同步到设备。
扫描 PDF 能直接用 Calibre 吗?
要看文件有没有可用的 OCR 文字层。只有页面图片时,Calibre 没有正文可整理;即使带文字层,文字也可能与画面不一致。应先做 OCR,或者使用能直接识别页面的路线。
DRM 保护的 PDF 怎么办?
先确认你是否拥有转换权利。本文讨论的是未加密或已获授权的文件,不提供绕过 DRM 的方法。
最后一句
Calibre 不需要被替代。对简单 PDF,它依然是我会先打开的工具。
真正值得避免的,是明明已经看到双栏和公式全乱,仍继续反复调整同一组参数。拿最难的几页先试,结果会替你做决定。