完整指南:怎么把 PDF 转成 Markdown
为什么有的 PDF 顺顺当当,有的非要 OCR 不可——以及两种情况下怎么拿到最干净的结果。
数字版 PDF 和扫描版 PDF
数字版 PDF —— 有文字层
由软件生成(Word、LaTeX、浏览器的打印对话框)。字符真真切切在文件里,所以提取又快又几乎不丢东西。日常文档里大约 97% 属于这一类,几秒就完事。
扫描版 PDF —— 只是一页页照片
从复印机、手机相机或传真机出来的。没有文字可提,选中复制什么也拿不到。只有 OCR 读得动——这正是多数免费工具悄无声息还你一个空文件的原因。

哪些能转得好
单栏文档
报告、技术文档、论文、合同都转得干净:标题保住层级,列表保住嵌套。
带框线的表格
框线看得见的表格会重建成 Markdown 表格,在哪儿打开都显示正常。
内嵌图片
PDF 里的图会被抽出来并在正文中引用,文档不会缺东西。
扫描件和表单
没有文字层的页面由 OCR 识别,多语言排版和填好的表单同样能处理。
怎样才能转得最干净
- 1.
先让自动判定拿主意
原样传上来就行。工具会先看有没有文字层,只有文件确实需要时才提示 OCR,不会让你为用不上的 OCR 付费。
- 2.
出乱码时手动强制走 OCR
老扫描件有时带着多年前留下的劣质 OCR 文字层。这种情况骗得过任何自动判定,所以结果页一直留着「改用 OCR 重试」按钮——文字出来是乱的,就点它。
- 3.
多栏页面记得复核
侧边栏、脚注、双栏论文是按 PDF 内部存储顺序读的,而那个顺序不一定等于人的阅读顺序。这些地方在采信之前先扫一眼。
- 4.
太长的文档拆开转
页数上限之所以存在,是因为耗时随篇幅增长。书籍或案卷建议按章节转——顺带也更好逐段复核。



