Полное руководство: как перевести PDF в Markdown
Почему одни PDF проходят безупречно, а другим нужен OCR — и как получить чистый результат в обоих случаях.
Цифровые PDF и отсканированные PDF
Цифровой PDF — с текстовым слоем
Создан программой (Word, LaTeX, окно печати браузера). Символы действительно лежат внутри файла, поэтому извлечение быстрое и почти без потерь. Так устроено около 97 % повседневных документов, и уходит на это несколько секунд.
Отсканированный PDF — просто снимки страниц
Получен с копира, камеры телефона или факса. Извлекать нечего: выделение и копирование не дают ничего. Прочитать их способен только OCR — именно поэтому большинство бесплатных конвертеров молча отдают пустой файл.

Что выходит хорошо
Одноколоночные документы
Отчёты, документация, статьи и договоры проходят чисто: заголовки сохраняют уровень, списки — вложенность.
Таблицы с рамками
Таблицы с видимой разлиновкой пересобираются в таблицы Markdown, которые везде отображаются правильно.
Встроенные изображения
Картинки внутри PDF извлекаются и вставляются ссылками в текст, чтобы из документа ничего не пропало.
Сканы и бланки
Страницы без текстового слоя распознаются через OCR, включая многоязычную вёрстку и заполненные бланки.
Как получить самый чистый результат
- 1.
Сначала пусть решит распознавание
Загружайте файл как есть. Инструмент проверяет наличие текстового слоя и предлагает OCR только тогда, когда он действительно нужен, — вы никогда не платите за лишнее распознавание.
- 2.
Включите OCR принудительно, если вышла белиберда
Старые сканы иногда тащат за собой плохой слой OCR многолетней давности. На это попадается любое распознавание, поэтому на странице результата остаётся кнопка «запустить OCR» — она и нужна, когда текст приходит покорёженным.
- 3.
Перечитайте многоколоночные страницы
Боковые врезки, сноски и научные статьи в две колонки читаются в том порядке, в каком их хранит PDF, а он не всегда совпадает с порядком чтения. Пробегите эти места глазами, прежде чем на них опираться.
- 4.
Разбивайте очень длинные документы
Ограничения по страницам существуют потому, что время растёт вместе с объёмом. Книги и дела удобнее переводить по главам — и вычитывать результат тоже проще.



