Hướng dẫn đầy đủ: chuyển PDF sang Markdown
Vì sao có PDF chạy mượt còn có PDF cần OCR – và cách lấy kết quả sạch nhất trong cả hai trường hợp.
PDF số và PDF scan
PDF số – có lớp văn bản
Do phần mềm tạo ra (Word, LaTeX, hộp thoại in của trình duyệt). Ký tự nằm thật trong file nên trích xuất nhanh và gần như không mất mát. Khoảng 97 % tài liệu thường ngày thuộc loại này, và chỉ mất vài giây.
PDF scan – chỉ là ảnh chụp trang
Ra từ máy photocopy, camera điện thoại hoặc máy fax. Không có chữ nào để trích xuất: bôi đen rồi sao chép không được gì. Chỉ OCR đọc nổi, và đó chính là lý do phần lớn công cụ miễn phí lặng lẽ trả về một file rỗng.

Những gì ra tốt
Tài liệu một cột
Báo cáo, tài liệu kỹ thuật, bài báo và hợp đồng ra sạch: tiêu đề giữ đúng cấp, danh sách giữ nguyên các tầng lồng nhau.
Bảng có đường viền
Bảng có kẻ khung được dựng lại thành bảng Markdown hiển thị đúng ở mọi nơi.
Ảnh nhúng trong file
Ảnh bên trong PDF được tách ra và chèn tham chiếu vào văn bản, để không phần nào của tài liệu bị mất.
Bản scan và biểu mẫu
Trang không có lớp văn bản được OCR nhận dạng, kể cả bố cục nhiều ngôn ngữ và biểu mẫu đã điền.
Cách lấy kết quả sạch nhất
- 1.
Để phần nhận diện quyết định trước
Cứ tải file lên nguyên trạng. Công cụ kiểm tra lớp văn bản và chỉ đề nghị OCR khi file thật sự cần, nên bạn không bao giờ trả tiền cho lần OCR thừa.
- 2.
Ép chạy OCR khi kết quả ra chữ loạn
Bản scan cũ đôi khi mang theo một lớp OCR tệ từ nhiều năm trước. Cái đó đánh lừa mọi cơ chế nhận diện, nên trang kết quả luôn giữ nút «chạy OCR» – hãy dùng khi chữ ra méo mó.
- 3.
Đọc lại các trang nhiều cột
Cột bên, chú thích chân trang và bài báo hai cột được đọc theo thứ tự PDF lưu, mà thứ tự đó không phải lúc nào cũng trùng với cách người ta đọc. Hãy lướt qua những chỗ ấy trước khi tin vào chúng.
- 4.
Cắt nhỏ tài liệu quá dài
Giới hạn số trang tồn tại vì thời gian tăng theo độ dài. Sách hay hồ sơ nên chuyển theo từng chương – kết quả cũng dễ soát lại hơn nhiều.



