Miễn phí – kèm OCR

Chuyển PDF sang Markdown miễn phí, cả file scan

Gặp PDF scan, phần lớn công cụ chuyển đổi đều bó tay. Công cụ này nhận ra và chạy OCR: báo cáo, hợp đồng và biểu mẫu ra Markdown thật sự, giữ nguyên bảng, tiêu đề và công thức.

Thả file PDF vào đây, hoặc bấm để chọn

Tối đa 10 MB và 30 trang · đăng nhập để nâng giới hạn

Chuyển PDF sang Markdown là gì?

Chuyển PDF sang Markdown là lấy phần chữ và cấu trúc bị khóa trong file PDF rồi viết lại thành văn bản thuần: tiêu đề thành dòng có dấu thăng, bảng thành bảng gạch đứng, hình ảnh đi kèm theo tài liệu. Chỗ khó nằm ở đây: rất nhiều file PDF thật ra là bản scan không hề có lớp văn bản, trích xuất không ra gì và chỉ OCR mới cứu được. Công cụ này tự nhận biết bạn đang có loại nào. Có Markdown rồi, bạn chuyển tiếp sang Word (.docx), PDF hay HTML.

Ba cách đi từ PDF sang Markdown

1

Công cụ trực tuyến – tải PDF lên, vài giây sau có Markdown. Lựa chọn tốt nhất khi bạn muốn giữ cấu trúc mà không phải cài gì, và là cách khả thi duy nhất cho file scan cần OCR.

2

Dòng lệnh – các thư viện như pymupdf4llm hay marker chạy cục bộ và viết script xử lý hàng loạt được. Hợp với lập trình viên xử lý nhiều file, đổi lại phải cài đặt, tinh chỉnh và không có OCR sẵn.

3

Sao chép rồi dán – bôi đen chữ trong trình đọc PDF rồi dán vào trình soạn thảo. Được với một đoạn, nhưng tiêu đề, bảng và bố cục nhiều cột sẽ vỡ hết, còn trang scan thì chẳng ra chữ nào.

Example Output

Kết quả thực tế trông như thế nào

Bốn thứ công cụ này làm đúng mà sao chép rồi dán không bao giờ làm được.

Tiêu đề và cấu trúc còn nguyên

Cấp tiêu đề, danh sách lồng nhau và ngắt đoạn được dựng lại thành Markdown thật, nên tài liệu sẵn sàng để sửa hoặc đăng chứ không thành một khối chữ liền mạch.

Bản tổng quan dự án dạng PDF được chuyển thành Markdown có cấu trúc, giữ nguyên cấp tiêu đề và danh sách lồng nhau

Bảng thành bảng Markdown

Bảng có đường viền được dựng lại bằng gạch đứng với các cột thẳng hàng: báo cáo, thông số và bảng so sánh vẫn dùng lại được thay vì rã thành chữ rời.

Bảng doanh số trong PDF được chuyển thành bảng Markdown có các cột thẳng hàng

Trang scan được OCR đọc

Khi PDF không có lớp văn bản, OCR sẽ đọc thẳng từ ảnh trang: bản scan, tài liệu chụp lại và biểu mẫu, hơn 170 ngôn ngữ, gồm cả tiếng Trung, tiếng Nhật và tiếng Hàn.

Báo cáo giấy được scan, nhận dạng bằng OCR và chuyển thành Markdown sửa được

Công thức trở lại dạng LaTeX

Cho một trang công thức chạy OCR, phần toán sẽ trở lại đúng LaTeX trong khối $$: phân số, căn, tích phân và số mũ giữ nguyên cấu trúc, sẵn sàng dán vào Obsidian, Notion hay một bài báo. (Trong PDF số, phương trình được lưu thành các glyph rời rạc, nên OCR mới là đường lấy lại chúng cho tử tế.)

Trang công thức PDF được OCR chuyển thành Markdown với các phương trình LaTeX trong khối dấu đô la

Hướng dẫn đầy đủ: chuyển PDF sang Markdown

Vì sao có PDF chạy mượt còn có PDF cần OCR – và cách lấy kết quả sạch nhất trong cả hai trường hợp.

PDF số và PDF scan

PDF số – có lớp văn bản

Do phần mềm tạo ra (Word, LaTeX, hộp thoại in của trình duyệt). Ký tự nằm thật trong file nên trích xuất nhanh và gần như không mất mát. Khoảng 97 % tài liệu thường ngày thuộc loại này, và chỉ mất vài giây.

PDF scan – chỉ là ảnh chụp trang

Ra từ máy photocopy, camera điện thoại hoặc máy fax. Không có chữ nào để trích xuất: bôi đen rồi sao chép không được gì. Chỉ OCR đọc nổi, và đó chính là lý do phần lớn công cụ miễn phí lặng lẽ trả về một file rỗng.

PDF số và PDF scan đặt cạnh nhau, chỉ rõ loại nào cần OCR

Những gì ra tốt

Tài liệu một cột

Báo cáo, tài liệu kỹ thuật, bài báo và hợp đồng ra sạch: tiêu đề giữ đúng cấp, danh sách giữ nguyên các tầng lồng nhau.

Bảng có đường viền

Bảng có kẻ khung được dựng lại thành bảng Markdown hiển thị đúng ở mọi nơi.

Ảnh nhúng trong file

Ảnh bên trong PDF được tách ra và chèn tham chiếu vào văn bản, để không phần nào của tài liệu bị mất.

Bản scan và biểu mẫu

Trang không có lớp văn bản được OCR nhận dạng, kể cả bố cục nhiều ngôn ngữ và biểu mẫu đã điền.

Cách lấy kết quả sạch nhất

  1. 1.

    Để phần nhận diện quyết định trước

    Cứ tải file lên nguyên trạng. Công cụ kiểm tra lớp văn bản và chỉ đề nghị OCR khi file thật sự cần, nên bạn không bao giờ trả tiền cho lần OCR thừa.

  2. 2.

    Ép chạy OCR khi kết quả ra chữ loạn

    Bản scan cũ đôi khi mang theo một lớp OCR tệ từ nhiều năm trước. Cái đó đánh lừa mọi cơ chế nhận diện, nên trang kết quả luôn giữ nút «chạy OCR» – hãy dùng khi chữ ra méo mó.

  3. 3.

    Đọc lại các trang nhiều cột

    Cột bên, chú thích chân trang và bài báo hai cột được đọc theo thứ tự PDF lưu, mà thứ tự đó không phải lúc nào cũng trùng với cách người ta đọc. Hãy lướt qua những chỗ ấy trước khi tin vào chúng.

  4. 4.

    Cắt nhỏ tài liệu quá dài

    Giới hạn số trang tồn tại vì thời gian tăng theo độ dài. Sách hay hồ sơ nên chuyển theo từng chương – kết quả cũng dễ soát lại hơn nhiều.

Key Capabilities

Công cụ chuyển PDF sang Markdown này xử lý được gì

Dành cho tài liệu bạn còn định làm việc tiếp, không chỉ để đọc.

OCR cho PDF scan

Trang không có lớp văn bản được nhận dạng từ ảnh: bản scan, ảnh chụp và biểu mẫu, hơn 170 ngôn ngữ, gồm cả tiếng Trung, tiếng Nhật và tiếng Hàn.

Giữ nguyên cấu trúc

Cấp tiêu đề, danh sách lồng nhau và trích dẫn trở lại đúng dạng Markdown, không phải một mớ đoạn văn bị san phẳng.

Bảng dạng gạch đứng

Bảng có đường viền được dựng lại với cột thẳng hàng và hiển thị đúng trong mọi trình soạn thảo Markdown, wiki hay kho mã.

Công thức và hình ảnh

Ảnh nhúng đi theo tài liệu, còn OCR lấy lại ký hiệu toán học từ những trang kỹ thuật được scan.

Quay lại Word

Gửi Markdown sang công cụ chuyển Word chỉ một cú nhấp rồi tải về .docx – đúng bản tài liệu sửa được mà PDF không cho bạn.

Xóa sau khi chuyển xong

File của bạn được truyền qua kết nối mã hóa, chỉ dùng cho lần chuyển đổi này rồi bị xóa. Không giữ lại và không phân tích gì cả.

Use Cases

Ai dùng PDF sang Markdown

Năm việc công cụ này làm mỗi ngày – chắc có một việc giống của bạn.

Lập trình viên

Rút tài liệu API, bảng thông số và sách hướng dẫn của nhà cung cấp ra khỏi PDF rồi đưa vào trang tài liệu, README hay wiki – Markdown vào thẳng hệ quản lý phiên bản.

Nghiên cứu

Biến bài báo thành ghi chú Markdown cho Obsidian, Notion hay Zotero. Số cũ dạng scan đi qua OCR, còn phương trình trở lại dạng LaTeX thay vì ký tự vỡ.

Viết và biên tập

Lấy phần chữ sạch, sửa được từ báo cáo khách hàng, bản brief và bộ tài liệu báo chí mà không phải gõ lại trang nào, rồi làm tiếp trong trình soạn thảo Markdown quen thuộc.

Sinh viên

Chuyển slide bài giảng, tài liệu phát tay và ghi chép chụp lại thành Markdown để tìm kiếm, tóm tắt và sắp xếp lại trước kỳ thi. Trang chụp bằng điện thoại đã có OCR lo.

Luồng AI và RAG

Markdown là thứ mô hình ngôn ngữ đọc tốt nhất. Hãy chuyển PDF nguồn trước khi đưa vào cơ sở tri thức, tập tinh chỉnh hay câu lệnh: giữ nguyên cấu trúc, không lẫn nhiễu của PDF.

Simple Process

Cách chuyển PDF sang Markdown

Ba bước, và không cần tài khoản để bắt đầu.

01

Tải PDF lên

Kéo file vào hoặc chọn từ máy. Dung lượng và số trang được kiểm tra trước khi xử lý bất cứ thứ gì, nên bạn không bao giờ phải chờ một file rồi bị từ chối.

02

Bản số hay bản scan – tự nhận ra

Tài liệu có lớp văn bản chuyển ngay lập tức. Nếu hóa ra là bản scan, bạn sẽ được hỏi trước khi OCR chạy – không bao giờ trừ tiền âm thầm.

03

Sao chép hoặc tải Markdown về

Xem lại kết quả rồi sao chép vào bộ nhớ tạm hoặc tải file .md. Nếu bản scan ra chữ loạn, một nút bấm sẽ cho chạy lại bằng OCR.

FAQ

Câu hỏi thường gặp về PDF sang Markdown

Giới hạn, OCR, chất lượng và quyền riêng tư – trả lời thẳng thắn.

1

Công cụ chuyển PDF sang Markdown này có miễn phí không?

Có. Mỗi người truy cập đều có lượt chuyển miễn phí hằng ngày, và tạo tài khoản sẽ nâng giới hạn dung lượng lẫn số trang. OCR cho file scan tốn một tín dụng mỗi lần chuyển, vì phía sau là một bộ máy nhận dạng có phí.

2

Có dùng được với PDF scan không?

Có – và đó chính là điểm tách công cụ này khỏi phần lớn công cụ miễn phí. Nó kiểm tra xem PDF có lớp văn bản thật hay không; nếu không có thì đề nghị OCR để đọc ký tự thẳng từ ảnh trang.

3

Giới hạn dung lượng và số trang là bao nhiêu?

Không có tài khoản, bạn chuyển được PDF tới 10 MB và 30 trang. Đăng nhập sẽ nâng lên 30 MB và 150 trang và mở khóa OCR cho tệp quét, còn người đăng ký lên tới 50 MB và 300 trang.

4

OCR nhận được những ngôn ngữ nào?

Hơn 170, trong đó có tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Ả Rập và các ngôn ngữ châu Âu chính. Trang lẫn nhiều ngôn ngữ được xử lý trong một lượt – bạn không phải chọn ngôn ngữ trước.

5

Bảng có được giữ nguyên không?

Bảng có đường viền chuyển sang bảng Markdown rất ổn định. Bảng không kẻ khung và ô gộp nhiều là điểm yếu của mọi bộ phân tích PDF, nên hãy kiểm lại những chỗ đó trước khi tin dùng.

6

Ảnh trong PDF thì sao?

Ảnh nhúng được tách ra và chèn tham chiếu vào Markdown nên đi theo tài liệu. Với PDF quá nhiều ảnh, ảnh có thể bị lược bớt để file còn dùng được – khi đó bạn sẽ được báo.

7

Có hỗ trợ công thức toán không?

Với tài liệu scan, OCR trả công thức về dạng ký hiệu LaTeX. Trong PDF số, cấu trúc phương trình được lưu thành các glyph đặt sẵn chứ không phải mã đánh dấu, nên công thức phức tạp về chỉ còn ký tự rời – chạy OCR cho những trang đó thường cho kết quả tốt hơn.

8

Vì sao kết quả của tôi bị lộn xộn?

Bố cục nhiều cột, cột bên và chú thích chân trang được đọc theo thứ tự PDF lưu, mà thứ tự đó không phải lúc nào cũng khớp với cách người đọc. Tài liệu một cột cho kết quả sạch hơn hẳn. Nếu chính phần chữ bị méo, nhiều khả năng file mang theo một lớp OCR tệ – hãy bấm «chạy OCR» ở trang kết quả.

9

File PDF của tôi có an toàn không?

Có. File được truyền qua kết nối mã hóa, chỉ phục vụ đúng lần chuyển đổi bạn yêu cầu, và bị gỡ khỏi kho lưu ngay khi xử lý xong. Chúng tôi không đọc tài liệu của bạn, không bao giờ dùng chúng để huấn luyện mô hình, và không bán hay công bố chúng. Chính sách quyền riêng tư nêu rõ cách xử lý file tải lên.

10

Chuyển đổi PDF có tốn tín dụng không?

Sau khi đăng nhập, mỗi lần chuyển đổi đều dùng tín dụng: 1 tín dụng cho mỗi 30 trang, phần trang lẻ được làm tròn thành một tín dụng đầy đủ — OCR cho tệp quét cũng theo quy tắc này. Người đăng ký chuyển đổi không giới hạn.

Biến file PDF đó thành thứ bạn sửa được

Bản scan hay bản số – trước hết sang Markdown, rồi tới Word, PDF hoặc HTML.

Bắt đầu ngay · Lượt chuyển miễn phí mỗi ngày · Hỗ trợ PDF scan bằng OCR