Kostenlos – OCR inklusive

PDF in Markdown umwandeln – kostenlos, auch gescannte Dateien

An gescannten PDFs scheitern die meisten Konverter. Dieser erkennt sie und startet OCR – Berichte, Verträge und Formulare werden zu echtem Markdown, mit Tabellen, Überschriften und Formeln.

PDF hierher ziehen oder zum Auswählen klicken

Bis 10 MB und 30 Seiten · anmelden hebt die Grenze an

Was heißt PDF in Markdown umwandeln?

Beim Umwandeln von PDF in Markdown wird der Text samt Struktur aus dem PDF herausgelöst und als reiner Text geschrieben: Überschriften werden zu Raute-Zeilen, Tabellen zu Pipe-Tabellen, Bilder wandern mit. Der Haken: Ein großer Teil aller PDFs sind Scans ganz ohne Textebene – dort liefert das Auslesen nichts, nur OCR hilft weiter. Dieses Tool erkennt, welche Sorte vorliegt. Aus dem Markdown geht es weiter zu Word (.docx), PDF oder HTML.

Drei Wege von PDF zu Markdown

1

Online-Konverter – PDF hochladen, Sekunden später steht das Markdown da. Die beste Wahl, wenn die Struktur erhalten bleiben soll und nichts installiert werden darf – und der einzige praktikable Weg für Scans, die OCR brauchen.

2

Kommandozeile – Bibliotheken wie pymupdf4llm oder marker arbeiten lokal und lassen sich für Stapelverarbeitung skripten. Gut für Entwickler mit vielen Dateien, dafür mit Einrichtung, Feinjustierung und ohne OCR ab Werk.

3

Kopieren und einfügen – Text im PDF-Reader markieren und in den Editor werfen. Für einen Absatz in Ordnung, aber Überschriften, Tabellen und mehrspaltige Layouts zerfallen dabei, und aus Scans kommt gar nichts.

Example Output

So sieht das Ergebnis wirklich aus

Vier Dinge, die dieser Konverter richtig macht und Kopieren-und-Einfügen nie hinbekommt.

Überschriften und Struktur bleiben

Überschriftenebenen, verschachtelte Listen und Absätze entstehen als echtes Markdown neu – das Dokument ist sofort bearbeitbar statt eine einzige Textwüste.

Eine PDF-Projektübersicht, umgewandelt in strukturiertes Markdown mit erhaltenen Überschriftenebenen und Listen

Tabellen werden zu Markdown-Tabellen

Tabellen mit Linien entstehen als Pipe-Tabellen mit ausgerichteten Spalten neu – Berichte, Spezifikationen und Vergleiche bleiben weiterverwendbar statt zu losem Text zu zerfallen.

Eine Umsatztabelle aus einem PDF, umgewandelt in eine ausgerichtete Markdown-Pipe-Tabelle

Gescannte Seiten per OCR gelesen

Fehlt dem PDF die Textebene, liest OCR stattdessen die Seitenbilder – für Scans, abfotografierte Dokumente und Formulare in über 170 Sprachen, Chinesisch, Japanisch und Koreanisch eingeschlossen.

Ein gescannter Papierbericht, per OCR erkannt und in bearbeitbares Markdown umgewandelt

Formeln kommen als LaTeX zurück

OCR über ein Formelblatt laufen lassen, und die Mathematik steht als echtes LaTeX in $$-Blöcken – Brüche, Wurzeln, Integrale und Hochstellungen behalten ihre Struktur, bereit für Obsidian, Notion oder ein Paper. (In digitalen PDFs liegen Formeln als lose Glyphen vor, deshalb führt OCR hier zum besseren Ergebnis.)

Ein PDF-Formelblatt, per OCR in Markdown mit LaTeX-Formeln in Dollarzeichen-Blöcken umgewandelt

Der komplette Leitfaden: PDF in Markdown umwandeln

Warum manche PDFs sauber durchlaufen und andere OCR brauchen – und wie das Ergebnis in beiden Fällen möglichst gut wird.

Digitale PDFs und gescannte PDFs

Digitales PDF – mit Textebene

Von Software erzeugt (Word, LaTeX, der Druckdialog des Browsers). Die Zeichen stecken wirklich in der Datei, das Auslesen geht schnell und nahezu verlustfrei. Das trifft auf rund 97 % der Alltagsdokumente zu und dauert Sekunden.

Gescanntes PDF – nur Bilder von Seiten

Aus Kopierer, Handykamera oder Fax entstanden. Es gibt keinen Text zum Auslesen – Markieren und Kopieren liefert nichts. Nur OCR kommt hier weiter, und genau deshalb geben die meisten kostenlosen Konverter stillschweigend eine leere Datei zurück.

Digitales PDF und gescanntes PDF im direkten Vergleich, mit Hinweis darauf, welches OCR benötigt

Was gut durchläuft

Einspaltige Dokumente

Berichte, Dokumentationen, Fachaufsätze und Verträge laufen sauber durch – Überschriften behalten ihre Ebene, Listen ihre Verschachtelung.

Tabellen mit Linien

Tabellen mit sichtbaren Linien entstehen als Markdown-Pipe-Tabellen neu und werden überall korrekt dargestellt.

Eingebettete Bilder

Bilder im PDF werden herausgelöst und im Text verlinkt, damit nichts aus dem Dokument verloren geht.

Scans und Formulare

Seiten ohne Textebene erkennt OCR – auch mehrsprachige Vorlagen und ausgefüllte Formulare.

So wird das Ergebnis am saubersten

  1. 1.

    Erst die Erkennung entscheiden lassen

    Einfach hochladen. Das Tool prüft auf eine Textebene und bietet OCR nur an, wenn die Datei sie wirklich braucht – bezahlt wird also nie für OCR, die überflüssig war.

  2. 2.

    OCR erzwingen, wenn Kauderwelsch herauskommt

    Alte Scans tragen manchmal eine schlechte OCR-Ebene aus früheren Jahren mit sich. Darauf fällt jede Erkennung herein, deshalb bleibt auf der Ergebnisseite ein Knopf für „stattdessen OCR ausführen“ – der richtige Griff, wenn der Text verstümmelt ankommt.

  3. 3.

    Mehrspaltige Seiten prüfen

    Seitenleisten, Fußnoten und zweispaltige Fachaufsätze werden in der Reihenfolge gelesen, in der das PDF sie speichert – und die entspricht nicht immer der Lesereihenfolge. Diese Stellen vor der Weiterverwendung überfliegen.

  4. 4.

    Sehr lange Dokumente aufteilen

    Die Seitengrenzen gibt es, weil die Dauer mit der Länge wächst. Bücher und Fallakten also kapitelweise umwandeln – das Ergebnis lässt sich obendrein leichter durchsehen.

Key Capabilities

Was dieser PDF-zu-Markdown-Konverter beherrscht

Gebaut für Dokumente, an denen weitergearbeitet wird – nicht nur gelesen.

OCR für gescannte PDFs

Seiten ohne Textebene werden aus den Bildern erkannt – Scans, Fotos und Formulare in über 170 Sprachen, Chinesisch, Japanisch und Koreanisch eingeschlossen.

Struktur bleibt erhalten

Überschriftenebenen, verschachtelte Listen und Zitate kommen als echtes Markdown zurück, nicht als eingeebneter Absatzbrei.

Tabellen als Pipe-Tabellen

Tabellen mit Linien entstehen mit ausgerichteten Spalten neu und werden in jedem Markdown-Editor, Wiki oder Repository korrekt dargestellt.

Formeln und Bilder

Eingebettete Bilder wandern mit dem Dokument mit, und OCR holt mathematische Notation aus gescannten Fachseiten zurück.

Zurück nach Word

Das Markdown mit einem Klick an den Word-Konverter geben und eine .docx herunterladen – das bearbeitbare Dokument, das das PDF verweigert hat.

Nach der Umwandlung gelöscht

Die Datei wird über eine verschlüsselte Verbindung übertragen, ausschließlich für diese Umwandlung genutzt und danach gelöscht. Nichts wird aufbewahrt oder ausgewertet.

Use Cases

Wer PDF zu Markdown nutzt

Fünf Aufgaben, die dieses Tool täglich erledigt – eine davon klingt vermutlich nach Ihrer.

Entwicklerinnen und Entwickler

API-Referenzen, Datenblätter und Herstellerhandbücher aus dem PDF holen und in die Doku-Seite, die README oder das Wiki bringen – Markdown, das direkt in die Versionsverwaltung wandert.

Forschung und Wissenschaft

Fachaufsätze werden zu Markdown-Notizen für Obsidian, Notion oder Zotero. Gescannte alte Jahrgänge laufen durch OCR, und Formeln kommen als LaTeX zurück statt als zerbrochene Zeichen.

Redaktion und Lektorat

Sauberen, bearbeitbaren Text aus Kundenberichten, Briefings und Pressemappen holen, ohne eine Seite abzutippen – und danach im gewohnten Markdown-Editor weiterarbeiten.

Studium

Vorlesungsfolien, Handouts und abfotografierte Mitschriften werden zu Markdown, das sich durchsuchen, zusammenfassen und vor der Prüfung umsortieren lässt. Fotografierte Seiten übernimmt OCR.

KI- und RAG-Pipelines

Sprachmodelle lesen Markdown am besten. Quell-PDFs vorher umwandeln, bevor sie in eine Wissensbasis, einen Feintuning-Datensatz oder einen Prompt gehen – Struktur erhalten, ohne PDF-Rauschen.

Simple Process

PDF in Markdown umwandeln – so geht es

Drei Schritte, und für den Anfang braucht es kein Konto.

01

PDF hochladen

Datei hineinziehen oder auswählen. Größe und Seitenzahl werden vorab geprüft, damit nie auf eine Datei gewartet wird, die ohnehin abgelehnt wird.

02

Digital oder gescannt – wird erkannt

Dokumente mit Textebene laufen sofort durch. Stellt sich die Datei als Scan heraus, wird vor dem Start von OCR nachgefragt – niemals stillschweigend abgerechnet.

03

Markdown kopieren oder herunterladen

Ergebnis durchsehen, dann in die Zwischenablage kopieren oder die .md-Datei herunterladen. Kam ein Scan verstümmelt zurück, schickt ein Knopf ihn durch OCR.

FAQ

Häufige Fragen zu PDF in Markdown

Grenzen, OCR, Qualität und Datenschutz – klar beantwortet.

1

Ist dieser PDF-zu-Markdown-Konverter kostenlos?

Ja. Jede Besucherin und jeder Besucher hat täglich kostenlose Umwandlungen frei, und ein Konto hebt die Grenzen für Dateigröße und Seitenzahl an. OCR für Scans kostet ein Guthaben pro Umwandlung, weil dahinter eine kostenpflichtige Erkennung läuft.

2

Funktioniert das auch mit gescannten PDFs?

Ja – und genau das unterscheidet es von den meisten kostenlosen Konvertern. Das Tool prüft, ob das PDF eine echte Textebene hat; fehlt sie, bietet es OCR an und liest die Zeichen stattdessen aus den Seitenbildern.

3

Wie groß darf die Datei sein, wie viele Seiten sind erlaubt?

Ohne Konto sind PDFs bis 10 MB und 30 Seiten möglich. Angemeldet steigt das auf 30 MB und 150 Seiten und schaltet OCR für gescannte Dateien frei, Abonnenten kommen auf 50 MB und 300 Seiten.

4

Welche Sprachen erkennt die OCR?

Über 170, darunter Chinesisch, Japanisch, Koreanisch, Arabisch und die großen europäischen Sprachen. Gemischtsprachige Seiten laufen in einem Durchgang – eine Sprache muss vorher nicht ausgewählt werden.

5

Bleiben Tabellen erhalten?

Tabellen mit Linien werden zuverlässig zu Markdown-Pipe-Tabellen. Linienlose Tabellen und stark verbundene Zellen sind die Schwachstelle jedes PDF-Parsers – diese Stellen also prüfen, bevor man sich darauf verlässt.

6

Was passiert mit Bildern im PDF?

Eingebettete Bilder werden herausgelöst und im Markdown verlinkt, sie wandern also mit dem Dokument mit. Bei sehr großen, bildlastigen PDFs können die Bilder entfallen, damit die Datei handhabbar bleibt – darauf wird hingewiesen.

7

Werden mathematische Formeln unterstützt?

In gescannten Dokumenten holt OCR Formeln als LaTeX-Notation zurück. In digitalen PDFs liegt der Formelaufbau als platzierte Glyphen statt als Auszeichnung vor, komplexe Formeln kommen deshalb als bloße Zeichen an – auf solchen Seiten liefert OCR oft das bessere Ergebnis.

8

Warum sieht mein Ergebnis durcheinander aus?

Mehrspaltige Layouts, Seitenleisten und Fußnoten werden in der Reihenfolge gelesen, in der das PDF sie speichert, und die deckt sich nicht immer mit der menschlichen Lesereihenfolge. Einspaltige Dokumente liefern deutlich sauberere Ergebnisse. Wirkt der Text selbst verstümmelt, trägt die Datei vermutlich eine schlechte OCR-Ebene – dann auf der Ergebnisseite „stattdessen OCR ausführen“ wählen.

9

Ist mein PDF sicher?

Ja. Die Datei wird über eine verschlüsselte Verbindung übertragen, ausschließlich für die gewünschte Umwandlung genutzt und nach der Verarbeitung aus dem Speicher entfernt. Wir lesen Ihre Dokumente nicht, nutzen sie niemals zum Training von Modellen und verkaufen oder veröffentlichen sie nicht. Wie mit Uploads genau umgegangen wird, steht in unserer Datenschutzerklärung.

10

Kostet das Konvertieren einer PDF Credits?

Angemeldet kostet jede Konvertierung Credits: 1 Credit je 30 Seiten, angefangene Seiten zählen als voller Credit – dieselbe Regel gilt für OCR bei Scans. Abonnenten konvertieren unbegrenzt.

Machen Sie aus dem PDF etwas Bearbeitbares

Gescannt oder digital – erst zu Markdown, dann nach Word, PDF oder HTML.

Sofort loslegen · Täglich kostenlose Umwandlungen · Scans per OCR unterstützt