← Alle FAQ-Fragen

OCR & Text

Text aus einem PDF extrahieren (OCR, einfach erklärt)

Die kurze Antwort

Wenn dein PDF digital ist (aus Text erstellt, nicht gescannt), kannst du den Text direkt markieren und kopieren – ganz ohne Tool. Bei einem gescannten Dokument brauchst du OCR (Optische Zeichenerkennung), die das Seitenbild liest und in echten Text verwandelt. Google Drive macht das kostenlos, und unser PDF-zu-Markdown-Konverter übernimmt die Extraktion für digitale Dateien.

Text aus einem digitalen PDF kopieren

Probier zuerst das Einfache: Öffne das PDF und ziehe mit der Maus über den Text. Wenn er sich markieren lässt, bist du fertig – Strg/Cmd+C und überall einfügen. Das funktioniert in Browsern, der Vorschau und jedem PDF-Reader.

Wenn die Markierung ausgegraut ist, hat die Datei einen Kopierschutz (eine Berechtigungssperre – die Art, die du entfernen kannst, wenn du das Passwort kennst). Manche Tools markieren den Text auch einwandfrei, fügen ihn aber mit kaputtem Format ein – der Text ist da, nur das Layout überlebt nicht.

Text aus einem gescannten PDF extrahieren (OCR)

Gescannte Seiten sind Fotos, und Fotos haben keinen Text zum Kopieren. OCR liest sie:

  1. Lade das gescannte PDF in Google Drive hoch (Rechtsklick → Öffnen mit → Google Docs). Drive führt die OCR automatisch aus und zeigt dir den Text.
  2. Oder nutze ein dediziertes OCR-Tool – kostenlose gibt es, und für ein paar Seiten reichen sie locker.
  3. Kopiere den Text heraus. Prüfe ihn – OCR macht Fehler bei Handschrift und komischen Schriften.

Die ehrliche Qualitätsnote: OCR auf sauberem Drucksatz ist fast perfekt. Bei Belegen, Rechnungen mit Stempeln oder Handschrift musst du mit Fehlern rechnen, die du von Hand korrigierst. Es gibt kein Tool, das die Handschrift eines Arztes liest, und jeder, der etwas anderes behauptet, lügt.

Der ehrliche Teil

Drei Dinge überraschen die Leute immer wieder:

  • Tabellen werden zu einem Chaos extrahiert. Textextraktion liest von links nach rechts, also werden die Spalten einer Tabelle zu einem einzigen langen Wust. Wenn du die Tabellenstruktur brauchst, konvertiere nach Excel oder Word, statt rohen Text zu kopieren.
  • Schriften und Formatierung verschwinden. Du bekommst die Wörter, nicht das Design. Für Zitate und Notizen okay, falsch für Dokumente, die bestimmt aussehen müssen.
  • Extrahieren ist nicht Bearbeiten. Wenn du den Text hast, ist das Ändern des PDFs selbst eine separate Aufgabe – siehe wie man ein PDF bearbeitet.

Verwandte Fragen