← Alle Artikel

Guides

Warum gescannte PDFs die schlimmsten Verursacher sind (und wie man sie richtig per OCR aufbereitet)

July 20, 2026 · 4 Min. Lesezeit · Das EasyAccessPDF-Team

Ein gescanntes PDF ist eines der verbreitetsten Dokumentenformate in Behörden, Gerichten und Archiven. Es sieht wie eine Seite aus, druckt sich wie eine Seite und trägt oft eine offizielle Unterschrift. Doch bei der Barrierefreiheit ist es in der Regel der schlimmste Verursacher. Bildschirmleseprogramme können es nicht lesen, Suchmaschinen können es nicht indexieren, und Nutzer können den Text weder markieren noch vergrößern. Ein gescanntes PDF ist im Grunde ein Foto in einem PDF-Behälter, und das ist die Quelle fast jedes Problems.

nn

Warum gescannte PDFs bei der Barrierefreiheit scheitern

nn

Das Problem ist einfach: Ein Scanner erfasst Pixel, keine Zeichen. Das entstandene Bild mag den Buchstaben A zeigen, die Datei enthält aber keine Information, dass der Buchstabe ein A ist. Ein Bildschirmleseprogramm stößt auf einen Block aus Stille. Eine Suchmaschine stößt auf ein Bild ohne durchsuchbaren Text. Ein mobiler Nutzer kann den Text nicht umfließen lassen, weil die Zeilen feste Bilder und kein echter Text sind.

nn

Schlechte Scans verschlimmern die Sache. Niedrige Auflösung, verzogene Seiten, Flecken und verblasste Tinte verringern die Genauigkeit selbst dann, wenn später eine optische Zeichenerkennung angewendet wird. Mehrspaltige Layouts, Fußnoten, Tabellen und Formulare verwirren einfache OCR-Werkzeuge, weil die Lesereihenfolge aus dem Bild allein nicht ersichtlich ist.

nn

Was OCR tatsächlich leistet

nn

Die optische Zeichenerkennung, kurz OCR, wandelt sichtbaren Text in einem Bild in echte, markierbare Zeichen um. Moderne OCR-Engines nutzen Mustererkennung und maschinelles Lernen, um Buchstaben, Zahlen und Symbole zu erkennen. Sie können auch Absätze, Tabellen und Lesereihenfolgen erkennen.

nn

OCR ist jedoch keine Magie. Sie kann keine Struktur hinzufügen, die nie vorhanden war. Sie versteht keine Überschriften, Listen oder semantische Bedeutung, es sei denn, das Werkzeug ordnet sie explizit zu. Handschriften, geschwungene Schriften und beschädigtes Papier bereiten ihr ebenfalls Schwierigkeiten. Gute OCR ist der erste Schritt zu einem barrierefreien Dokument, aber eben nur ein Schritt.

nn

Wie man richtig OCR durchführt

nn

Gutes OCR bedeutet, vor dem Klick auf die Schaltfläche die richtigen Einstellungen zu wählen. Beginnen Sie mit diesen vier Bereichen.

nn

Die richtige Sprache wählen

nn

OCR-Engines laden Sprachmodelle, um Zeichenformen zu erkennen. Wenn Sie ein englisches Dokument mit einem deutschen Modell verarbeiten, wird jedes th zu einem unleserlichen Paar. Legen Sie immer die Dokumentensprache fest, und wählen Sie für mehrsprachige Dateien ein Werkzeug, das die Erkennung gemischter Sprachen unterstützt.

nn

Das richtige Ausgabeformat wählen

nn

PDF/A ist das sicherste Langzeitformat, weil es Schriftarten und Text einbettet und für die Archivierung konzipiert ist. Wenn Barrierefreiheit wichtig ist, exportieren Sie nach Möglichkeit als getaggtes PDF. Die Tags transportieren Überschriftenebenen, Listen und Tabellenstrukturen an Hilfsmittel. Vermeiden Sie reine bildbasierte Ausgaben.

nn

Die Textebene erhalten

nn

Das beste OCR-Ergebnis ist ein durchsuchbares PDF, das den Originalscan sichtbar lässt und gleichzeitig eine unsichtbare Textebene darüber legt. Das bewahrt das visuelle Erscheinungsbild für Druck und Unterschriften und gibt Bildschirmleseprogrammen sowie Suchmaschinen etwas, womit sie arbeiten können.

nn

Vor dem OCR bereinigen

nn

Drehen Sie schiefe Seiten, entfernen Sie schwarze Ränder, und erhöhen Sie den Kontrast, wenn das Original blass ist. Einige Werkzeuge können automatisch entzerren und entrauschen. Ein sauberer Scan hebt die Genauigkeit von akzeptabel auf hervorragend.

nn

Schritte zur Nachbearbeitung nach dem OCR

nn

Selbst der beste OCR-Lauf braucht noch eine Prüfung. Öffnen Sie das entstandene Dokument, und kontrollieren Sie die Lesereihenfolge. Stellen Sie sicher, dass Überschriften als Überschriften getaggt sind und Tabellen korrekte Kopfzeilen haben. Achten Sie auf typische Fehler: die Zahl 0, falsch gelesen als Buchstabe O, oder rn, gelesen als m.

nn

Wenn Sie in einem Barrierefreiheits-Workflow arbeiten, führen Sie eine automatische Prüfung wie PAC für PDF oder die Acrobat-Barrierefreiheitsprüfung durch. Testen Sie dann mit einem echten Bildschirmleseprogramm, um zu hören, was die Nutzer hören werden. Beheben Sie verbleibende Probleme im Ausgangsdokument oder in den PDF-Tags.

nn

Wenn ein gescanntes Dokument zu stark beschädigt oder zu komplex ist, ist es manchmal schneller und sauberer, es aus der Originalquelle neu zu erstellen, als ein schlechtes OCR-Ergebnis zu reparieren.

nn

Gescannte PDFs müssen nicht unzugänglich bleiben. Mit der richtigen OCR-Vorgehensweise und einer kurzen Nachbearbeitung verwandeln Sie ein stummes Bild in ein Dokument, das jeder lesen, durchsuchen und nutzen kann.

nn

Brauchen Sie Hilfe bei der Barrierefreiheit Ihrer Dokumentensammlung? EasyAccessPDF konvertiert und bereinigt gescannte PDFs, damit Sie Compliance-Standards erreichen, ohne manuelle Mühe.