← すべての記事

Guides

なぜスキャンPDFは最悪の障害ファイルなのか(そして正しくOCRする方法)

July 20, 2026 · 2 分で読める · EasyAccessPDF チーム

スキャンPDFは、事務所、法廷、公文書館で最も一般的な文書形式の一つです。見た目も印刷も一枚の紙のようで、正式な署名が押してあることもあります。しかし、アクセシビリティの観点から見ると、これほど悪影響を与える形式はありません。スクリーンリーダーは読み上げられず、検索エンジンは索引に登録できず、ユーザーはテキストを選択したり拡大したりできません。スキャンPDFは、PDFという容器に入った写真とほぼ同じものであり、そこにほとんどの問題の原因があります。

nn

スキャンPDFがアクセシビリティを損なう理由

nn

問題は単純です。スキャナーが取得するのはピクセルであって文字ではありません。出来上がった画像には文字Aが写っていても、ファイル内に「これはAという文字である」という情報は含まれていません。スクリーンリーダーは無音の塊に遭遇し、検索エンジンはクロールできるテキストのない画像に遭遇します。モバイルユーザーは文字をリフローできません。なぜなら、行は画像として固定されており、実際のテキストではないからです。

nn

品質の低いスキャンは事態を悪化させます。低解像度、傾いたページ、しみ、褪せたインクは、後からOCRをかけても精度を下げます。複数段組のレイアウト、脚注、表、フォームは、画像だけからでは読み順が不明瞭なため、単純なOCRツールを混乱させます。

nn

OCRが実際に行うこと

nn

OCR(光学的文字認識)は、画像内の見える文字を、選択可能な実際の文字に変換します。最新のOCRエンジンは、パターンマッチングと機械学習を使って文字、数字、記号を認識します。段落、表、読み順の検出も可能です。

nn

ただし、OCRは魔法ではありません。そもそも存在しなかった構造を追加することはできません。ツールが明示的にマッピングしない限り、見出しやリスト、意味的な構造を理解することはできません。手書き文字、装飾的なフォント、破損した紙も苦手です。良いOCRはアクセシブルな文書への第一歩ですが、あくまで一つのステップに過ぎません。

nn

正しくOCRを行うには

nn

OCRを正しく行うには、変換ボタンを押す前に適切な設定を選びます。以下の4点から始めましょう。

nn

言語設定を選ぶ

nn

OCRエンジンは、文字の形を認識するために言語モデルを読み込みます。英語の文書をドイツ語モデルで処理すると、thの組み合わせが文字化けしてしまいます。必ず文書の言語を設定し、多言語ファイルの場合は混合言語認識に対応したツールを選びましょう。

nn

出力形式を選ぶ

nn

PDF/Aは長期保存に最も安全な形式です。フォントとテキストを埋め込み、アーカイブ用に設計されているからです。アクセシビリティが重要な場合は、OCRソフトウェアが対応していればタグ付きPDFを出力しましょう。タグには見出しレベル、リスト、表の構造が含まれ、支援技術に伝わります。画像だけの出力は避けましょう。

nn

テキストレイヤーを保持する

nn

最良のOCR結果は、元のスキャン画像を表示したまま、目に見えないテキストレイヤーを重ねた検索可能なPDFです。これにより印刷や署名のための見た目は保ちつつ、スクリーンリーダーや検索エンジンが扱えるテキストを提供できます。

nn

OCR前に前処理する

nn

傾いたページを回転させ、黒い余白を取り除き、原本が薄ければコントラストを上げましょう。自動で傾き補正やノイズ除去ができるツールもあります。きれいなスキャンは、精度を「使えるレベル」から「優秀なレベル」へ引き上げます。

nn

OCR後の修正作業

nn

どんなに優秀なOCR処理でも、事後チェックが必要です。生成された文書を開き、読み順を確認しましょう。見出しが見出しとしてタグ付けされ、表に正しい見出しセルがあることを確認します。よくある誤認識もチェックしましょう。数字の0が文字のOと間違えられたり、rnmと読まれたりするケースです。

nn

アクセシビリティのワークフローで作業する場合は、PAC for PDFやAcrobatのアクセシビリティチェッカーのような自動チェックツールを実行しましょう。その後、実際のスクリーンリーダーでテストし、ユーザーが聞く音声を確認します。残った問題は、元の文書またはPDFのタグで修正します。

nn

スキャン文書が破損しすぎていたり構造が複雑すぎたりする場合、悪いOCR結果を修正するよりも、元のソースから作り直した方が速くてきれいなこともあります。

nn

スキャンPDFはアクセシブルでないままでいる必要はありません。正しいOCRアプローチと短時間の修正作業で、無音の画像を誰でも読み、検索し、利用できる文書に変換できます。

nn

文書群のアクセシビリティ化にお困りですか? EasyAccessPDFはスキャンPDFの変換と修正を行い、手作業の負担なくコンプライアンス基準を満たせるようにサポートします。