← すべてのFAQ質問

OCRとテキスト

PDFからテキストを抽出する方法(OCRをわかりやすく解説)

短い答え

デジタルPDF(スキャンではなくテキストから作られたもの)なら、テキストを直接選択してコピーできます。ツールは不要です。スキャン文書の場合はOCR(光学式文字認識)が必要です。ページ画像を読み取って、実際のテキストに変換します。Google Driveで無料で実行でき、デジタルファイルの抽出はPDFからMarkdownへの変換ツールが対応しています。

デジタルPDFからテキストをコピーする

まずは簡単な方法を試しましょう。PDFを開いて、マウスでテキストをドラッグ選択します。ハイライトされたら完了です。Ctrl/Cmd+Cでコピーして、どこにでも貼り付けられます。ブラウザ、プレビュー、どのPDFリーダーでも使えます。

選択がグレーアウトしている場合、そのファイルにはコピー保護(権限ロック)がかかっています。パスワードが分かれば解除できます。テキストの選択はできても、貼り付け時に書式が崩れるツールもあります。テキスト自体はあるのですが、レイアウトが生き残らないのです。

スキャンPDFからテキストを抽出する(OCR)

スキャンしたページは写真です。写真にはコピーできるテキストがありません。OCRがそれを読み取ります。

  1. スキャンしたPDFをGoogle Driveにアップロードします(右クリック → アプリで開く → Googleドキュメント)。Driveが自動でOCRを実行し、テキストを表示します。
  2. 専用のOCRツールを使う方法もあります。無料ツールでも数ページなら十分こなせます。
  3. テキストをコピーして、中身を確認します。手書きや特殊なフォントではOCRも間違えます。

品質に関する正直な評価: きれいな活字のOCRはほぼ完璧です。レシート、印鑑付きの請求書、手書き文字になると、手直しが必要なエラーが出ると思ってください。医者の手書き文字を読めるツールは存在しません。そう主張する人は嘘をついています。

正直なところ

よく驚かれるのが次の3点です。

  • 表はグチャグチャに抽出されます。テキスト抽出は左から右へ読むため、表の列が長い文字列の塊になってしまいます。表の構造が必要なら、生テキストをコピーするよりExcelやWordに変換しましょう。
  • フォントと書式は消えます。手に入るのは単語だけで、デザインはありません。引用やメモには十分ですが、見た目が重要な文書には向きません。
  • 抽出は編集ではありません。テキストを取り出しても、PDF自体の変更は別の作業です。PDFの編集方法をご覧ください。

関連する質問