スキャンしたPDFを編集する方法(先にOCR、それから編集)
短い答え
スキャンしたPDFの編集とは、要するに写真であるページを扱うことです。だから正直な第一歩はOCRです。画像を本物のテキストに変換してから、そのテキストを編集します。上にメモや署名を追加したいだけなら、それは注釈で、どんなスキャンでも使えます。文字そのものを変えたいなら、先にOCRです。どんなエディタもピクセルを書き換えることはできません。
スキャンしたPDFの「編集」には2種類ある
どちらが必要かを先に見極めましょう。まったく別の作業です:
- 上に何かを足す — 署名、メモ、ハイライトなど。どんなスキャンでも使えて、無料で、1分で終わります。PDFへの注釈を参照してください。
- テキストそのものを変える — 誤字の修正、名前の更新、数字の差し替え。OCRと再構築が必要です。これが下の長い道のりです。
スキャンしたPDFの文字を変える
- スキャンにOCRをかけます。GoogleドライブのOCRや専用ツールが画像を編集可能なテキストに変換します。
- 結果をエディタで開きます。Word変換(スキャンしたPDFをWordに)か、テキスト文書です。
- テキスト文書で編集します。ここが本番の編集作業です。
- 内容が確定したら、PDFに書き出し直します。
正直な現実:これは5分で終わる作業ではありません。OCRの品質はスキャン次第です(300DPIのきれいな印刷なら良好、手書きやハンコだと手で直すエラーが出ます)。そして結果は元の文書と完全に同じ見た目にはなりません。法的文書の1文字の誤字なら、OCRの道よりページを打ち直すほうが速いことも多いです。
正直なところ
始める前に知っておきたいことが3つあります:
- OCRは読むだけで、理解しません。表、段組み、複雑なレイアウトはぐちゃぐちゃになります。詳細はテキスト抽出を参照してください。
- 書式は失われます。スキャン元のフォントやレイアウトは引き継がれません。OCR版はスキャンではなく、素朴な文書に見えます。
- 文書が元と同じ見た目でなければならない場合(認証コピー、署名済み契約書など)は、編集してはいけません。スキャンは記録として残し、修正版は別に作ってください。公式文書のスキャンを編集すると、気まずい話に巻き込まれかねません。