PDFをテキストに変換する方法(言葉だけ、それ以外は不要)
短い答え
PDFをプレーンテキストに変換するには、デジタルPDFなら開いてテキストをコピペするだけ。またはコンバーターにアップロードして.txtを出力します。スキャンしたPDFは先にOCRが必要です(PDFからのテキスト抽出をご覧ください)。出力は純粋なテキスト。書式も画像もレイアウトもありません。編集、引用、他のツールへの取り込みにちょうどいい状態です。
最速の方法:コピー&ペースト
- PDFを任意のビューアーで開きます。
- テキストをすべて選択(Ctrl/Cmd+A)してコピーし、テキストエディターに貼り付けます。
- 完了——ツール不要で、どのデバイスでも使えます。
これでたいていのデジタルPDFは処理できます。選択がグレーアウトしている場合はコピー保護がかかっています。許可のロックなので、パスワードを知っていれば解除できます。
ツールでPDFをテキストに変換する
コピペが現実的でない場合——200ページのマニュアル、ヘッダーやフッターを除去したいテキスト——はコンバーターを使います。PDFをアップロードして.txtをダウンロード。優れたツールはページ番号やヘッダーを自動で削除し、ページ範囲を選べるものもあります。
構造(見出し、リスト)を保ったテキストが必要なら、PDF→Markdown変換ツールの方がおすすめです。Markdownは構造を持つプレーンテキストで、HTMLやWord、ドキュメント形式にもきれいに変換できます。とにかく素の.txtが欲しいなら、普通のコンバーターで十分です。
正直なところ
テキストに変換すると失われるもの:
- 視覚的なものすべて。表は流れるテキストに潰れ、列は融合し、画像は消えます。テキスト自体は全部残っていますが、読む感触は映画のラジオ文字起こしを読むようなものです。
- スキャンにはOCRが必要。スキャンしたページにはテキスト層がありません。存在しないものを抽出することはできません。先にOCRを実行し、画質の悪いスキャンでの誤認識は受け入れましょう。
- 順番が入れ替わることがある。段組みレイアウトは、読む順序ではなく列の順序で抽出されます。2段組みのニュースレターは、列Aの次に列Bという順で出力されます。うんざりしますが、予測はできます。
用途の確認を:テキストファイルは内容のためのものです。引用、アーカイブ、スクリプトやAIツールへの取り込みに使います。読める文書が目的なら、PDFのままか、構造を保つ形式に変換する方がいいでしょう。