編集可能なPDFと画像化されたPDFの違い
最終更新日
2つのファイルがどちらもPDFであっても、まったく異なる挙動をすることがあります。一方はテキストを選択でき、引用をコピーでき、単語を検索でき、内容を編集できます。もう一方は画面上では同じように見えても、実質的には文書の写真のようなものです — テキストは画像の一部であり、独立した存在ではありません。前者は編集可能なPDFで、後者は画像化されたPDF(スキャンPDFや画像PDFとも呼ばれます)です。
どちらのタイプかを知ることが重要なのは、それぞれに対して使うべきツールが異なるからです。編集可能なPDFは、PDF編集ツール、変換ツール、検索がきちんと機能します。画像化されたPDFは、検索できるようにするにはOCR(文字認識)が必要で、編集するにはOCRをかけてから編集するか、画像そのものを丸ごと差し替えるしかありません。画像化されたPDFに対して編集可能なPDF向けのツールを使おうとしても、たいていうまくいかず苛立たしい結果になります。
このガイドでは、その違いを解説し、2秒でどちらのタイプかわかる確認方法を紹介し、それぞれのタイプが適切な選択となる場面を示します。画像化されたPDFであることが意図的な場合もあれば、単にファイルの作られ方によって偶然そうなっただけの場合もあります。
手順
- 1
2秒でわかる確認方法:テキストを選択してみる
PDFを開き、テキストの上をクリックしてドラッグしてみましょう。テキストが選択され(ハイライトされ、コピーできる状態になれば)、それは編集可能なPDFです。カーソルで選択枠は描けてもテキストがハイライトされない場合は、画像化されたPDFです — その「テキスト」は画像データです。
- 2
編集可能なPDF:テキストが選択・検索・コピー可能
Word、Pages、Docs、デザインツールから直接書き出すと、編集可能なPDFになります。テキストはファイル内部の構造化されたデータとして存在し、検索やコピー&ペーストが機能し、PDF編集ツールで変更もできます。
- 3
画像化されたPDF:ページの画像で、下地にテキストがない
スキャンした文書が、画像化されたPDFとして最もよくあるケースです。テキストはピクセルとしてしか存在せず、下地の文字データはありません。検索しても何もヒットせず、コピー&ペーストしても何も得られません。
- 4
OCRは画像化されたPDFを検索可能にする(ただし完全には編集できない)
OCR(文字認識)は、ページの画像を解析し、ピクセルの下にテキストの層を追加します。これによって検索は機能するようになり、コピー&ペーストではおおよそのテキストが得られます。編集するには、それでも画像要素を手動で差し替える必要があります。
- 5
画像化が意図的な場合:固定と、画像としての完全な忠実度
ワークフローによっては、あえてPDFを平坦化することがあります — そうすればファイルは簡単に編集できなくなり、署名や印影が下地のテキストを乱すこともありません。PDFから画像に変換してから画像からPDFに戻せば、平坦化されたコピーが作れます。
- 6
編集可能にすることが望ましい場合:それ以外のすべてのワークフロー
共有、署名、編集、保存、再利用のためには、編集可能なPDFが正しい選択です。特に必要な場合を除いて、平坦化しないようにしましょう。
コツ
- 自分で作成したPDFなのにテキストを選択できない場合は、書き出し設定でテキスト層が失われています。「テキストを保持」を有効にして書き出し直しましょう。
- 古いスキャナーでスキャンしたPDFは、たいてい画像化されています。スキャン時、またはあとからツールでOCRをかけておけば、長期的に役立つファイルになります。
- 画像化されたPDFは、同じ内容の編集可能なPDFより大きくなります — 画像データは文字データより多くの容量を占めるためです。
- PDFを「固定する」ために平坦化しないでください — きちんとした編集制限のほうがうまく機能し、検索性も保たれます。
- 「編集可能」とされるPDFの中には、各文字をテキストではなく小さな図形として書き出しているものがあります。選択自体はできているように見えても、コピー&ペーストすると意味不明な結果になります。これは編集にとって最悪のケースです。