段落をコピーするつもりでPDFを開いたのに、クリックしてドラッグしても何もハイライトされません。カーソルは、まるでそこにテキストなど存在しないかのようにページ上を滑ります。Cmd+Aですべて選択しようとしても——何も起きません。文書は完全に読めるように見えますが、実質的にはテキストの「絵」であり、本物のテキストではないのです。
一部のPDFがテキストを選択させない理由
これはスキャンした書類、政府の申請書、古い学術論文、特定のデザインツールから書き出されたPDFでよく起こります。ページは画像から作成されており——紙からスキャンされたか、書き出し時にフラット化されたため——PDFにはテキストレイヤーではなくラスターレイヤーが含まれています。プレビュー、Adobe Reader、その他すべてのPDFビューアが目にするのは同じもの——文字のように見えるように配置されたピクセルであり、選択できる文字データは存在しません。
一部のPDFにはコピー保護が設定されていることもあります。作成者がテキスト選択を防ぐ権限フラグを設定しており、テキストレイヤーが存在していても、標準的なPDFリーダーはこのフラグを尊重するため、何もコピーできません。
画面から直接テキストを読み取る
Opticはどちらの問題も回避します。ファイルの内部構造からではなく、画面から文字を読み取るため、PDFにテキストレイヤーがあるか、スキャン画像であるか、コピー制限があるかは関係ありません。ディスプレイに見えているなら、Opticはそれを読み取れます。
スキャンした書類
スキャンしたPDFをプレビューで開き、読みやすい大きさにズームし、Opticを起動して必要なテキストの上をドラッグします。スキャンから印刷文字を認識し、編集可能なテキストとしてコピーします。古いタイプ打ちの書類、スキャンしたレシート、写真で撮影したページにも対応します。
保護されたPDF
テキストレイヤーは存在するが選択がロックされているPDFについては、Opticは画面上にレンダリングされた出力を読み取ります。権限フラグと格闘したり、PDFのロック解除ツールを探し回ったりすることなく、同じテキストを得られます。
複数ページの抽出
書類をスクロールしながら各ページで選択を行います。すべてのキャプチャはOpticのメニューバー履歴に保存されるため、長いスキャン書類をページごとに処理し、必要なテキストをすべて集められます。