Appleは画像内のテキストを認識するシステムレベルの機能として「ライブテキスト」を導入しました。理屈の上では、「画像内のテキストを選択できない」という問題を解決するもののように聞こえます。しかし実際には、限られた場面でしか機能せず、実際に必要とする多くの状況では静かに何もしません。
ライブテキストが力不足な場面
ライブテキストは写真、プレビュー、Safari(一部の画像)、クイックルックの中で機能します。おおよそそこがその守備範囲の限界です。以下は、役に立たないよくある状況です。
動画のフレーム。ライブテキストは動画コンテンツには作用しません。YouTube動画、Zoomの画面共有、QuickTimeの録画、あるいはどんなストリーミングプレーヤーであっても、そこに表示されたテキストをライブテキストは認識しません。結局は手作業での書き写しに逆戻りです。
アプリのインターフェースやダイアログ。アプリUIのラベル、エラーダイアログ、メニュー項目、カスタムコントロールとしてレンダリングされたテキストは、ライブテキストからは見えません。埋め込み画像に対してのみ動作し、任意の画面コンテンツには反応しません。
canvasやSVGでテキストを描画するウェブアプリ。多くの現代的なウェブアプリ——ダッシュボード、データツール、デザインアプリ——はcanvas要素やSVGを使ってテキストをレンダリングします。ライブテキストはこうしたレンダリングの内部までは届きません。
選択できないPDF。プレビューは画像ベースのPDF内のテキストを認識できることもありますが、結果は一貫しておらず、スキャン品質、ページの複雑さ、PDFの構造に左右されます。多くのスキャン書類では、ライブテキストの反応がまったく得られません。
コピー保護されたコンテンツ。ライブテキストはDRMとコピー制限を尊重します。アプリや書類がテキスト選択を無効にしている場合、ライブテキストもそれに従います。
キャプチャ履歴がない。ライブテキストには記憶がありません。認識のたびに一時的なものです。画像を閉じたり別の画面に移動したりすると、認識されたテキストは消えてしまいます。抽出内容のログや履歴は存在しません。
これらの限界のない画面レベルのOCR
Opticはファイルや画像レベルではなく、画面レベルで動作します。ディスプレイに表示されているものであれば、どのアプリでも、どんなソースでも、どんな文脈でも文字を読み取ります。動画フレーム、ダイアログボックス、ウェブアプリのcanvas、ロックされたPDF、リモートデスクトップセッション——見えるテキストであればOpticは読み取れます。
履歴と読み上げ
ライブテキストとは異なり、Opticはすべてのキャプチャをメニューバーからアクセスできる永続的な履歴に保存します。また読み上げ機能も備えており、キャプチャしたテキストを音声で聞くことができます——校正やアクセシビリティに便利です。
QRコードのスキャン
ライブテキストは一部の画像の文脈でQRコードを読み取れますが、動画や画面共有、任意のアプリウィンドウからは読み取れません。Opticは画面上のどこからでもQRコードをスキャンし、即座にデコードします。