Вы открываете PDF, ожидая скопировать абзац, но при попытке выделить текст ничего не подсвечивается. Курсор скользит по странице, как будто текста там нет. Пробуете Cmd+A, чтобы выделить всё, — ничего. Документ выглядит абсолютно читаемым, но по сути это картинка с текстом, а не настоящий текст.
Почему некоторые PDF не дают выделить текст
Это встречается в отсканированных документах, государственных формах, старых научных статьях и PDF, экспортированных из некоторых дизайнерских инструментов. Страницы были созданы из изображений — либо отсканированы с бумаги, либо «сплющены» при экспорте, — поэтому PDF содержит растровые слои, а не текстовые. Preview, Adobe Reader и любой другой просмотрщик PDF видят одно и то же: пиксели, расположенные так, чтобы напоминать буквы, без каких-либо данных о символах для выделения.
У некоторых PDF также включена защита от копирования. Создатель установил флаг разрешений, запрещающий выделение текста, даже если текстовый слой существует. Стандартные PDF-ридеры соблюдают этот флаг, и вы не можете ничего скопировать.
Читайте текст прямо с экрана
Optic обходит обе проблемы. Поскольку он считывает символы с экрана, а не из внутренней структуры файла, неважно, есть ли у PDF текстовый слой, является ли он отсканированным изображением или имеет ограничения на копирование. Если вы видите текст на экране, Optic сможет его прочитать.
Отсканированные документы
Откройте отсканированный PDF в Preview, увеличьте масштаб до удобного для чтения размера, активируйте Optic и выделите нужный текст. Он распознаёт печатные символы со скана и копирует их как редактируемый текст. Работает со старыми машинописными документами, отсканированными чеками и сфотографированными страницами.
Защищённые PDF
Для PDF, где текстовый слой существует, но выделение заблокировано, Optic считывает отрисованный вывод на экране. Вы получаете тот же текст без борьбы с флагами разрешений и поиска инструментов для «разблокировки» PDF.
Извлечение из нескольких страниц
Пролистывайте документ и делайте выделения на каждой странице. Каждый захват сохраняется в истории строки меню Optic, так что вы можете последовательно пройти длинный отсканированный документ страница за страницей и собрать весь нужный текст.