·5 мин. чтения

Ограничения OCR в Preview на Mac — чего ей не хватает

Preview работает с изображениями и PDF, но не может извлечь текст из большинства из них. Если вы пытались скопировать текст из отсканированного PDF или фото в Preview и ничего не вышло, вот почему.

Preview — стандартный просмотрщик изображений и PDF в macOS, и многие пользователи предполагают, что он умеет распознавать текст на изображениях и в отсканированных документах. В ограниченных случаях это так — благодаря интеграции с Live Text. Но во многих распространённых сценариях Preview либо незаметно не распознаёт текст, либо вообще не предлагает функции извлечения. Если вы пытались выделить текст из отсканированного PDF или фото документа в Preview, а курсор просто рисовал прямоугольник выделения без подсветки текста, вы упёрлись в стену OCR-возможностей Preview.

Где ломается распознавание текста в Preview

Отсканированные PDF со сложной вёрсткой. Preview иногда может распознать текст в чистых, хорошо отсканированных одноколоночных документах. Но многоколоночная вёрстка, таблицы, колонтитулы и документы со смешанной графикой и текстом часто вообще не дают выделяемого текста. Движок Live Text в Preview ненадёжно обрабатывает сложные структуры документов.

Низкая контрастность или мелкий текст. Сканы чеков, выцветшие документы и изображения с низкой контрастностью между текстом и фоном часто побеждают распознавание Preview. Текст может быть отлично читаем для глаз человека, но невидим для распознавания Preview.

Рукописный текст. Распознавание текста в Preview настроено на печатные шрифты. Рукописные заметки, фото досок и аннотированные документы редко распознаются, даже если почерк аккуратный и разборчивый.

Нелатинские системы письма. Поддержка нелатинских языков нестабильна. Текст на CJK, арабском или кириллице в изображениях может распознаваться или нет — в зависимости от стиля шрифта, качества изображения и сложности документа.

Нет захвата с экрана. Preview обрабатывает только открытые вами файлы. Если нужный текст находится в кадре видео, интерфейсе веб-приложения, диалоге ошибки или окне другого приложения, у Preview нет способа до него добраться.

OCR, работающий со всем на экране

Optic полностью обходит ограничения Preview, работая на уровне экрана. Вместо того чтобы просить просмотрщик файлов распознать текст внутри файла, Optic считывает символы со всего, что видно на экране. Откройте проблемный документ в Preview — или любом другом приложении — и выделите нужный текст с помощью Optic.

Optic преодолевает ограничения OCR в Preview на Mac

Сложная вёрстка документов

Таблицы, многоколоночный текст и смешанный контент, ставящие Preview в тупик, читаемы для Optic, потому что вы сами контролируете, какую именно область сканировать. Выделите только нужный столбец или ячейку таблицы — без разбора всей страницы целиком.

За пределами файлов

Optic не ограничен открытыми файлами. Кадры видео, диалоги, веб-приложения, сеансы удалённого рабочего стола — всё, что отрисовано на экране, подходит. Preview никогда не сможет добраться до таких источников; Optic читает их так же естественно, как любое изображение.

Постоянная история

У Preview нет памяти о прошлых попытках распознавания текста. Optic сохраняет каждое извлечение в строке меню, создавая журнал захваченного текста, который можно пролистать и скопировать заново в любой момент.

Скачать Optic в Mac App Store

Следующая статья

Optic

Select any text on screen and copy it — images, PDFs, dialogs, anything.

Get Optic on the Mac App Store