·4分钟阅读

如何在 Mac 上从无法选中文字的 PDF 中复制文字

有些 PDF 看起来像普通文档,却连一个字都选不中。文字在视觉上确实存在,但它被困在一层扁平的图片图层里。

你打开一份 PDF,想要复制一段文字,但当你点击并拖拽时,什么都没有高亮。光标在页面上滑过,好像文字根本不存在。你试着按 Cmd+A 全选——还是没有反应。文档看起来完全可读,但它实际上只是一张文字的图片,而不是真正的文字。

为什么有些 PDF 无法选中文字

这种情况常见于扫描文档、政府表格、较老的学术论文,以及从某些设计工具导出的 PDF。这些页面是由图片生成的——要么是从纸质文件扫描而来,要么在导出时被扁平化——所以 PDF 里包含的是栅格图层,而不是文本图层。预览、Adobe Reader 以及其他任何 PDF 阅读器看到的都是同一回事:排列得像文字的像素,底层没有可供选择的字符数据。

有些 PDF 还启用了复制保护。创建者设置了权限标志,禁止文本选择,即便文本图层实际存在。标准 PDF 阅读器都会遵守这个标志,让你无法复制任何内容。

直接从屏幕读取文字

Optic 绕开了这两个问题。因为它是从你的屏幕读取字符,而不是从文件的内部结构读取,所以 PDF 是否有文本图层、是否是扫描图片,或者是否有复制限制,都不重要。只要你能在屏幕上看到文字,Optic 就能识别它。

Optic reading text from a non-selectable PDF on Mac

扫描文档

在预览中打开扫描的 PDF,缩放到便于阅读的大小,启用 Optic,在需要的文字上拖出选框。它能从扫描件中识别印刷字符,并将其复制为可编辑文字。适用于老式打字文档、扫描收据和拍摄的页面。

受保护的 PDF

对于文本图层存在但选择被锁定的 PDF,Optic 会读取屏幕上渲染出来的输出内容。你能得到同样的文字,而不用去对抗权限标志或寻找 PDF 解锁工具。

多页提取

在文档中翻页,并在每一页上进行选取。每一次捕获都会保存在 Optic 的菜单栏历史记录中,让你可以逐页处理一份很长的扫描文档,并收集所需的全部文字。

在 Mac App Store 获取 Optic

下一篇文章

Optic

Select any text on screen and copy it — images, PDFs, dialogs, anything.

Get Optic on the Mac App Store