你打开一份 PDF,想要复制一段文字,但当你点击并拖拽时,什么都没有高亮。光标在页面上滑过,好像文字根本不存在。你试着按 Cmd+A 全选——还是没有反应。文档看起来完全可读,但它实际上只是一张文字的图片,而不是真正的文字。
为什么有些 PDF 无法选中文字
这种情况常见于扫描文档、政府表格、较老的学术论文,以及从某些设计工具导出的 PDF。这些页面是由图片生成的——要么是从纸质文件扫描而来,要么在导出时被扁平化——所以 PDF 里包含的是栅格图层,而不是文本图层。预览、Adobe Reader 以及其他任何 PDF 阅读器看到的都是同一回事:排列得像文字的像素,底层没有可供选择的字符数据。
有些 PDF 还启用了复制保护。创建者设置了权限标志,禁止文本选择,即便文本图层实际存在。标准 PDF 阅读器都会遵守这个标志,让你无法复制任何内容。
直接从屏幕读取文字
Optic 绕开了这两个问题。因为它是从你的屏幕读取字符,而不是从文件的内部结构读取,所以 PDF 是否有文本图层、是否是扫描图片,或者是否有复制限制,都不重要。只要你能在屏幕上看到文字,Optic 就能识别它。
扫描文档
在预览中打开扫描的 PDF,缩放到便于阅读的大小,启用 Optic,在需要的文字上拖出选框。它能从扫描件中识别印刷字符,并将其复制为可编辑文字。适用于老式打字文档、扫描收据和拍摄的页面。
受保护的 PDF
对于文本图层存在但选择被锁定的 PDF,Optic 会读取屏幕上渲染出来的输出内容。你能得到同样的文字,而不用去对抗权限标志或寻找 PDF 解锁工具。
多页提取
在文档中翻页,并在每一页上进行选取。每一次捕获都会保存在 Optic 的菜单栏历史记录中,让你可以逐页处理一份很长的扫描文档,并收集所需的全部文字。