跳到主要内容

使用工作流创建带有 PDF OCR 功能的可搜索 PDF

3 min read
PDF4me Team

我们经常拍摄带有文字的文档或表面图像,以便提取数据或供日后参考。这可以通过手机摄像头或文档扫描仪完成。将扫描的文档或图像转换为可搜索的 PDF 文件对于后续处理至关重要。实现 PDF 可搜索性最常用的技术是光学字符识别 (OCR )。

PDF4me 提供的 PDF OCR 功能能够实现最精准的文本识别之一。但是,当您需要识别数百份扫描文档时,唯一的解决方案就是自动化。PDF4me 工作流提供了执行此自动化流程的正确方法——PDF OCR 。

让我们来看一个使用 PDF OCR 操作识别文本的示例工作流程。

利用工作流实现 PDF OCR 自动化​

从扫描文档或文档图像生成包含可搜索文本内容的 PDF 文档。使用 PDF4me OCR 将扫描文档文件转换为可复制文本的 PDF 文档。使用 PDF4me 的工作流自动化平台实现流程自动化。

我们可以先创建一个示例工作流程来自动化 PDF OCR 过程。

PDF OCR 的示例工作流程

为工作流添加触发器​

创建并配置一个触发器来启动工作流自动化。一旦新文件到达触发器配置的文件夹中,自动化流程就会启动。

目前工作流提供 2 个触发器 - Google Drive 和 Dropbox。

本示例使用 Dropbox 触发器。

Dropbox 触发器用于 PDF OCR 工作流程

添加 PDF OCR 操作​

添加 PDF OCR 功能并根据您的需求进行配置。识别功能提供两种质量配置文件。

  • 草稿- 适用于高分辨率文档扫描和图像。
  • 高质量——适用于低分辨率文档扫描。还能识别多种语言。

用于工作流程自动化的 PDF OCR 操作

将“需要时执行 OCR”设置为“是”,即可仅在需要字符识别的页面上运行 OCR,并忽略已识别的内容。这样可以节省处理时间和自动化调用次数。

工作流程中“需要时执行 OCR”选项

添加“保存到存储”操作​

添加保存输出 PDF 文件的操作。在本示例中,我们将选择“保存到 Dropbox” 。配置处理后文件的保存文件夹。配置完成后,即可保存并发布工作流。示例工作流如下所示。

将输出文件保存到 Dropbox 工作流操作