我们经常拍摄带有文字的文档或表面图像,以便提取数据或供日后参考。这可以通过手机摄像头或文档扫描仪完成。将扫描的文档或图像转换为可搜索的 PDF 文件对于后续处理至关重要。实现 PDF 可搜索性最常用的技术是光学字符识别 (OCR )。
PDF4me 提供的 PDF OCR 功能能够实现最精准的文本识别之一。但是,当您需要识别数百份扫描文档时,唯一的解决方案就是自动化。PDF4me 工作流提供了执行此自动化流程的正确方法——PDF OCR 。
让我们来看一个使用 PDF OCR 操作识别文本的示例工作流程。
利用工作流实现 PDF OCR 自动化
从扫描文档或文档图像生成包含可搜索文本内容的 PDF 文档。使用 PDF4me OCR 将扫描文档文件转换为可复制文本的 PDF 文档。使用 PDF4me 的工作流自动化平台实现流程自动化。
我们可以先创建一个示例工作流程来自动化 PDF OCR 过程。

为工作流添加触发器
创建并配置一个触发器来启动工作流自动化。一旦新文件到达触发器配置的文件夹中,自动化流程就会启动。
目前工作流提供 2 个触发器 - Google Drive 和 Dropbox。
本示例使用 Dropbox 触发器。
添加 PDF OCR 操作
添加 PDF OCR 功能并根据您的需求进行配置。识别功能提供两种质量配置文件。
- 草稿- 适用于高分辨率文档扫描和图像。
- 高质量——适用于低分辨率文档扫描。还能识别多种语言。
将“需要时执行 OCR”设置为“是”,即可仅在需要字符识别的页面上运行 OCR,并忽略已识别的内容。这样可以节省处理时间和自动化调用次数。
添加“保存到存储”操作
添加保存输出 PDF 文件的操作。在本示例中,我们将选择“保存到 Dropbox” 。配置处理后文件的保存文件夹。配置完成后,即可保存并发布工作流。示例工作流如下所示。
