跳到主要内容
博客 · 文档自动化

使用工作流创建带有 PDF OCR 功能的可搜索 PDF

2022年11月12日 · 使用PDF OCR技术识别扫描文档中的文本,创建可搜索的PDF文件。使用PDF4me工作流程,通过PDF OCR操作实现流程自动化。

我们经常拍摄带有文字的文档或表面图像,以便提取数据或供日后参考。这可以通过手机摄像头或文档扫描仪完成。将扫描的文档或图像转换为可搜索的 PDF 文件对于后续处理至关重要。实现 PDF 可搜索性最常用的技术是光学字符识别 (OCR )。

PDF4me 提供的 PDF OCR 功能能够实现最精准的文本识别之一。但是,当您需要识别数百份扫描文档时,唯一的解决方案就是自动化。PDF4me 工作流提供了执行此自动化流程的正确方法——PDF OCR

让我们来看一个使用 PDF OCR 操作识别文本的示例工作流程。

利用工作流实现 PDF OCR 自动化

从扫描文档或文档图像生成包含可搜索文本内容的 PDF 文档。使用 PDF4me OCR 将扫描文档文件转换为可复制文本的 PDF 文档。使用 PDF4me 的工作流自动化平台实现流程自动化。

我们可以先创建一个示例工作流程来自动化 PDF OCR 过程。

PDF OCR 的示例工作流程

为工作流添加触发器

创建并配置一个触发器来启动工作流自动化。一旦新文件到达触发器配置的文件夹中,自动化流程就会启动。

目前工作流提供 2 个触发器 - Google Drive 和 Dropbox。

本示例使用 Dropbox 触发器。

Dropbox 触发器用于 PDF OCR 工作流程

添加 PDF OCR 操作

添加 PDF OCR 功能并根据您的需求进行配置。识别功能提供两种质量配置文件。

  • 草稿- 适用于高分辨率文档扫描和图像。
  • 高质量——适用于低分辨率文档扫描。还能识别多种语言。
用于工作流程自动化的 PDF OCR 操作

将“需要时执行 OCR”设置为“是”,即可仅在需要字符识别的页面上运行 OCR,并忽略已识别的内容。这样可以节省处理时间和自动化调用次数。

工作流程中“需要时执行 OCR”选项

添加“保存到存储”操作

添加保存输出 PDF 文件的操作。在本示例中,我们将选择“保存到 Dropbox” 。配置处理后文件的保存文件夹。配置完成后,即可保存并发布工作流。示例工作流如下所示。

将输出文件保存到 Dropbox 工作流操作

把你的文件准备好。

您可以使用 API 将其集成到您的产品中,无需编写代码即可实现自动化,或者使用浏览器中的免费工具。无需信用卡即可开始。

从一次通话开始curl -X POST https://api.pdf4me.com/v1/ConvertToPdf

免费版 · 无需信用卡