跳到主要内容

使用工作流读取 PDF 特定区域的文本

3 min read
PDF4me Team

如今,我们很多文档处理流程都实现了自动化。想要从 PDF 的特定区域复制文本?想在后续处理 PDF 时使用该文本?我们为您提供解决方案。PDF4me 工作流操作可满足所有此类文档逻辑的需求。

工作流专注于为您的文档流程提供可靠的自动化解决方案。工作流中的**“读取文本”操作**可以读取并复制 PDF 文档特定区域中的文本。该区域可以以像素为单位进行定义,并且可以指代 PDF 文档中的任何区域。

如何读取PDF文件中的文本?​

让我们通过创建一个示例工作流程来了解一下,在这个工作流程中,您想要分割一个大型 PDF 文件,并使用每个 PDF 中的特定文本来命名输出文件。

首先启动PDF4me 控制面板。

  • 选择“创建工作流”按钮。

创建 PDF4me 工作流程

添加触发器以启动您的工作流​

添加触发器以启动自动化流程。目前,工作流提供 2 个触发器。

Dropbox 和 Google Drive。例如,我们来创建一个 Dropbox 触发器。

配置连接并选择输入文件所在的文件夹。

配置 Dropbox 触发器

添加拆分操作​

添加并配置“拆分 PDF”操作,以便根据需要拆分文件页面。这里我们使用“拆分循环”操作,在达到一定页数后定期拆分页面。

拆分操作反复拆分 PDF 页面

添加“针对每个文档”控制​

由于“拆分循环”操作会生成多个文档,因此需要一个**“遍历每个文档”控件来**逐个处理输出文件。其余操作都应包含在此控件中。

允许每个文档单独处理输出文件

添加“从 PDF 读取文本”操作​

添加并配置“读取文本”操作,包括所有必需的参数。

  • X1 - 左侧的 X 坐标
  • Y1 - 左侧的 Y 坐标
  • X2 - 右侧的 X 坐标
  • Y2 - 右侧的 Y 坐标

从 PDF 文件中指定位置读取文本

添加“保存到”操作​

输出文件需要保存到云存储。在本用例中,我们配置一个**“保存到 Dropbox** ”操作。上图显示了从“读取文本”操作中获取文本的表达式。您可以将下方给出的正则表达式复制粘贴到“输出文件名”参数中。

${file.pages[0].PageText}.pdf

将输出文件以读取文本命名后,保存到 Dropbox。

该表达式会将 PDF 指定位置的文本传递给输出文件名参数,以便根据读取的文本重命名文件。

从 PDF 工作流程摘要中读取最终文本