跳到主要内容

扫描并按其中包含的特定文本分割 PDF 文件

3 min read
PDF4me Team

如今,我们很多文档处理流程都实现了自动化。想从 PDF 文件中识别特定文本吗?想使用该文本将文件拆分到包含该文本的页面吗?想使用拆分文本重命名拆分后的文件吗?我们为您提供解决方案。

PDF4me 工作流的“按文本拆分”操作可满足所有此类文档逻辑。工作流致力于为您的文档处理提供可靠的自动化解决方案。该操作还可以将文本存储在剪贴板中,以便在保存文件时根据需要使用该文本重命名文件。现在,让我们通过一个示例工作流来了解如何设置此操作。

如何扫描并按特定文本分割PDF?​

在下面的示例中,我们将创建一个工作流,使用 PDF 文件中包含的特定文本来拆分 PDF 文件,并使用该文本重命名拆分后的文件。

首先启动PDF4me 控制面板。

  • 选择“创建工作流”按钮。

创建 PDF4me 工作流程界面

添加触发器以启动您的工作流​

添加触发器以启动自动化流程。

  • 目前,工作流提供两种触发器**——Dropbox 和 Google Drive** 。例如,让我们创建一个 Dropbox 触发器。

配置连接并选择输入文件所在的文件夹。

Dropbox 触发工作流

要测试具体流程,您可以使用此示例 PDF 文件 -下载示例文件

添加“按文本拆分”操作​

添加并配置“按文本拆分”操作,以使用所需的文本分隔文件页面。这里我们使用_正则表达式来检测唯一文本_。

序列号:(.*)

正则表达式将查找以“Serial#:”开头的文本值,并根据条件将其拆分。

按文本拆分操作配置

添加“针对每个文档”控制​

由于**“按文本拆分”会生成多个文档,因此需要一个“遍历每个文档”控件来**逐个处理输出文件。其余操作都应包含在此控件中。

每个控件用于控制多个输出

添加“保存到”操作​

输出文件需要保存到云存储。在本用例中,我们配置一个**“保存到 Dropbox”**操作。上图显示了从“按文本拆分”操作中获取文本的表达式。您可以在“输出文件名”参数中使用以下正则表达式来重命名文件。

${file.pages[0].PageText}.pdf

重命名后保存到 Dropbox。

该表达式会将“按 PDF 拆分”操作中的文本传递给输出文件名参数,以便根据读取的文本重命名文件。