无需额外集成,即可配置工作流以自动从 PDF 中提取文本。让我们通过一个示例工作流来了解如何自动提取和重命名 PDF 文本。
添加触发器以启动您的工作流
添加触发器以启动自动化流程。目前,工作流提供两种触发器: Dropbox 和 Google Drive 。例如,让我们创建一个 Dropbox 触发器。
配置连接并选择输入文件所在的文件夹。 
添加提取文本操作
添加“提取文本”操作并启用该操作。该操作会从 PDF 文件中提取全文。如果您想分别从每一页提取文本,请在“提取”操作之前添加“拆分 PDF”操作。此外,请将“提取文本”操作添加到“循环”控件中。 
添加“保存到”操作
输出文件需要保存到云存储。在本用例中,我们配置一个“保存到 Dropbox”操作。您可以使用正则表达式从“提取文本”操作中获取特定文本。您可以将下方给出的正则表达式复制粘贴到“输出文件名”参数中,并添加条件以匹配所需的文本。
${file.pages[0].PageText.match(<condition>).pdf 
该表达式会将 PDF 中符合条件的文本传递给输出文件名参数,以便根据读取的文本重命名文件。
试用样品
让我们来看一个工作流程,从示例发票 PDF 中提取文本,并使用文本的特定部分(发票编号)在将 PDF 文件保存到云端之前重命名该文件。
让我们简要看一下这些步骤——
- 添加并配置您选择的触发器
- 添加“提取文本”操作并启用它。
- 请将示例 PDF 发票上传到触发器的源文件夹中 -下载示例文件
- 添加要保存文件的存储位置,并在输出文件名参数中传递以下正则表达式 -
${file.pages[0].PageText.match('发票 #(.*)')[1].trim()}.pdf 
上述工作流程将从 PDF 中提取文本,裁剪所需部分,并将文件重命名为相同名称,然后保存到存储位置。