跳到主要内容
博客 · 文档自动化

使用工作流从 PDF 中提取文本并稍后重复使用。

2022年7月30日 · 从PDF中提取文本,并可部分或全部重复使用。使用PDF4me工作流中的“提取文本”操作可自动执行此过程。

数字文档正在迅速取代传统的纸质文档。如今,我们收到的PDF文件数量庞大。像合同、法律文件或电子书这样的PDF文档可能包含成百上千页。我们对很多这类文档都进行了自动化处理。有时,我们可能需要从PDF的特定区域复制文本。此外,在后续处理PDF的过程中,我们也可能需要用到这些文本。别担心,我们为您提供了一个解决方案。PDF4me工作流操作可以满足所有这些文档逻辑的需求。

使用PDF4me 工作流中的“提取文本”操作,可以自动从 PDF 文档中提取文本数据。此外,您还可以使用其他步骤在后续阶段部分或全部重用这些数据。让我们来看一个示例工作流,其中我们从 PDF 文档中提取文本,并在后续阶段使用它来重命名文件。

如何从PDF中提取文本以供重复使用?

无需额外集成,即可配置工作流以自动从 PDF 中提取文本。让我们通过一个示例工作流来了解如何自动提取和重命名 PDF 文本。

添加触发器以启动您的工作流

添加触发器以启动自动化流程。目前,工作流提供两种触发器: Dropbox 和 Google Drive 。例如,让我们创建一个 Dropbox 触发器。

配置连接并选择输入文件所在的文件夹。

Dropbox 触发器用于提取文本操作

添加提取文本操作

添加“提取文本”操作并启用该操作。该操作会从 PDF 文件中提取全文。如果您想分别从每一页提取文本,请在“提取”操作之前添加“拆分 PDF”操作。此外,请将“提取文本”操作添加到“循环”控件中。

添加并启用“提取文本”操作

添加“保存到”操作

输出文件需要保存到云存储。在本用例中,我们配置一个“保存到 Dropbox”操作。您可以使用正则表达式从“提取文本”操作中获取特定文本。您可以将下方给出的正则表达式复制粘贴到“输出文件名”参数中,并添加条件以匹配所需的文本。

${file.pages[0].PageText.match(<condition>).pdf

使用正则表达式保存 Dropbox 操作

该表达式会将 PDF 中符合条件的文本传递给输出文件名参数,以便根据读取的文本重命名文件。

试用样品

让我们来看一个工作流程,从示例发票 PDF 中提取文本,并使用文本的特定部分(发票编号)在将 PDF 文件保存到云端之前重命名该文件。

让我们简要看一下这些步骤——

  1. 添加并配置您选择的触发器
  2. 添加“提取文本”操作并启用它。
  3. 请将示例 PDF 发票上传到触发器的源文件夹中 -下载示例文件
  4. 添加要保存文件的存储位置,并在输出文件名参数中传递以下正则表达式 -

${file.pages[0].PageText.match('发票 #(.*)')[1].trim()}.pdf

提取文本并重命名 PDF 的示例工作流程

上述工作流程将从 PDF 中提取文本,裁剪所需部分,并将文件重命名为相同名称,然后保存到存储位置。

把你的文件准备好。

您可以使用 API 将其集成到您的产品中,无需编写代码即可实现自动化,或者使用浏览器中的免费工具。无需信用卡即可开始。

从一次通话开始curl -X POST https://api.pdf4me.com/v1/ConvertToPdf

免费版 · 无需信用卡