跳到主要内容
博客 · 文档自动化

自动对扫描的PDF文档进行排序和重命名

2021年9月16日 · 您有很多扫描文档,文件名是机器生成的,排序也不规范。现在,使用PDF4me工作流,即可自动对它们进行排序和重命名。

文档分类几十年来一直是几乎所有行业的一大挑战,并且在各种业务流程中都至关重要。传统上,这一过程是人工完成的,例如用户阅读文档并识别主题以进行分类。尽管人工分类有助于更精确地进行分类,但它非常耗时且成本高昂。

业务流程的数字化显著减少了人工操作,从而促进了经济的快速增长。目前市场上已有许多文档工作自动化工具和服务,能够简化业务流程,使其更加高效且易于扩展。因此,快速整理大量涌入业务流程的文档至关重要。借助PDF4me 工作流功能,您可以利用其辅助功能自动完成文档的排序和整理。

为了便于您理解,我们举了一个具体的用例。

  • 使用正则表达式从文档中查找发票号码,并将文件重命名为发票号码,并逐步详细解释。

只需 3 个简单步骤,即可整理文档、重命名文档并将其保存到分类良好的存储空间。

步骤 1:仅在需要时执行 OCR

使用 OCR 技术识别扫描文档中的文本。

这将是您使用 PDF4me 执行工作流程的第一步。PDF OCR 功能非常强大,它可以检测您的输入文档是扫描文档还是文本文档,并仅在需要时应用 OCR 识别。通常,OCR 功能比其他功能成本略高,因为它需要专用资源,包括强大的 OCR 引擎和相关组件。

在自动化工作流程中,有时您可能需要对扫描图像文档进行 OCR 识别。如果您的文档并非扫描图像,则无需进行 OCR 识别,从而避免不必要的费用。只需在工作流程中添加 OCR 操作时启用“需要时执行 OCR”选项即可。此操作会在转换后生成基于文本的 PDF 文件,或者在不需要转换时返回原始文件。

步骤 2:从 PDF 文档的每一页中提取文本

使用 OCR 识别后提取文本。

“提取文本”工作流操作会将页面所有内容导入到下一个操作的数据上下文中。这意味着您可以随意处理内容,例如解析特定文本、检查是否找到所需文本、将解析后的文本与自定义文本合并等等,所有这些都可以通过 JavaScript 表达式实现。在本例中,我们将尝试从在线支付收据中查找发票号码。

发票样本PDF:

发票样本

我们要从这个 PDF 文件中解析发票号码,并使用该号码重命名文件,最终将其存储在 PDF4me 的“我的文档”云存储中。

此操作的输出数据上下文将包含以下格式的文本。

${file.pages[0].PageText}

[0] - 这表示从零开始的页码,可以将其设置为任何数字,以获取 PDF 文档中任何页面范围的页面文本。

添加正则表达式,从 PageText 数据上下文中查找匹配项,如下所示。

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}

这是一个简单的 JavaScript 函数,用于将正则表达式应用于数据上下文结果。此正则表达式尝试查找发票编号以及发票标签。

这样,您就可以利用 JavaScript 函数应用任何逻辑函数来识别您的文档,并做出更准确的分类决策,而无需任何人工操作。

步骤 3:重命名并将其保存到“我的文档存储”中

“保存到我的文档”是 PDF4me 的一项操作,可让您将文档保存到 PDF4me 存储空间。您也可以将其保存到 Dropbox、FTP 或 Google 云端硬盘。为了演示,我们目前使用“我的文档”存储空间。所有“保存到”操作都有一个“输出文件名”字段,该字段为非必填项。

将文件以自定义名称保存到“我的文档”

您可以设置自定义文件名,例如使用任意动态组合 `${INV}-{UTCNOW()}.pdf`。这将生成以 `INV-` 为前缀、动态添加当前 UTC 时间后缀的文档。您可以控制输出文档的存储方式、存储位置和存储内容。在我们的演示用例中,我们需要将数据上下文与正则表达式结合使用,以生成如下所示的新文件名。

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}.pdf

完成以上三个步骤后,您的文档将被分类、重命名并存储到您指定的文件存储位置。现在是不是感觉很方便?没错,PDF4me始终从最终用户的角度出发,致力于让用户在文档处理方面轻松无忧。

把你的文件准备好。

您可以使用 API 将其集成到您的产品中,无需编写代码即可实现自动化,或者使用浏览器中的免费工具。无需信用卡即可开始。

从一次通话开始curl -X POST https://api.pdf4me.com/v1/ConvertToPdf

免费版 · 无需信用卡