步骤 1:仅在需要时执行 OCR

这将是您使用 PDF4me 执行工作流程的第一步。PDF OCR 功能非常强大,它可以检测您的输入文档是扫描文档还是文本文档,并仅在需要时应用 OCR 识别。通常,OCR 功能比其他功能成本略高,因为它需要专用资源,包括强大的 OCR 引擎和相关组件。
在自动化工作流程中,有时您可能需要对扫描图像文档进行 OCR 识别。如果您的文档并非扫描图像,则无需进行 OCR 识别,从而避免不必要的费用。只需在工作流程中添加 OCR 操作时启用“需要时执行 OCR”选项即可。此操作会在转换后生成基于文本的 PDF 文件,或者在不需要转换时返回原始文件。
步骤 2:从 PDF 文档的每一页中提取文本

“提取文本”工作流操作会将页面所有内容导入到下一个操作的数据上下文中。这意味着您可以随意处理内容,例如解析特定文本、检查是否找到所需文本、将解析后的文本与自定义文本合并等等,所有这些都可以通过 JavaScript 表达式实现。在本例中,我们将尝试从在线支付收据中查找发票号码。
发票样本PDF: 
我们要从这个 PDF 文件中解析发票号码,并使用该号码重命名文件,最终将其存储在 PDF4me 的“我的文档”云存储中。
此操作的输出数据上下文将包含以下格式的文本。
${file.pages[0].PageText}
[0] - 这表示从零开始的页码,可以将其设置为任何数字,以获取 PDF 文档中任何页面范围的页面文本。
添加正则表达式,从 PageText 数据上下文中查找匹配项,如下所示。
${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}
这是一个简单的 JavaScript 函数,用于将正则表达式应用于数据上下文结果。此正则表达式尝试查找发票编号以及发票标签。
这样,您就可以利用 JavaScript 函数应用任何逻辑函数来识别您的文档,并做出更准确的分类决策,而无需任何人工操作。
步骤 3:重命名并将其保存到“我的文档存储”中
“保存到我的文档”是 PDF4me 的一项操作,可让您将文档保存到 PDF4me 存储空间。您也可以将其保存到 Dropbox、FTP 或 Google 云端硬盘。为了演示,我们目前使用“我的文档”存储空间。所有“保存到”操作都有一个“输出文件名”字段,该字段为非必填项。 
您可以设置自定义文件名,例如使用任意动态组合 `${INV}-{UTCNOW()}.pdf`。这将生成以 `INV-` 为前缀、动态添加当前 UTC 时间后缀的文档。您可以控制输出文档的存储方式、存储位置和存储内容。在我们的演示用例中,我们需要将数据上下文与正则表达式结合使用,以生成如下所示的新文件名。
${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}.pdf
完成以上三个步骤后,您的文档将被分类、重命名并存储到您指定的文件存储位置。现在是不是感觉很方便?没错,PDF4me始终从最终用户的角度出发,致力于让用户在文档处理方面轻松无忧。