Zum Hauptinhalt springen

Erstellung durchsuchbarer PDFs mit PDF-OCR mithilfe von Workflows

3 min read
PDF4me Team

Wir fotografieren häufig Dokumente oder Oberflächen mit Text, um die Daten zu extrahieren oder später darauf zurückzugreifen. Dies kann mit einer einfachen Handykamera oder einem Dokumentenscanner geschehen. Die Umwandlung gescannter Dokumente oder Bilder in durchsuchbare PDF-Dateien ist für deren Weiterverarbeitung wichtig. Die am häufigsten verwendete Technologie zur Durchsuchbarkeit von PDFs ist die optische Zeichenerkennung (OCR) .

PDF4me bietet eine PDF-OCR-Funktion mit höchster Genauigkeit bei der Texterkennung. Bei Hunderten von gescannten Dokumenten ist jedoch die Automatisierung die einzige Lösung. PDF4me Workflows bietet die passende Funktion für diese Automatisierung: die PDF-OCR .

Betrachten wir einen Beispiel-Workflow zur Texterkennung mithilfe der PDF-OCR-Aktion.

PDF-OCR mit Workflows automatisieren​

Erstellen Sie PDF-Dokumente mit durchsuchbarem Text aus gescannten Dokumenten oder Dokumentenbildern. Konvertieren Sie gescannte Dokumentdateien mithilfe der OCR-Technologie von PDF4me in PDF-Dokumente mit kopierbarem Text. Automatisieren Sie den Prozess mit der Workflow- Automatisierungsplattform von PDF4me.

Wir können damit beginnen, einen Beispiel-Workflow zu erstellen, um den PDF-OCR-Prozess zu automatisieren.

Beispielhafter Workflow für PDF-OCR

Fügen Sie einen Auslöser für den Workflow hinzu.​

Erstellen und konfigurieren Sie einen Auslöser, um die Workflow-Automatisierung zu starten. Sobald eine neue Datei im konfigurierten Ordner des Auslösers eintrifft, wird die Automatisierung initialisiert.

Workflows bieten derzeit 2 Auslöser – Google Drive und Dropbox.

Wir verwenden im Beispiel den Dropbox-Trigger.

Dropbox-Trigger für PDF-OCR-Workflow

Fügen Sie die PDF-OCR-Aktion hinzu​

Fügen Sie die PDF-OCR-Aktion hinzu und konfigurieren Sie sie nach Ihren Anforderungen. Es stehen zwei Qualitätsprofile für die Erkennung zur Verfügung.

  • Entwurf - Geeignet für Dokumentenscans und Bilder in guter Auflösung.
  • Hoch – Eignet sich gut für Dokumentenscans mit niedriger Auflösung. Erkennt zudem eine Vielzahl von Sprachen.

PDF-OCR-Aktion für Workflow-Automatisierung

Setzen Sie die Option „OCR bei Bedarf durchführen“ auf „true“, um die OCR nur auf Seiten auszuführen, die eine Zeichenerkennung erfordern, und bereits erkannte Inhalte zu ignorieren. Dadurch sparen Sie Verarbeitungszeit und Automatisierungsguthaben.

Option „OCR bei Bedarf“ für den Workflow

Aktion "Im Speicher speichern" hinzufügen​

Fügen Sie die Aktion zum Speichern der ausgegebenen PDF-Dateien hinzu. In diesem Beispiel wählen wir „ In Dropbox speichern“ . Konfigurieren Sie den Ordner, in dem Ihre verarbeiteten Dateien gespeichert werden sollen. Sobald die Konfigurationen abgeschlossen sind, können Sie den Workflow speichern und veröffentlichen . Ein Beispiel-Workflow sieht wie folgt aus.

Workflow-Aktion: Ausgabedateien in Dropbox speichern