Zum Hauptinhalt springen
Blog · Dokumentenautomatisierung

Automatische Sortierung und Umbenennung gescannter PDF-Dokumente

16. September 2021 · Sie haben viele gescannte Dokumente mit maschinell generierten Namen und falscher Sortierung? Sortieren und benennen Sie diese jetzt automatisch mit PDF4me Workflows um.

Die Dokumentenklassifizierung stellt seit Jahrzehnten in nahezu allen Branchen eine große Herausforderung dar und ist für diverse Geschäftsprozesse unerlässlich. Traditionell erfolgt sie manuell: Benutzer lesen die Dokumente und identifizieren die relevanten Themen, um sie zu klassifizieren. Obwohl die manuelle Kategorisierung eine präzisere Einteilung ermöglicht, ist sie äußerst zeitaufwendig und kostspielig.

Die Digitalisierung von Geschäftsprozessen hat den manuellen Aufwand im Laufe der Zeit erheblich reduziert und so zu einem schnelleren Wirtschaftswachstum beigetragen. Zahlreiche Tools und Services zur Dokumentenautomatisierung sind bereits auf dem Markt verfügbar und ermöglichen schnellere und skalierbare Geschäftsprozesse. Dazu gehört auch die beschleunigte Organisation großer Dokumentenmengen. Mit den Workflow-Funktionen von PDF4me lässt sich dieser Sortier- und Organisationsprozess automatisieren.

Um Ihnen das besser zu veranschaulichen, haben wir einen konkreten Anwendungsfall betrachtet.

  • Ermitteln Sie die Rechnungsnummer aus dem Dokument mithilfe regulärer Ausdrücke und benennen Sie die Datei entsprechend der Rechnungsnummer um. Eine detaillierte Schritt-für-Schritt-Anleitung erklärt dies.

In 3 einfachen Schritten können Sie Ihre Dokumente sortieren, umbenennen und in einem übersichtlichen Speicher ablegen.

Schritt 1: OCR nur bei Bedarf durchführen

Texterkennung in gescannten Dokumenten mit OCR

Dies wäre der erste Schritt Ihres Workflows mit PDF4me. Die PDF-OCR-Funktion ist eine leistungsstarke Funktion, die erkennt, ob es sich bei Ihrem Eingabedokument um ein gescanntes oder ein textbasiertes Dokument handelt, und die OCR nur bei Bedarf anwendet. OCR ist in der Regel etwas ressourcenintensiver als andere Funktionen, da sie dedizierte Ressourcen mit leistungsstarken OCR-Engines und zugehörigen Komponenten erfordert.

Im automatisierten Workflow kann es vorkommen, dass Sie OCR benötigen, wenn das Dokument ein Scan ist. Sie müssen nicht unnötig bezahlen, wenn OCR nicht erforderlich ist, beispielsweise wenn Ihr Dokument kein Scan enthält. Aktivieren Sie einfach die Option „OCR bei Bedarf durchführen“, wenn Sie eine OCR-Aktion in Ihren Workflow einfügen. Diese Aktion erzeugt nach der Konvertierung eine textbasierte PDF-Datei oder gibt dieselbe Datei zurück, wenn keine Konvertierung erforderlich ist.

Schritt 2: Extrahieren Sie den Text aus jeder Seite Ihres PDF-Dokuments.

Text nach der Erkennung mit OCR extrahieren

Die Workflow-Aktion „Text extrahieren“ überträgt den gesamten Seiteninhalt in den Datenkontext der nächsten Aktion. So können Sie Ihre Inhalte nach Belieben bearbeiten – beispielsweise bestimmte Textstellen analysieren, prüfen, ob der gewünschte Text gefunden wurde, den analysierten Text mit Ihrem benutzerdefinierten Text kombinieren und vieles mehr mithilfe von JavaScript-Ausdrücken. In diesem Beispiel wird versucht, die Rechnungsnummer einer online bezahlten Quittung zu ermitteln.

Beispielrechnung (PDF):

Eine Musterrechnung

Aus dieser PDF-Datei möchten wir die Rechnungsnummer extrahieren und mithilfe dieser Nummer die Datei umbenennen und sie schließlich im Cloud-Speicher „My Docs“ von PDF4me speichern.

Der Ausgabedatenkontext dieser Aktion enthält den Text im folgenden Format.

${file.pages[0].PageText}

[0] - Dies gibt die Seitenzahl ab Null an. Sie können eine beliebige Zahl einstellen, um den Seitentext aus einem beliebigen Seitenbereich Ihres PDF-Dokuments zu erhalten.

Fügen Sie wie folgt einen regulären Ausdruck hinzu, um eine Übereinstimmung im Datenkontext von PageText zu finden.

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}

Dies ist eine einfache JavaScript-Funktion, die einen regulären Ausdruck auf Ihre Datenkontextergebnisse anwendet. Dieser reguläre Ausdruck versucht, die Rechnungsnummer zusammen mit der Rechnungsbezeichnung zu finden.

Auf diese Weise können Sie JavaScript-Funktionen nutzen, um beliebige logische Funktionen anzuwenden, um Ihr Dokument zu identifizieren und eine Entscheidung zu treffen, es genauer und ohne manuellen Aufwand zu klassifizieren.

Schritt 3: Umbenennen und in „Eigene Dokumente“ speichern.

„In Meine Dokumente speichern“ ist eine PDF4me-Aktion, mit der Sie Ihr Dokument im PDF4me-Speicher ablegen können. Alternativ können Sie es auch in Ihrer Dropbox, per FTP oder Google Drive speichern. Für die Demonstration verwenden wir vorerst den Speicher „Meine Dokumente“ . Alle Speicheraktionen haben ein optionales Feld für den Ausgabedateinamen.

Dateien mit benutzerdefiniertem Namen in „Eigene Dokumente“ speichern

Sie können Ihren benutzerdefinierten Dateinamen mit einer beliebigen dynamischen Kombination festlegen, z. B. ${INV}-{UTCNOW()}.pdf. Dadurch werden Dokumente mit dem Präfix INV- und dem Suffix der aktuellen UTC-Zeit dynamisch erstellt. Sie haben die Kontrolle darüber, was, wie und wo Ihre Ausgabedokumente gespeichert werden. In unserem Beispiel müssen wir den Datenkontext zusammen mit einem regulären Ausdruck verwenden, um einen neuen Dateinamen zu generieren, wie unten dargestellt.

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}.pdf

Nach Ausführung dieser drei Schritte wird Ihr Dokument klassifiziert, umbenannt und am gewünschten Speicherort abgelegt. Wie einfach ist das denn jetzt für Sie? PDF4me denkt stets aus der Perspektive des Endnutzers und macht die Dokumentenverarbeitung so einfach wie möglich.

Erledigen Sie Ihre Dokumente.

Integrieren Sie es mit der API in Ihr Produkt, automatisieren Sie es ohne Programmierung oder nutzen Sie die kostenlosen Tools in Ihrem Browser. Keine Kreditkarte erforderlich.

Beginnen Sie mit einem einzigen Anrufcurl -X POST https://api.pdf4me.com/v1/ConvertToPdf

Kostenloses Angebot · Keine Kreditkarte erforderlich