Aller au contenu principal
Blog · Automatisation des documents

Trier et renommer automatiquement les documents PDF numérisés

16 sept. 2021 · Vous avez de nombreux documents numérisés avec des noms générés automatiquement et un tri incorrect ? Désormais, triez et renommez-les automatiquement grâce aux flux de travail PDF4me.

La classification des documents représente un défi majeur depuis des décennies dans presque tous les secteurs d'activité et s'avère essentielle à de nombreux processus métier. Traditionnellement, ce processus est manuel : les utilisateurs lisent les documents et identifient leur sujet afin de les classer. Bien que cette méthode manuelle permette une catégorisation plus précise, elle est extrêmement chronophage et coûteuse.

La numérisation des processus métier a considérablement réduit les tâches manuelles au fil du temps, contribuant ainsi à une croissance économique plus rapide. De nombreux outils et services d'automatisation du traitement documentaire sont déjà disponibles sur le marché, permettant d'accélérer et de rendre plus facilement adaptables les processus métier. Dans ce contexte, il est essentiel d'optimiser l'organisation des volumes importants de documents entrant dans vos processus métier. Le tri et l'organisation de ces documents peuvent être automatisés grâce aux fonctionnalités dédiées de PDF4me Workflow .

Pour une meilleure compréhension, nous avons pris un cas d'utilisation spécifique.

  • Trouvez le numéro de facture dans le document à l'aide d'expressions régulières et renommez le fichier avec ce numéro ; la procédure est expliquée étape par étape en détail.

3 étapes faciles pour trier vos documents, les renommer et les enregistrer dans un espace de stockage bien organisé.

Étape 1 : Effectuer la reconnaissance optique de caractères (OCR) uniquement lorsque cela est nécessaire.

Reconnaître le texte de documents numérisés grâce à la reconnaissance optique de caractères (OCR)

Il s'agit de la toute première étape de votre flux de travail depuis PDF4me. La reconnaissance optique de caractères (OCR) PDF est une fonctionnalité puissante capable de détecter si votre document d'entrée est un document numérisé ou un document texte, et d'appliquer l'OCR uniquement lorsque cela est nécessaire. L'OCR est généralement plus coûteuse que les autres fonctionnalités, car elle nécessite des ressources dédiées, notamment des moteurs OCR performants et les composants associés.

Dans un flux de travail automatisé, il peut arriver que la reconnaissance optique de caractères (OCR) soit nécessaire, même pour des documents numérisés. Inutile de payer pour une OCR si votre document n'est pas numérisé : activez simplement l'option « OCR si nécessaire » lors de l'ajout de l'action OCR à votre flux de travail. Cette action génère un fichier PDF en texte brut après conversion, ou renvoie le fichier original si aucune conversion n'est requise.

Étape 2 : Extraire le texte de chaque page de votre document PDF

Extraction de texte après reconnaissance optique de caractères (OCR)

L'action de workflow « Extraire du texte » transfère tout le contenu de votre page au contexte de données de votre prochaine action. Vous pouvez ainsi manipuler votre contenu à votre guise : analyser un texte spécifique, vérifier si le texte recherché est présent, combiner le texte analysé avec votre texte personnalisé, et bien plus encore grâce aux expressions JavaScript. Dans cet exemple, nous allons rechercher le numéro de facture sur un reçu de paiement en ligne.

Exemple de facture PDF :

Exemple de facture

À partir de ce fichier PDF, nous voulons extraire le numéro de facture et, à l'aide de ce numéro, renommer le fichier et le stocker enfin dans le stockage cloud « Mes documents » de PDF4me.

Les données de sortie de cette action contiendront le texte au format ci-dessous.

${file.pages[0].PageText}

[0] - ceci indique le numéro de page commençant à zéro, il peut être défini sur n'importe quel nombre pour obtenir le texte de la page à partir de n'importe quelle plage de pages de votre document PDF.

Ajoutez une expression régulière pour trouver une correspondance dans le contexte de données PageText, comme ci-dessous.

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}

Il s'agit d'une fonction JavaScript simple permettant d'appliquer une expression régulière aux résultats de vos données. Cette expression régulière recherche le numéro de facture ainsi que son libellé.

Ainsi, vous pouvez utiliser des fonctions JavaScript pour appliquer des fonctions logiques afin d'identifier votre document et de décider de sa classification avec plus de précision et sans intervention manuelle.

Étape 3 : Renommez-le et enregistrez-le dans Mon espace de stockage de documents

« Enregistrer dans Mes Documents » est une action PDF4me qui vous permet d'enregistrer votre document dans l'espace de stockage PDF4me. Vous pouvez également l'enregistrer dans votre Dropbox, via FTP ou Google Drive. À titre d'exemple, nous utilisons l'espace de stockage Mes Documents . Toutes les actions d'enregistrement comportent un champ « Nom du fichier de sortie », qui est facultatif.

Enregistrez les fichiers avec un nom personnalisé dans Mes documents

Vous pouvez définir un nom de fichier personnalisé avec n'importe quelle combinaison dynamique, par exemple : `${INV}-{UTCNOW()}.pdf`. Les documents générés commenceront par `INV-` et se termineront par l'heure UTC actuelle, mise à jour dynamiquement. Vous contrôlez ainsi le contenu, le format et l'emplacement de stockage de vos documents. Dans notre exemple, nous devons fournir le contexte de données ainsi qu'une expression régulière pour générer un nouveau nom de fichier, comme ci-dessous.

${file.pages[0].PageText.match(/Invoice\s ?[#-]\s [0-9]*/g)}.pdf

Après avoir suivi ces trois étapes, votre document sera classé, renommé et enregistré à l'emplacement de votre choix. N'est-ce pas simple ? PDF4me privilégie toujours le point de vue de l'utilisateur et lui simplifie la vie dans le traitement des documents.

Préparez vos documents.

Intégrez-le à votre produit grâce à l'API, automatisez-le sans coder ou utilisez les outils gratuits directement dans votre navigateur. Aucune carte de crédit n'est requise pour commencer.

Commencez par un seul appelcurl -X POST https://api.pdf4me.com/v1/ConvertToPdf

Niveau gratuit · Aucune carte de crédit requise