Extraire du texte d'un PDF et le réutiliser ultérieurement grâce aux flux de travail.
30 juil. 2022 · Extrayez du texte d'un PDF et réutilisez-le partiellement ou intégralement. Automatisez ce processus grâce à l'action Extraire le texte des flux de travail PDF4me.
Les documents numériques remplacent rapidement les documents papier traditionnels. De nos jours, nous en recevons beaucoup au format PDF. Ces documents, tels que les contrats, les documents juridiques ou les livres numériques, peuvent contenir des centaines, voire des milliers de pages. Nous automatisons un grand nombre de ces documents. Il peut arriver que nous souhaitions copier du texte à partir d'une zone spécifique d'un PDF, ou encore utiliser ce texte ultérieurement lors du traitement du même document. PDF4me Workflows a la solution : elle prend en charge tous ces types de logiques documentaires.
Utilisez l'action Extraire du texte des flux de travail PDF4me pour automatiser l'extraction de données textuelles à partir de documents PDF. Vous pouvez ensuite utiliser des étapes supplémentaires pour réutiliser ces données, partiellement ou totalement, ultérieurement. Prenons l'exemple d'un flux de travail où nous extrayons du texte d'un document PDF et l'utilisons ensuite pour renommer le fichier.
01
Comment extraire du texte d'un PDF pour le réutiliser ?
Sans intégration supplémentaire, vous pouvez configurer un flux de travail pour extraire automatiquement le texte d'un PDF. Prenons l'exemple d'un flux de travail permettant d'automatiser l'extraction et le renommage du texte d'un PDF.
Ajoutez un déclencheur pour démarrer votre flux de travail.
Ajoutez un déclencheur pour lancer votre automatisation. Actuellement, les flux de travail proposent deux déclencheurs : Dropbox et Google Drive . Prenons l’exemple d’un déclencheur Dropbox.
Configurez la connexion et choisissez le dossier où les fichiers d'entrée sont attendus.
Ajouter une action Extraire le texte
Ajoutez l'action Extraire le texte et activez-la. Cette action extrait le texte intégral du PDF. Si vous souhaitez extraire le texte de chaque page séparément, ajoutez une action Fractionner le PDF avant l'action Extraire. Ajoutez également l'action Extraire le texte à l'intérieur du contrôle Pour chaque .
Ajouter une action Enregistrer
Les fichiers de sortie doivent être enregistrés dans le cloud. Dans notre cas, configurons une action « Enregistrer dans Dropbox » . Vous pouvez utiliser une expression régulière pour extraire un texte spécifique de l'action « Extraire du texte ». Copiez-collez l'expression régulière ci-dessous dans le paramètre « Nom du fichier de sortie » et ajoutez la condition pour qu'elle corresponde au texte recherché.
${file.pages[0].PageText.match(<condition>).pdf
L'expression transmettra le texte correspondant à la condition depuis le PDF et le transmettra au paramètre de nom de fichier de sortie afin que les fichiers soient renommés en fonction du texte lu.
Un échantillon à essayer
Examinons un flux de travail permettant d'extraire du texte d'un exemple de facture au format PDF et d'utiliser une partie spécifique de ce texte (le numéro de facture) pour renommer le fichier PDF avant de l'enregistrer dans le cloud.
Examinons brièvement les étapes -
Ajoutez et configurez le déclencheur de votre choix
Ajoutez l'espace de stockage sur lequel vous souhaitez enregistrer le fichier et, dans le paramètre de nom de fichier de sortie, transmettez l'expression régulière suivante :
Le flux de travail décrit ci-dessus extraira le texte du PDF, découpera la partie requise et renommera le fichier avant de l'enregistrer.
Préparez vos documents.
Intégrez-le à votre produit grâce à l'API, automatisez-le sans coder ou utilisez les outils gratuits directement dans votre navigateur. Aucune carte de crédit n'est requise pour commencer.
Commencez par un seul appelcurl -X POST https://api.pdf4me.com/v1/ConvertToPdf