Passa al contenuto principale
Blog · Automazione dei documenti

Ordina e rinomina automaticamente i documenti PDF scansionati

16 settembre 2021 · Hai molti documenti scansionati con nomi generati automaticamente e ordinamento errato? Ora puoi ordinarli e rinominarli automaticamente utilizzando i flussi di lavoro di PDF4me.

La classificazione dei documenti rappresenta da decenni una grande sfida in quasi tutti i settori ed è di fondamentale importanza in diversi processi aziendali. Tradizionalmente, questo processo viene svolto manualmente: gli operatori leggono i documenti e ne identificano l'argomento per classificarli. Sebbene il processo manuale consenta una categorizzazione più precisa, risulta essere estremamente dispendioso in termini di tempo e costi.

La digitalizzazione dei processi aziendali ha ridotto significativamente il lavoro manuale nel tempo, contribuendo a una crescita economica più rapida. Sul mercato sono già disponibili numerosi strumenti e servizi per l'automazione della gestione documentale, in grado di rendere i processi aziendali più veloci e facilmente scalabili. In questo contesto, l'organizzazione di grandi volumi di documenti che entrano nei processi aziendali deve essere più rapida. Il processo di smistamento e organizzazione può essere automatizzato grazie alle funzionalità di supporto offerte da PDF4me Workflow .

Per una migliore comprensione, abbiamo preso in esame un caso d'uso specifico.

  • Come trovare il numero di fattura nel documento utilizzando le espressioni regolari e rinominare il file con il numero di fattura, il tutto spiegato dettagliatamente passo dopo passo.

3 semplici passaggi per ordinare i documenti, rinominarli e salvarli in un archivio ben organizzato.

Passaggio 1: Eseguire l'OCR solo quando necessario

Riconosci il testo dai documenti scansionati tramite OCR

Questo rappresenta il primo passaggio del flusso di lavoro di PDF4me. La funzione OCR per PDF è una potente funzionalità in grado di rilevare se il documento di input è una scansione o un documento di testo, applicando l'OCR solo quando necessario. Solitamente, l'OCR è un po' più oneroso rispetto ad altre funzionalità, poiché richiede risorse dedicate dotate di potenti motori OCR e componenti correlati.

Nel flusso di lavoro automatizzato, potrebbero verificarsi situazioni in cui è necessario applicare l'OCR anche quando il documento è un'immagine scansionata. Non è necessario pagare inutilmente quando non è effettivamente necessario applicare l'OCR se il documento non contiene un'immagine scansionata. È sufficiente abilitare l'opzione "Esegui OCR quando necessario" quando si aggiunge l'azione OCR al flusso di lavoro. Questa azione produce un file PDF basato su testo dopo la conversione, oppure restituisce lo stesso file quando non è necessaria la conversione.

Passaggio 2: Estrai il testo da ogni pagina del tuo documento PDF

Estrazione del testo tramite riconoscimento ottico dei caratteri (OCR)

L'azione del flusso di lavoro "Estrai testo" porterà tutto il contenuto della pagina nel contesto dati dell'azione successiva. Ciò significa che potrai manipolare il contenuto come preferisci, ad esempio analizzare un testo specifico, verificare se il testo desiderato è stato trovato, combinare il testo analizzato con un testo personalizzato e molto altro ancora tramite espressioni JavaScript. In questo esempio, cercheremo di trovare il numero di fattura da una ricevuta di pagamento online.

Esempio di fattura in PDF:

Esempio di fattura

Da questo file PDF vogliamo estrarre il numero di fattura e, utilizzando questo numero, rinomineremo il file e lo salveremo infine nello spazio di archiviazione cloud "My Docs" di PDF4me.

Il contesto dei dati di output di questa azione conterrà il testo nel formato seguente.

${file.pages[0].PageText}

[0] - questo indica il numero di pagina a partire da zero, può essere impostato su qualsiasi numero per ottenere il testo della pagina da qualsiasi intervallo di pagine del documento PDF.

Aggiungi l'espressione regolare per trovare una corrispondenza nel contesto dei dati PageText come mostrato di seguito.

${file.pages[0].PageText.match(/Fattura\s ?[#-]\s [0-9]*/g)}

Questa è una semplice funzione JavaScript per applicare un'espressione regolare ai risultati del contesto dei dati. Questa espressione regolare cerca di trovare il numero di fattura insieme all'etichetta della fattura.

In questo modo, è possibile utilizzare le funzioni JavaScript per applicare qualsiasi funzione logica al fine di identificare il documento e prendere una decisione per classificarlo in modo più accurato e senza alcuno sforzo manuale.

Passaggio 3: rinomina e salva il file nella cartella Documenti.

"Salva in Documenti" è un'azione di PDF4me che consente di salvare il documento nello spazio di archiviazione di PDF4me. È possibile salvarlo anche su Dropbox, FTP o Google Drive. A scopo dimostrativo, per ora utilizziamo lo spazio di archiviazione "Documenti" . Tutte le azioni di salvataggio hanno un campo "Nome file di output", che è facoltativo.

Salva i file con un nome personalizzato in Documenti

È possibile impostare un nome file personalizzato con qualsiasi combinazione dinamica, ad esempio ${INV}-{UTCNOW()}.pdf. In questo modo, i documenti verranno generati con il prefisso INV- e il suffisso corrispondente all'ora UTC corrente, in modo dinamico. Avrete il controllo su cosa, come e dove archiviare i documenti di output. Nel nostro caso d'uso dimostrativo, dobbiamo inserire il contesto dati insieme all'espressione regolare per generare un nuovo nome file, come mostrato di seguito.

${file.pages[0].PageText.match(/Fattura\s ?[#-]\s [0-9]*/g)}.pdf

Dopo aver completato tutti e tre questi passaggi, il tuo documento verrà classificato, rinominato e salvato nella posizione di archiviazione desiderata. Facile, vero? PDF4me pensa sempre alle esigenze dell'utente finale e semplifica al massimo la gestione dei documenti.

Sbrigate le vostre pratiche burocratiche.

Integralo nel tuo prodotto tramite API, automatizzalo senza scrivere codice oppure utilizza gli strumenti gratuiti disponibili nel tuo browser. Non è richiesta alcuna carta di credito per iniziare.

Inizia con una singola chiamatacurl -X POST https://api.pdf4me.com/v1/ConvertToPdf

Livello gratuito · Non è richiesta la carta di credito