Classifique e renomeie automaticamente documentos PDF digitalizados.
16 de set. de 2021 · Tem muitos documentos digitalizados com nomes gerados por máquina e classificação incorreta? Agora, classifique e renomeie-os automaticamente usando os fluxos de trabalho do PDF4me.
A classificação de documentos é um grande desafio há muitas décadas em quase todos os setores, sendo de suma importância em diversos processos de negócios. Tradicionalmente, esse processo é realizado manualmente, com usuários lendo o documento e identificando o assunto para classificá-lo. Embora o processo manual contribua para uma categorização mais precisa, ele é bastante demorado e dispendioso.
A digitalização dos processos de negócios reduziu significativamente o esforço manual ao longo do tempo, resultando em um crescimento econômico mais acelerado. Existem diversas ferramentas e serviços de automação de documentos disponíveis no mercado que podem tornar os processos de negócios mais rápidos e escaláveis. Nesse contexto, a organização de grandes volumes de documentos que chegam ao seu negócio precisa ser mais ágil. O processo de classificação e organização pode ser automatizado com recursos adicionais, como o Workflow do PDF4me .
Para melhor compreensão, apresentamos um caso de uso específico.
Encontre o número da fatura no documento usando expressões regulares e renomeie o arquivo com o número da fatura. O processo é explicado passo a passo em detalhes.
01
3 passos simples para organizar seus documentos, renomeá-los e salvá-los em um local de armazenamento bem organizado.
Passo 1: Execute o OCR somente quando necessário.
Este seria o primeiro passo do seu fluxo de trabalho com o PDF4me. A função OCR de PDF é um recurso poderoso que detecta se o documento de entrada é um documento digitalizado ou um documento baseado em texto, aplicando o OCR somente quando necessário. Geralmente, o OCR é um pouco mais caro do que outros recursos, pois envolve recursos dedicados com mecanismos de OCR potentes e componentes relacionados.
Em um fluxo de trabalho automatizado, pode haver situações em que você precise de OCR mesmo quando o documento for uma imagem digitalizada. Não há necessidade de pagar desnecessariamente quando o OCR não for realmente necessário e o documento não contiver uma imagem digitalizada. Basta habilitar a opção "Realizar OCR quando necessário" ao adicionar a ação de OCR ao seu fluxo de trabalho. Essa ação gera um arquivo PDF baseado em texto após a conversão ou retorna o mesmo arquivo quando a conversão não for necessária.
Passo 2: Extraia o texto de cada página do seu documento PDF.
A ação de fluxo de trabalho "Extrair Texto" trará todo o conteúdo da sua página para o contexto de dados da sua próxima ação. Isso significa que você pode manipular o conteúdo como quiser — como analisar um texto específico, verificar se o texto desejado foi encontrado, combinar o texto analisado com um texto personalizado e muito mais com expressões JavaScript. Neste exemplo, tentaremos encontrar o número da fatura em um recibo de pagamento online.
Exemplo de fatura em PDF:
A partir desse arquivo PDF, queremos extrair o número da fatura e, usando esse número, renomearemos o arquivo e o armazenaremos no armazenamento em nuvem " Meus Documentos" do PDF4me.
O contexto de dados de saída desta ação conterá o texto no formato abaixo.
${file.pages[0].PageText}
[0] - indica o número da página a partir de zero, podendo ser definido para qualquer número para obter o texto da página de qualquer intervalo de páginas do seu documento PDF.
Adicione uma expressão regular para encontrar uma correspondência no contexto de dados PageText, conforme abaixo.
Esta é uma função JavaScript simples para aplicar expressões regulares aos resultados do seu contexto de dados. Esta expressão regular tenta encontrar o número da fatura juntamente com o rótulo da fatura.
Dessa forma, você pode utilizar funções JavaScript para aplicar quaisquer funções lógicas a fim de identificar seu documento e tomar uma decisão para classificá-lo com mais precisão e sem qualquer esforço manual.
Passo 3: Renomeie e salve em Meus Documentos
Salvar em Meus Documentos é uma ação do PDF4me que permite salvar seu documento no armazenamento do PDF4me. Se preferir, também é possível armazená-lo no Dropbox, FTP ou Google Drive. Para fins de demonstração, usaremos o armazenamento Meus Documentos por enquanto. Todas as ações de salvar em possuem um campo "Nome do Arquivo de Saída", que é opcional.
Você pode definir seu nome de arquivo personalizado com qualquer combinação dinâmica, como ${INV}-{UTCNOW()}.pdf. Isso gerará documentos com o prefixo INV- e o horário UTC atual como sufixo, de forma dinâmica. Você controla o que, como e onde armazenar seus documentos de saída. Em nosso exemplo de uso, precisamos inserir o contexto de dados juntamente com uma expressão regular para gerar um novo nome de arquivo, como mostrado abaixo.
Após executar todas essas três etapas, seu documento será classificado, renomeado e armazenado no local de armazenamento de arquivos desejado. Viu como é fácil para você? Sim, o PDF4me sempre pensa na perspectiva do usuário final e torna a vida dele muito mais fácil no mundo do processamento de documentos.
Conclua seus documentos.
Integre-o ao seu produto com a API, automatize-o sem código ou use as ferramentas gratuitas no seu navegador. Não é necessário cartão de crédito para começar.
Comece com uma única chamadacurl -X POST https://api.pdf4me.com/v1/ConvertToPdf