La clasificación de documentos ha sido un gran desafío durante décadas en casi todos los sectores, y resulta fundamental para diversos procesos empresariales. Tradicionalmente, este proceso se realiza manualmente: los usuarios leen el documento e identifican el tema para clasificarlo. Si bien el proceso manual permite una categorización más precisa, consume mucho tiempo y resulta muy costoso.
La digitalización de los procesos empresariales ha reducido significativamente el trabajo manual a lo largo del tiempo, lo que ha impulsado un crecimiento económico más rápido. Existen numerosas herramientas y servicios de automatización de documentos disponibles en el mercado que facilitan la agilización y escalabilidad de los procesos empresariales. En este contexto, la organización de grandes volúmenes de documentos debe ser más rápida. El proceso de clasificación y organización se puede automatizar mediante las funciones de soporte de PDF4me Workflow .
Para que lo entienda mejor, hemos tomado un caso de uso específico.
- Encontrar el número de factura en el documento utilizando expresiones regulares y renombrar el archivo con el número de factura, explicado paso a paso en detalle.
3 sencillos pasos para organizar tus documentos, cambiarles el nombre y guardarlos en un almacenamiento bien organizado.
Paso 1: Realice el OCR solo cuando sea necesario.
Este sería el primer paso de tu flujo de trabajo con PDF4me. La función OCR para PDF es muy útil, ya que detecta si el documento de entrada es escaneado o de texto plano y aplica el OCR solo cuando es necesario. Generalmente, el OCR es más costoso que otras funciones, pues requiere recursos específicos, como potentes motores de OCR y componentes relacionados.
En el flujo de trabajo de automatización, puede que necesites usar OCR cuando el documento sea una imagen escaneada. No pagues innecesariamente si no necesitas aplicar OCR cuando tu documento no contiene una imagen escaneada. Simplemente habilita la opción "Realizar OCR cuando sea necesario" al agregar la acción de OCR a tu flujo de trabajo. Esta acción genera un archivo PDF de texto después de la conversión o devuelve el mismo archivo cuando no requiere conversión.
Paso 2: Extraiga el texto de cada página de su documento PDF.
La acción de flujo de trabajo «Extraer texto» transferirá todo el contenido de tu página al contexto de datos de tu próxima acción. Esto significa que puedes manipular el contenido como quieras: analizar texto específico, comprobar si se encuentra el texto deseado, combinar el texto analizado con texto personalizado y mucho más mediante expresiones JavaScript. En este ejemplo, intentaremos encontrar el número de factura en un recibo de pago en línea.
Ejemplo de factura en PDF:
A partir de este archivo PDF, queremos extraer el número de factura y, utilizando este número, cambiaremos el nombre del archivo y lo almacenaremos finalmente en el almacenamiento en la nube My Docs de PDF4me.
El contexto de datos de salida de esta acción contendrá el texto en el siguiente formato.
${file.pages[0].PageText}
[0] - esto indica el número de página comenzando desde cero, se puede establecer en cualquier número para obtener el texto de la página de cualquier rango de páginas de su documento PDF.
Agregue la expresión regular para encontrar una coincidencia en el contexto de datos PageText como se muestra a continuación.
${file.pages[0].PageText.match(/Invoice\\s _?[#-]\\s_ [0-9]*/g)}
Esta es una función JavaScript sencilla para aplicar expresiones regulares a los resultados de tu contexto de datos. Esta expresión regular busca el número de factura junto con la etiqueta de la factura.
De esta forma, puedes utilizar funciones de JavaScript para aplicar cualquier función lógica que permita identificar tu documento y tomar una decisión para clasificarlo con mayor precisión y sin ningún esfuerzo manual.
Paso 3: Cámbiele el nombre y guárdelo en Almacenamiento de documentos.
La acción «Guardar en MyDoc» de PDF4me te permite guardar tu documento en el almacenamiento de PDF4me. También puedes guardarlo en Dropbox, FTP o Google Drive. Para esta demostración, usaremos el almacenamiento de My Docs . Todas las acciones de guardar incluyen el campo «Nombre del archivo de salida», que no es obligatorio.
Puedes configurar tu nombre de archivo personalizado con cualquier combinación dinámica, como ${INV}-{UTCNOW()}.pdf. Esto generará documentos con el prefijo INV- y el sufijo de la hora UTC actual de forma dinámica. Tú controlas qué, cómo y dónde se almacenan tus documentos de salida. En nuestro caso de uso de demostración, necesitamos colocar el contexto de datos junto con una expresión regular para generar un nuevo nombre de archivo como el que se muestra a continuación.
${file.pages[0].PageText.match(/Invoice\\s _?[#-]\\s_ [0-9]*/g)}.pdf
Tras completar estos tres pasos, su documento se clasificará, renombrará y almacenará en la ubicación que usted elija. ¿Verdad que es fácil? PDF4me siempre piensa desde la perspectiva del usuario final y le facilita enormemente la gestión de documentos.
