Saltar al contenido principal

Extrae texto de un PDF y reutilízalo posteriormente mediante flujos de trabajo.

4 min read
PDF4me Team

Los documentos digitales están reemplazando rápidamente a los documentos en papel tradicionales. Hoy en día, recibimos muchos en formato PDF. Documentos como contratos, documentos legales o libros digitales pueden contener cientos o miles de páginas. Automatizamos muchos de estos documentos. Es posible que necesitemos copiar texto de un área específica de un PDF o que tengamos que usar ese texto posteriormente durante el procesamiento del documento. Tenemos la solución. Las acciones de PDF4me Workflows se adaptan a todas estas necesidades de gestión de documentos.

Utilice la acción «Extraer texto» de los flujos de trabajo de PDF4me para automatizar la extracción de texto de documentos PDF. Además, puede añadir pasos adicionales para reutilizar estos datos, parcial o totalmente, posteriormente. Veamos un ejemplo de flujo de trabajo donde extraemos texto de un documento PDF y lo utilizamos para renombrar el archivo.

¿Cómo extraer texto de un PDF para reutilizarlo?​

Sin necesidad de integración adicional, puedes configurar un flujo de trabajo para extraer automáticamente texto de un PDF. Veamos, con un ejemplo de flujo de trabajo, cómo automatizar la extracción y el cambio de nombre del texto de un PDF.

Agrega un activador para iniciar tu flujo de trabajo.​

Agrega un activador para iniciar tu automatización. Actualmente, Workflows ofrece dos activadores: Dropbox y Google Drive . Por ejemplo, vamos a crear un activador para Dropbox.

Configure la conexión y elija la carpeta donde se esperan los archivos de entrada.

Activador de Dropbox para la acción de extracción de texto

Agregar acción de extracción de texto​

Agregue la acción Extraer texto y habilítela. Esta acción extrae el texto completo del PDF. Si desea extraer el texto de cada página por separado, agregue la acción Dividir PDF antes de la acción Extraer. Además, agregue la acción Extraer texto dentro del control Para cada .

Agregar y habilitar la acción Extraer texto

Agregar una acción de guardar​

Los archivos de salida debían guardarse en el almacenamiento en la nube. En nuestro caso, configuraremos la acción "Guardar en Dropbox" . Puedes usar una expresión regular para obtener un texto específico de la acción "Extraer texto". Copia y pega la expresión regular que se muestra a continuación en el parámetro "Nombre del archivo de salida" y agrega la condición para que coincida con el texto requerido.

${file.pages[0].PageText.match(<condition>).pdf

Guardar acción de Dropbox con expresión regular

La expresión pasará el texto que coincida con la condición del PDF y lo asignará al parámetro de nombre de archivo de salida para que los archivos se renombren en función del texto leído.

Una muestra para probar​

Veamos un flujo de trabajo para extraer texto de una factura en formato PDF de ejemplo y utilizar una parte específica del texto (el número de factura) para cambiar el nombre del archivo PDF antes de guardarlo en la nube.

Veamos brevemente los pasos:

  1. Agregue y configure el activador que prefiera.
  2. Agrega la acción Extraer texto y habilítala.
  3. Cargue la factura PDF de muestra en la carpeta de origen del activador - Descargar archivo de muestra
  4. Agregue el almacenamiento en el que desea guardar el archivo y en el parámetro del nombre del archivo de salida, pase la siguiente expresión regular:

${file.pages[0].PageText.match('FACTURA #(.*)')[1].trim()}.pdf

Ejemplo de flujo de trabajo para extraer texto y renombrar archivos PDF

El flujo de trabajo descrito anteriormente extraerá el texto del PDF, recortará la parte necesaria y renombrará el archivo con el mismo nombre antes de guardarlo en el almacenamiento.