Saltar al contenido

Agente de Cumplimiento de Documentos (Google)

Descripción General

Jitterbit proporciona el Agente de Cumplimiento de Documentos (Google) a los clientes a través de Jitterbit Marketplace. Este agente automatiza el procesamiento de documentos enfocado en el cumplimiento al recuperar archivos PDF de Google Cloud Storage, extraer su contenido textual utilizando reconocimiento óptico de caracteres (OCR) y aplicar análisis impulsados por IA para detectar y eliminar información de identificación personal (PII), ayudando a las organizaciones a cumplir con los requisitos de privacidad de datos sin revisión manual de documentos.

El agente recupera archivos PDF de un bucket de origen configurado, se autentica con Google Cloud utilizando una cuenta de servicio y un token de acceso OAuth2 en caché, y envía cada archivo a Google Document AI para la extracción de OCR. Un LLM luego analiza el texto extraído en dos pasadas: una para identificar y almacenar datos PII, y otra para producir una versión saneada con toda la PII eliminada. Ambos archivos de salida se escriben en un servidor FTP, el PDF original se copia a un bucket de archivo separado en Google Cloud Storage y se elimina del origen, y se envían notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.

El agente realiza las siguientes tareas:

  • Se autentica con Google Cloud utilizando un JWT de cuenta de servicio y almacena en caché el token de acceso OAuth2 para reutilizarlo en ejecuciones de procesamiento.
  • Recupera una lista de archivos PDF de un bucket de origen configurado en Google Cloud Storage.
  • Envía cada archivo PDF a Google Document AI para la extracción de texto OCR y recopila el texto extraído completo.
  • Envía el texto extraído a un LLM para detectar y extraer datos PII, y escribe la salida en un archivo en un servidor FTP.
  • Envía el texto extraído al LLM para producir una versión limpia con toda la PII eliminada, y escribe la salida en un archivo en un servidor FTP.
  • Archiva los archivos PDF procesados en un bucket de Google Cloud Storage de destino configurado y elimina los originales del bucket de origen.
  • Envía notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.

Este documento explica cómo configurar y operar este agente de IA. Cubre arquitectura, requisitos previos y pasos para instalar, configurar y operar el agente de IA.

Arquitectura del agente de IA

Este agente de IA conecta Google Cloud Storage, Google Document AI, un LLM y un servidor FTP para extraer y sanitizar texto de documentos PDF. Un ciclo de procesamiento típico sigue estos pasos:

  1. La operación GCP Controller verifica la caché en busca de un token de acceso OAuth2 válido. Si no existe, activa la operación Generate AccessToken para autenticarse con Google Cloud utilizando las credenciales de la cuenta de servicio configurada.
  2. El agente se conecta al bucket de origen de Google Cloud Storage configurado y recupera una lista de archivos PDF disponibles.
  3. Para cada archivo, el agente envía el PDF a Google Document AI para la extracción de texto OCR y recopila el texto completo extraído.
  4. El agente envía el texto extraído al LLM con un aviso de detección de PII. Los datos de PII identificados se escriben como un archivo JSON en el servidor FTP.
  5. El agente envía el texto extraído al LLM con un aviso de limpieza de datos para producir una versión sanitizada. El texto limpio se escribe como un archivo JSON en el servidor FTP.
  6. El PDF procesado se copia al bucket de archivo de Google Cloud Storage de destino y luego se elimina del bucket de origen.
  7. Si algún paso en la canalización falla, se envía una notificación por correo electrónico a los destinatarios configurados con detalles del error.

Diagrama de flujo de trabajo

El siguiente diagrama muestra la principal canalización de procesamiento para el Agente de Cumplimiento de Documentos (Google).

--- config: flowchart: padding: 20 nodeSpacing: 80 --- flowchart LR classDef default fill:white, stroke:black, stroke-width:3px, rx:15px, ry:15px JSP@{ shape: hex, label: "
Document Compliance
Agent (Google)" } GCSSRC[fab:fa-google
Google Cloud Storage
Source Bucket] DOCAI[fab:fa-google
Google Document AI] LLM[fas:fa-brain
LLM] FTP[fas:fa-server
FTP Server] GCSARC[fab:fa-google
Google Cloud Storage
Archive Bucket] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| GCSSRC JSP <-->|2. OCR request / extracted text| DOCAI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| FTP JSP -->|6. Archive and delete PDF| GCSARC JSP -->|7. Error notification| EMAIL

Requisitos previos

Necesitas los siguientes componentes para utilizar este agente de IA.

Componentes de Harmony

Debes tener una licencia de Jitterbit Harmony con acceso a los siguientes componentes:

  • Jitterbit Studio
  • Agente de Cumplimiento de Documentos (Google) adquirido como un complemento de licencia

Endpoints compatibles

El agente de IA se conecta a los siguientes endpoints. Se pueden acomodar otros sistemas modificando las configuraciones de endpoints y flujos de trabajo del proyecto.

Modelo de lenguaje grande (LLM)

El agente utiliza Google Vertex AI para acceder a modelos de lenguaje grandes para la detección de PII y la sanitización de datos. El proyecto está configurado para usar Gemini 2.5 Flash por defecto. Se puede sustituir otro modelo compatible con Vertex AI actualizando la variable del proyecto GCP_Model. Se debe tener un proyecto de Google Cloud con la API de Vertex AI habilitada y una cuenta de servicio con el rol de Usuario de Vertex AI.

Google Cloud Storage

El agente utiliza Google Cloud Storage tanto como fuente de PDF como destino de archivo. Se debe tener un proyecto de Google Cloud con la API de Cloud Storage habilitada, dos buckets de Cloud Storage configurados (uno para archivos PDF entrantes y otro para archivar archivos procesados), y una cuenta de servicio con el rol de Administrador de Objetos de Almacenamiento en ambos buckets.

Google Document AI

El agente utiliza Google Document AI para la extracción de texto OCR de archivos PDF. Se debe tener la API de Cloud Document AI habilitada en el proyecto de Google Cloud, un procesador de Document AI creado, y una cuenta de servicio con el rol de Usuario de la API de Document AI.

FTP

El agente escribe archivos de salida procesados (datos de PII y texto limpio) en un servidor FTP. Se debe tener un servidor FTP accesible desde Jitterbit con credenciales de conexión válidas.

Correo electrónico

El agente envía notificaciones de error a través de correo electrónico SMTP. La configuración predeterminada utiliza Gmail (smtp.gmail.com). Se debe tener una cuenta de correo electrónico de remitente con acceso SMTP habilitado y, si se utiliza Gmail, una contraseña de aplicación configurada.

Instalación, configuración y operación

Sigue estos pasos para instalar, configurar y operar este agente de IA:

  1. Descargar e instalar el proyecto
  2. Configurar recursos de GCP
  3. Configurar variables del proyecto
  4. Probar conexiones
  5. Desplegar el proyecto
  6. Revisar flujos de trabajo del proyecto
  7. Activar los flujos de trabajo del proyecto

Para obtener orientación sobre la resolución de problemas, consulte Resolución de problemas.

Descargar e instalar el proyecto

Siga estos pasos para instalar el proyecto de Studio para el agente de IA:

  1. Inicie sesión en el portal de Harmony en https://login.jitterbit.com y abra Marketplace.

  2. Localice el agente de IA llamado Document Compliance Agent (Google). Para localizar el agente, utilice la barra de búsqueda o, en el panel de Filtros bajo Tipo, seleccione Agente de IA para limitar la visualización a agentes de IA.

  3. Haga clic en el enlace de Documentación del agente para abrir su documentación en una pestaña separada. Mantenga la pestaña abierta para consultarla después de iniciar el proyecto.

  4. Haga clic en Iniciar Proyecto para abrir un cuadro de diálogo de configuración.

    Nota

    Si aún no ha comprado el agente de IA, se mostrará Obtenga este agente en su lugar. Haga clic en él para abrir un cuadro de diálogo informativo, luego haga clic en Enviar para que un representante se comunique con usted sobre la compra del agente de IA.

    Consejo

    El cuadro de diálogo de configuración incluye una advertencia de no importar la plantilla antes de aplicar personalizaciones de punto final. Esa advertencia no se aplica a este agente de IA y se puede ignorar. Siga el orden recomendado de pasos en esta documentación en su lugar.

  5. En el cuadro de diálogo Crear un Nuevo Proyecto, seleccione un entorno donde se creará el proyecto de Studio, luego haga clic en Crear Proyecto.

  6. Después de que el cuadro de diálogo de progreso indique que el proyecto ha sido creado, utilice el enlace del cuadro de diálogo Ir a Studio o abra el proyecto directamente desde la página de Proyectos de Studio.

Configurar recursos de GCP

Antes de configurar las variables del proyecto, configure los recursos requeridos de Google Cloud Platform.

Habilitar APIs requeridas

  1. Abra la Consola de Google Cloud y seleccione su proyecto.

  2. Abra el menú de navegación y vaya a APIs y Servicios > Biblioteca.

  3. Busque y habilite cada una de las siguientes APIs:

    • API de Cloud Storage
    • API de Cloud Document AI
    • API de Vertex AI

Crear una cuenta de servicio

  1. En la Consola de Google Cloud, abre IAM y Admin > Cuentas de servicio y haz clic en Crear cuenta de servicio.

  2. Ingresa un nombre para la cuenta de servicio, luego haz clic en Crear y continuar.

  3. Asigna los siguientes roles de IAM a la cuenta de servicio:

    • Administrador de objetos de almacenamiento (requerido para leer, archivar y eliminar archivos en ambos buckets de Cloud Storage)
    • Usuario de la API de Document AI (requerido para la extracción de texto OCR)
    • Usuario de Vertex AI (requerido para la inferencia de LLM)
  4. Haz clic en Listo para crear la cuenta de servicio.

  5. En la lista de cuentas de servicio, haz clic en la cuenta de servicio que acabas de crear. Abre la pestaña Claves, haz clic en Agregar clave > Crear nueva clave, selecciona JSON y haz clic en Crear. El archivo de clave se descarga automáticamente.

  6. Abre el archivo de clave JSON descargado y anota los siguientes valores para usarlos en las variables del proyecto:

    • El valor de client_email se asigna a la variable del proyecto GCP_clientEmail.
    • El valor de private_key se asigna a la variable del proyecto GCP_privateKey.
    • El valor de private_key_id se asigna a la variable del proyecto GCP_privateKeyId.

Crear buckets de Cloud Storage

  1. En la Consola de Google Cloud, abre Cloud Storage > Buckets y haz clic en Crear.

  2. Crea el bucket de origen donde se colocarán los archivos PDF para su procesamiento. Anota el nombre del bucket para la variable del proyecto GCP_Get_BucketName.

  3. Crea un segundo bucket que sirva como destino de archivo para los archivos procesados. Anota su nombre para la variable del proyecto GCP_Archive_BucketName.

  4. Asegúrate de que ambos buckets estén en la misma región de Google Cloud.

Crear un procesador de Document AI

  1. En la Consola de Google Cloud, abre Document AI > Mis procesadores y haz clic en Crear procesador.

  2. Selecciona Document OCR como el tipo de procesador.

  3. Ingresa un nombre para el procesador, selecciona una región y haz clic en Crear. Anota la región para la variable del proyecto GCP_DocumentAI_Location.

  4. Después de que se cree el procesador, copia el ID del procesador de la página de detalles del procesador. Usa este valor para la variable del proyecto GCP_Processor_ID.

Configurar variables del proyecto

En el proyecto de Studio instalado desde Marketplace, establece valores para las siguientes variables del proyecto.

Para configurar las variables del proyecto, utiliza el menú de acciones del proyecto y selecciona Variables del Proyecto para abrir el panel de configuración.

Google Cloud Platform

Nombre de la variable Descripción
GCP_Project_ID ID del proyecto de Google Cloud.
GCP_clientEmail Dirección de correo electrónico de la cuenta de servicio desde la clave JSON de la cuenta de servicio.
GCP_privateKeyId ID de la clave privada de la clave JSON de la cuenta de servicio.
GCP_privateKey Clave privada de la clave JSON de la cuenta de servicio en formato PEM.
GCP_tokenURI URI del endpoint de token OAuth2 para autenticarse con Google Cloud. Usa el valor predeterminado: https://oauth2.googleapis.com/token.
GCP_scope Alcance OAuth2 para la cuenta de servicio. Usa el valor predeterminado: https://www.googleapis.com/auth/cloud-platform.

Google Document AI

Nombre de la variable Descripción
GCP_DocumentAI_Location Código de ubicación para la API de Document AI (por ejemplo, us).
GCP_Processor_ID ID del procesador de Document AI. Consulta Crear un procesador de Document AI.

Google Vertex AI

Nombre de la variable Descripción
GCP_VertexAI_Location Región de Vertex AI (por ejemplo, us-central1).
GCP_Model Nombre del modelo Gemini utilizado para la detección de PII y la sanitización de datos (por ejemplo, gemini-2.5-flash).
GCP_temperature Temperatura de muestreo de LLM. Valores más bajos producen respuestas más deterministas (por ejemplo, 0.1).
GCP_maxOutputTokens Número máximo de tokens en la respuesta de LLM (por ejemplo, 8192).

Google Cloud Storage

Nombre de la variable Descripción
GCP_Get_BucketName Nombre del bucket de origen de Google Cloud Storage donde se colocan los archivos PDF para su procesamiento.
GCP_Archive_BucketName Nombre del bucket de archivo de Google Cloud Storage donde se mueven los archivos procesados después del análisis.

FTP

Nombre de variable Descripción
FTP_Host Nombre de host del servidor FTP.
FTP_UserName Nombre de usuario FTP.
FTP_Password Contraseña FTP.
FTP_File_Path Ruta de la carpeta de destino FTP (por ejemplo, /PDF_Parser/).

Email

Nombre de variable Descripción
SMTP_Host Nombre de host del servidor SMTP para enviar notificaciones de error (por ejemplo, smtp.gmail.com).
SMTP_Username Nombre de usuario SMTP.
SMTP_Password Contraseña SMTP. Para Gmail, genera una contraseña de aplicación en la configuración de seguridad de tu cuenta de Google.
Email_From_Recipients Dirección de correo electrónico del remitente para los mensajes de notificación de error.
Email_To_Recipients Dirección(es) de correo electrónico del(os) destinatario(s) para los mensajes de notificación de error.

Agent

Nombre de variable Descripción
debug Establecer en 1 para habilitar el registro de depuración o 0 para deshabilitarlo.

Probar conexiones

Probar las configuraciones de los puntos finales para verificar la conectividad utilizando los valores de variables del proyecto definidos.

Para probar conexiones, ve a la pestaña Puntos finales y conectores del proyecto en la paleta de componentes de diseño, pasa el cursor sobre cada punto final y haz clic en Probar.

Desplegar el proyecto

Desplegar el proyecto de Studio.

Para desplegar el proyecto, utiliza el menú de acciones del proyecto y selecciona Desplegar.

Revisar flujos de trabajo del proyecto

El proyecto de Studio contiene un flujo de trabajo que implementa el pipeline de procesamiento del Agente de Cumplimiento de Documentos (Google).

GCP PDF Parser

Operación Descripción
GCP Controller Verifica la caché en busca de un token de acceso válido e inicializa el pipeline de procesamiento.
Generate AccessToken Se autentica con Google Cloud utilizando credenciales de cuenta de servicio y recupera un token de acceso OAuth2.
Read List of PDFs from Google Cloud Storage Recupera una lista de archivos PDF disponibles del bucket de Cloud Storage de origen.
Extract data from PDF using Google Document_AI Envía un archivo PDF a Google Document AI para la extracción de texto OCR.
Extract PII data using Google Vertex_AI Envía el texto extraído al LLM para detectar y extraer datos PII, luego escribe el resultado en el servidor FTP.
Extract Non_PII data using Google Vertex_AI Envía el texto extraído al LLM para producir una versión sanitizada sin PII, luego escribe el resultado en el servidor FTP.
Send File to FTP Escribe una carga útil JSON procesada en el destino del servidor FTP configurado.
Copy PDFs from Google Cloud Storage Copia el PDF procesado del bucket de origen al bucket de archivo.
Delete PDFs from Google Cloud Storage Elimina el PDF procesado del bucket de origen después de haber sido archivado.
Error Notification Envía una notificación por correo electrónico con detalles del error cuando ocurre una falla en el procesamiento.
GCP Controller

La operación GCP Controller sirve como el punto de entrada para el flujo de trabajo. Verifica la caché en busca de un token de acceso OAuth2 existente. Si se encuentra un token válido, el flujo de trabajo procede directamente a leer archivos PDF desde Cloud Storage. Si no existe un token, la operación activa Generate AccessToken para obtener uno antes de continuar.

Generate AccessToken

La operación Generate AccessToken autentica al agente con Google Cloud utilizando las credenciales de la cuenta de servicio configurada. Construye un JWT a partir de la clave privada de la cuenta de servicio, lo firma y lo intercambia con el punto final del token OAuth2 de Google para recuperar un token de acceso. El token se almacena en caché para su reutilización en operaciones posteriores.

Read List of PDFs from Google Cloud Storage

La operación Read List of PDFs from Google Cloud Storage envía una solicitud HTTP autenticada a la API de Cloud Storage para recuperar una lista de nombres de archivos PDF en el bucket de origen. La operación itera a través de la lista devuelta, activando el pipeline de extracción para cada archivo.

Extract data from PDF using Google Document_AI

La operación Extract data from PDF using Google Document_AI envía el archivo PDF a la API de Google Document AI utilizando el procesador configurado. La API devuelve el contenido de texto extraído, que la operación almacena para su uso en los pasos de análisis LLM posteriores.

Extract PII data using Google Vertex_AI

La operación Extract PII data using Google Vertex_AI envía el texto del documento extraído al modelo Gemini configurado a través de la API de Vertex AI con un aviso para identificar y extraer información personal identificable. La respuesta del LLM se analiza y limpia, y luego se pasa a la operación Send File to FTP para su entrega al destino FTP configurado.

Extract Non_PII data using Google Vertex_AI

La operación Extract Non_PII data using Google Vertex_AI envía el texto del documento extraído al modelo Gemini a través de la API de Vertex AI con un aviso para producir una versión saneada con toda la PII eliminada. La respuesta limpia se pasa a la operación Send File to FTP para su entrega al destino FTP configurado.

Enviar archivo a FTP

La operación Enviar archivo a FTP escribe la carga útil JSON procesada en el servidor FTP en la ruta configurada por la variable de proyecto FTP_File_Path. Esta operación se llama una vez para la salida de PII y una vez para la salida de no-PII para cada archivo PDF procesado.

Copiar PDFs desde Google Cloud Storage

La operación Copiar PDFs desde Google Cloud Storage utiliza la API de Cloud Storage para copiar el PDF procesado del bucket de origen al bucket de archivo, creando un registro permanente del archivo procesado.

Eliminar PDFs desde Google Cloud Storage

La operación Eliminar PDFs desde Google Cloud Storage envía una solicitud DELETE autenticada a la API de Cloud Storage para eliminar el PDF procesado del bucket de origen después de que ha sido archivado con éxito, evitando que se reprocesen en ejecuciones posteriores.

Notificación de error

La operación Notificación de error construye un correo electrónico de error con el nombre del flujo de trabajo, la marca de tiempo y los detalles del error, y luego lo envía a las direcciones configuradas en la variable de proyecto Email_To_Recipients. Después de enviar la notificación, la operación genera el error para detener la ejecución posterior.

Activar los flujos de trabajo del proyecto

Para ejecutar el Agente de Cumplimiento de Documentos (Google), despliega y ejecuta la operación GCP Controller. En Studio, pasa el cursor sobre la operación y haz clic en el ícono de Desplegar y Ejecutar en la esquina superior derecha del mosaico de la operación.

Para automatizar el pipeline, configura programaciones de operaciones en la operación GCP Controller para que se ejecute con la frecuencia que prefieras.

Solución de problemas

Si encuentras problemas, revisa los registros de operaciones para obtener información detallada sobre la solución de problemas.

Para asistencia adicional, contacta a soporte de Jitterbit.