Agente de Cumplimiento de Documentos (Google)
Descripción General
Jitterbit proporciona el Agente de Cumplimiento de Documentos (Google) a los clientes a través de Jitterbit Marketplace. Este agente automatiza el procesamiento de documentos enfocado en el cumplimiento al recuperar archivos PDF de Google Cloud Storage, extraer su contenido textual utilizando reconocimiento óptico de caracteres (OCR) y aplicar análisis impulsados por IA para detectar y eliminar información de identificación personal (PII), ayudando a las organizaciones a cumplir con los requisitos de privacidad de datos sin revisión manual de documentos.
El agente recupera archivos PDF de un bucket de origen configurado, se autentica con Google Cloud utilizando una cuenta de servicio y un token de acceso OAuth2 en caché, y envía cada archivo a Google Document AI para la extracción de OCR. Un LLM luego analiza el texto extraído en dos pasadas: una para identificar y almacenar datos PII, y otra para producir una versión saneada con toda la PII eliminada. Ambos archivos de salida se escriben en un servidor FTP, el PDF original se copia a un bucket de archivo separado en Google Cloud Storage y se elimina del origen, y se envían notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.
El agente realiza las siguientes tareas:
- Se autentica con Google Cloud utilizando un JWT de cuenta de servicio y almacena en caché el token de acceso OAuth2 para reutilizarlo en ejecuciones de procesamiento.
- Recupera una lista de archivos PDF de un bucket de origen configurado en Google Cloud Storage.
- Envía cada archivo PDF a Google Document AI para la extracción de texto OCR y recopila el texto extraído completo.
- Envía el texto extraído a un LLM para detectar y extraer datos PII, y escribe la salida en un archivo en un servidor FTP.
- Envía el texto extraído al LLM para producir una versión limpia con toda la PII eliminada, y escribe la salida en un archivo en un servidor FTP.
- Archiva los archivos PDF procesados en un bucket de Google Cloud Storage de destino configurado y elimina los originales del bucket de origen.
- Envía notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.
Este documento explica cómo configurar y operar este agente de IA. Cubre arquitectura, requisitos previos y pasos para instalar, configurar y operar el agente de IA.
Arquitectura del agente de IA
Este agente de IA conecta Google Cloud Storage, Google Document AI, un LLM y un servidor FTP para extraer y sanitizar texto de documentos PDF. Un ciclo de procesamiento típico sigue estos pasos:
- La operación
GCP Controllerverifica la caché en busca de un token de acceso OAuth2 válido. Si no existe, activa la operaciónGenerate AccessTokenpara autenticarse con Google Cloud utilizando las credenciales de la cuenta de servicio configurada. - El agente se conecta al bucket de origen de Google Cloud Storage configurado y recupera una lista de archivos PDF disponibles.
- Para cada archivo, el agente envía el PDF a Google Document AI para la extracción de texto OCR y recopila el texto completo extraído.
- El agente envía el texto extraído al LLM con un aviso de detección de PII. Los datos de PII identificados se escriben como un archivo JSON en el servidor FTP.
- El agente envía el texto extraído al LLM con un aviso de limpieza de datos para producir una versión sanitizada. El texto limpio se escribe como un archivo JSON en el servidor FTP.
- El PDF procesado se copia al bucket de archivo de Google Cloud Storage de destino y luego se elimina del bucket de origen.
- Si algún paso en la canalización falla, se envía una notificación por correo electrónico a los destinatarios configurados con detalles del error.
Diagrama de flujo de trabajo
El siguiente diagrama muestra la principal canalización de procesamiento para el Agente de Cumplimiento de Documentos (Google).
Document Compliance
Agent (Google)" } GCSSRC[fab:fa-google
Google Cloud Storage
Source Bucket] DOCAI[fab:fa-google
Google Document AI] LLM[fas:fa-brain
LLM] FTP[fas:fa-server
FTP Server] GCSARC[fab:fa-google
Google Cloud Storage
Archive Bucket] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| GCSSRC JSP <-->|2. OCR request / extracted text| DOCAI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| FTP JSP -->|6. Archive and delete PDF| GCSARC JSP -->|7. Error notification| EMAIL
Requisitos previos
Necesitas los siguientes componentes para utilizar este agente de IA.
Componentes de Harmony
Debes tener una licencia de Jitterbit Harmony con acceso a los siguientes componentes:
- Jitterbit Studio
- Agente de Cumplimiento de Documentos (Google) adquirido como un complemento de licencia
Endpoints compatibles
El agente de IA se conecta a los siguientes endpoints. Se pueden acomodar otros sistemas modificando las configuraciones de endpoints y flujos de trabajo del proyecto.
Modelo de lenguaje grande (LLM)
El agente utiliza Google Vertex AI para acceder a modelos de lenguaje grandes para la detección de PII y la sanitización de datos. El proyecto está configurado para usar Gemini 2.5 Flash por defecto. Se puede sustituir otro modelo compatible con Vertex AI actualizando la variable del proyecto GCP_Model. Se debe tener un proyecto de Google Cloud con la API de Vertex AI habilitada y una cuenta de servicio con el rol de Usuario de Vertex AI.
Google Cloud Storage
El agente utiliza Google Cloud Storage tanto como fuente de PDF como destino de archivo. Se debe tener un proyecto de Google Cloud con la API de Cloud Storage habilitada, dos buckets de Cloud Storage configurados (uno para archivos PDF entrantes y otro para archivar archivos procesados), y una cuenta de servicio con el rol de Administrador de Objetos de Almacenamiento en ambos buckets.
Google Document AI
El agente utiliza Google Document AI para la extracción de texto OCR de archivos PDF. Se debe tener la API de Cloud Document AI habilitada en el proyecto de Google Cloud, un procesador de Document AI creado, y una cuenta de servicio con el rol de Usuario de la API de Document AI.
FTP
El agente escribe archivos de salida procesados (datos de PII y texto limpio) en un servidor FTP. Se debe tener un servidor FTP accesible desde Jitterbit con credenciales de conexión válidas.
Correo electrónico
El agente envía notificaciones de error a través de correo electrónico SMTP. La configuración predeterminada utiliza Gmail (smtp.gmail.com). Se debe tener una cuenta de correo electrónico de remitente con acceso SMTP habilitado y, si se utiliza Gmail, una contraseña de aplicación configurada.
Instalación, configuración y operación
Sigue estos pasos para instalar, configurar y operar este agente de IA:
- Descargar e instalar el proyecto
- Configurar recursos de GCP
- Configurar variables del proyecto
- Probar conexiones
- Desplegar el proyecto
- Revisar flujos de trabajo del proyecto
- Activar los flujos de trabajo del proyecto
Para obtener orientación sobre la resolución de problemas, consulte Resolución de problemas.
Descargar e instalar el proyecto
Siga estos pasos para instalar el proyecto de Studio para el agente de IA:
-
Inicie sesión en el portal de Harmony en https://login.jitterbit.com y abra Marketplace.
-
Localice el agente de IA llamado Document Compliance Agent (Google). Para localizar el agente, utilice la barra de búsqueda o, en el panel de Filtros bajo Tipo, seleccione Agente de IA para limitar la visualización a agentes de IA.
-
Haga clic en el enlace de Documentación del agente para abrir su documentación en una pestaña separada. Mantenga la pestaña abierta para consultarla después de iniciar el proyecto.
-
Haga clic en Iniciar Proyecto para abrir un cuadro de diálogo de configuración.
Nota
Si aún no ha comprado el agente de IA, se mostrará Obtenga este agente en su lugar. Haga clic en él para abrir un cuadro de diálogo informativo, luego haga clic en Enviar para que un representante se comunique con usted sobre la compra del agente de IA.
Consejo
El cuadro de diálogo de configuración incluye una advertencia de no importar la plantilla antes de aplicar personalizaciones de punto final. Esa advertencia no se aplica a este agente de IA y se puede ignorar. Siga el orden recomendado de pasos en esta documentación en su lugar.
-
En el cuadro de diálogo Crear un Nuevo Proyecto, seleccione un entorno donde se creará el proyecto de Studio, luego haga clic en Crear Proyecto.
-
Después de que el cuadro de diálogo de progreso indique que el proyecto ha sido creado, utilice el enlace del cuadro de diálogo Ir a Studio o abra el proyecto directamente desde la página de Proyectos de Studio.
Configurar recursos de GCP
Antes de configurar las variables del proyecto, configure los recursos requeridos de Google Cloud Platform.
Habilitar APIs requeridas
-
Abra la Consola de Google Cloud y seleccione su proyecto.
-
Abra el menú de navegación y vaya a APIs y Servicios > Biblioteca.
-
Busque y habilite cada una de las siguientes APIs:
- API de Cloud Storage
- API de Cloud Document AI
- API de Vertex AI
Crear una cuenta de servicio
-
En la Consola de Google Cloud, abre IAM y Admin > Cuentas de servicio y haz clic en Crear cuenta de servicio.
-
Ingresa un nombre para la cuenta de servicio, luego haz clic en Crear y continuar.
-
Asigna los siguientes roles de IAM a la cuenta de servicio:
- Administrador de objetos de almacenamiento (requerido para leer, archivar y eliminar archivos en ambos buckets de Cloud Storage)
- Usuario de la API de Document AI (requerido para la extracción de texto OCR)
- Usuario de Vertex AI (requerido para la inferencia de LLM)
-
Haz clic en Listo para crear la cuenta de servicio.
-
En la lista de cuentas de servicio, haz clic en la cuenta de servicio que acabas de crear. Abre la pestaña Claves, haz clic en Agregar clave > Crear nueva clave, selecciona JSON y haz clic en Crear. El archivo de clave se descarga automáticamente.
-
Abre el archivo de clave JSON descargado y anota los siguientes valores para usarlos en las variables del proyecto:
- El valor de
client_emailse asigna a la variable del proyectoGCP_clientEmail. - El valor de
private_keyse asigna a la variable del proyectoGCP_privateKey. - El valor de
private_key_idse asigna a la variable del proyectoGCP_privateKeyId.
- El valor de
Crear buckets de Cloud Storage
-
En la Consola de Google Cloud, abre Cloud Storage > Buckets y haz clic en Crear.
-
Crea el bucket de origen donde se colocarán los archivos PDF para su procesamiento. Anota el nombre del bucket para la variable del proyecto
GCP_Get_BucketName. -
Crea un segundo bucket que sirva como destino de archivo para los archivos procesados. Anota su nombre para la variable del proyecto
GCP_Archive_BucketName. -
Asegúrate de que ambos buckets estén en la misma región de Google Cloud.
Crear un procesador de Document AI
-
En la Consola de Google Cloud, abre Document AI > Mis procesadores y haz clic en Crear procesador.
-
Selecciona Document OCR como el tipo de procesador.
-
Ingresa un nombre para el procesador, selecciona una región y haz clic en Crear. Anota la región para la variable del proyecto
GCP_DocumentAI_Location. -
Después de que se cree el procesador, copia el ID del procesador de la página de detalles del procesador. Usa este valor para la variable del proyecto
GCP_Processor_ID.
Configurar variables del proyecto
En el proyecto de Studio instalado desde Marketplace, establece valores para las siguientes variables del proyecto.
Para configurar las variables del proyecto, utiliza el menú de acciones del proyecto y selecciona Variables del Proyecto para abrir el panel de configuración.
Google Cloud Platform
| Nombre de la variable | Descripción |
|---|---|
GCP_Project_ID |
ID del proyecto de Google Cloud. |
GCP_clientEmail |
Dirección de correo electrónico de la cuenta de servicio desde la clave JSON de la cuenta de servicio. |
GCP_privateKeyId |
ID de la clave privada de la clave JSON de la cuenta de servicio. |
GCP_privateKey |
Clave privada de la clave JSON de la cuenta de servicio en formato PEM. |
GCP_tokenURI |
URI del endpoint de token OAuth2 para autenticarse con Google Cloud. Usa el valor predeterminado: https://oauth2.googleapis.com/token. |
GCP_scope |
Alcance OAuth2 para la cuenta de servicio. Usa el valor predeterminado: https://www.googleapis.com/auth/cloud-platform. |
Google Document AI
| Nombre de la variable | Descripción |
|---|---|
GCP_DocumentAI_Location |
Código de ubicación para la API de Document AI (por ejemplo, us). |
GCP_Processor_ID |
ID del procesador de Document AI. Consulta Crear un procesador de Document AI. |
Google Vertex AI
| Nombre de la variable | Descripción |
|---|---|
GCP_VertexAI_Location |
Región de Vertex AI (por ejemplo, us-central1). |
GCP_Model |
Nombre del modelo Gemini utilizado para la detección de PII y la sanitización de datos (por ejemplo, gemini-2.5-flash). |
GCP_temperature |
Temperatura de muestreo de LLM. Valores más bajos producen respuestas más deterministas (por ejemplo, 0.1). |
GCP_maxOutputTokens |
Número máximo de tokens en la respuesta de LLM (por ejemplo, 8192). |
Google Cloud Storage
| Nombre de la variable | Descripción |
|---|---|
GCP_Get_BucketName |
Nombre del bucket de origen de Google Cloud Storage donde se colocan los archivos PDF para su procesamiento. |
GCP_Archive_BucketName |
Nombre del bucket de archivo de Google Cloud Storage donde se mueven los archivos procesados después del análisis. |
FTP
| Nombre de variable | Descripción |
|---|---|
FTP_Host |
Nombre de host del servidor FTP. |
FTP_UserName |
Nombre de usuario FTP. |
FTP_Password |
Contraseña FTP. |
FTP_File_Path |
Ruta de la carpeta de destino FTP (por ejemplo, /PDF_Parser/). |
| Nombre de variable | Descripción |
|---|---|
SMTP_Host |
Nombre de host del servidor SMTP para enviar notificaciones de error (por ejemplo, smtp.gmail.com). |
SMTP_Username |
Nombre de usuario SMTP. |
SMTP_Password |
Contraseña SMTP. Para Gmail, genera una contraseña de aplicación en la configuración de seguridad de tu cuenta de Google. |
Email_From_Recipients |
Dirección de correo electrónico del remitente para los mensajes de notificación de error. |
Email_To_Recipients |
Dirección(es) de correo electrónico del(os) destinatario(s) para los mensajes de notificación de error. |
Agent
| Nombre de variable | Descripción |
|---|---|
debug |
Establecer en 1 para habilitar el registro de depuración o 0 para deshabilitarlo. |
Probar conexiones
Probar las configuraciones de los puntos finales para verificar la conectividad utilizando los valores de variables del proyecto definidos.
Para probar conexiones, ve a la pestaña Puntos finales y conectores del proyecto en la paleta de componentes de diseño, pasa el cursor sobre cada punto final y haz clic en Probar.
Desplegar el proyecto
Desplegar el proyecto de Studio.
Para desplegar el proyecto, utiliza el menú de acciones del proyecto y selecciona Desplegar.
Revisar flujos de trabajo del proyecto
El proyecto de Studio contiene un flujo de trabajo que implementa el pipeline de procesamiento del Agente de Cumplimiento de Documentos (Google).
GCP PDF Parser
| Operación | Descripción |
|---|---|
| GCP Controller | Verifica la caché en busca de un token de acceso válido e inicializa el pipeline de procesamiento. |
| Generate AccessToken | Se autentica con Google Cloud utilizando credenciales de cuenta de servicio y recupera un token de acceso OAuth2. |
| Read List of PDFs from Google Cloud Storage | Recupera una lista de archivos PDF disponibles del bucket de Cloud Storage de origen. |
| Extract data from PDF using Google Document_AI | Envía un archivo PDF a Google Document AI para la extracción de texto OCR. |
| Extract PII data using Google Vertex_AI | Envía el texto extraído al LLM para detectar y extraer datos PII, luego escribe el resultado en el servidor FTP. |
| Extract Non_PII data using Google Vertex_AI | Envía el texto extraído al LLM para producir una versión sanitizada sin PII, luego escribe el resultado en el servidor FTP. |
| Send File to FTP | Escribe una carga útil JSON procesada en el destino del servidor FTP configurado. |
| Copy PDFs from Google Cloud Storage | Copia el PDF procesado del bucket de origen al bucket de archivo. |
| Delete PDFs from Google Cloud Storage | Elimina el PDF procesado del bucket de origen después de haber sido archivado. |
| Error Notification | Envía una notificación por correo electrónico con detalles del error cuando ocurre una falla en el procesamiento. |
GCP Controller
La operación GCP Controller sirve como el punto de entrada para el flujo de trabajo. Verifica la caché en busca de un token de acceso OAuth2 existente. Si se encuentra un token válido, el flujo de trabajo procede directamente a leer archivos PDF desde Cloud Storage. Si no existe un token, la operación activa Generate AccessToken para obtener uno antes de continuar.
Generate AccessToken
La operación Generate AccessToken autentica al agente con Google Cloud utilizando las credenciales de la cuenta de servicio configurada. Construye un JWT a partir de la clave privada de la cuenta de servicio, lo firma y lo intercambia con el punto final del token OAuth2 de Google para recuperar un token de acceso. El token se almacena en caché para su reutilización en operaciones posteriores.
Read List of PDFs from Google Cloud Storage
La operación Read List of PDFs from Google Cloud Storage envía una solicitud HTTP autenticada a la API de Cloud Storage para recuperar una lista de nombres de archivos PDF en el bucket de origen. La operación itera a través de la lista devuelta, activando el pipeline de extracción para cada archivo.
Extract data from PDF using Google Document_AI
La operación Extract data from PDF using Google Document_AI envía el archivo PDF a la API de Google Document AI utilizando el procesador configurado. La API devuelve el contenido de texto extraído, que la operación almacena para su uso en los pasos de análisis LLM posteriores.
Extract PII data using Google Vertex_AI
La operación Extract PII data using Google Vertex_AI envía el texto del documento extraído al modelo Gemini configurado a través de la API de Vertex AI con un aviso para identificar y extraer información personal identificable. La respuesta del LLM se analiza y limpia, y luego se pasa a la operación Send File to FTP para su entrega al destino FTP configurado.
Extract Non_PII data using Google Vertex_AI
La operación Extract Non_PII data using Google Vertex_AI envía el texto del documento extraído al modelo Gemini a través de la API de Vertex AI con un aviso para producir una versión saneada con toda la PII eliminada. La respuesta limpia se pasa a la operación Send File to FTP para su entrega al destino FTP configurado.
Enviar archivo a FTP
La operación Enviar archivo a FTP escribe la carga útil JSON procesada en el servidor FTP en la ruta configurada por la variable de proyecto FTP_File_Path. Esta operación se llama una vez para la salida de PII y una vez para la salida de no-PII para cada archivo PDF procesado.
Copiar PDFs desde Google Cloud Storage
La operación Copiar PDFs desde Google Cloud Storage utiliza la API de Cloud Storage para copiar el PDF procesado del bucket de origen al bucket de archivo, creando un registro permanente del archivo procesado.
Eliminar PDFs desde Google Cloud Storage
La operación Eliminar PDFs desde Google Cloud Storage envía una solicitud DELETE autenticada a la API de Cloud Storage para eliminar el PDF procesado del bucket de origen después de que ha sido archivado con éxito, evitando que se reprocesen en ejecuciones posteriores.
Notificación de error
La operación Notificación de error construye un correo electrónico de error con el nombre del flujo de trabajo, la marca de tiempo y los detalles del error, y luego lo envía a las direcciones configuradas en la variable de proyecto Email_To_Recipients. Después de enviar la notificación, la operación genera el error para detener la ejecución posterior.
Activar los flujos de trabajo del proyecto
Para ejecutar el Agente de Cumplimiento de Documentos (Google), despliega y ejecuta la operación GCP Controller. En Studio, pasa el cursor sobre la operación y haz clic en el ícono de Desplegar y Ejecutar en la esquina superior derecha del mosaico de la operación.
Para automatizar el pipeline, configura programaciones de operaciones en la operación GCP Controller para que se ejecute con la frecuencia que prefieras.
Solución de problemas
Si encuentras problemas, revisa los registros de operaciones para obtener información detallada sobre la solución de problemas.
Para asistencia adicional, contacta a soporte de Jitterbit.