Agente de Cumplimiento de Documentos Jitterbit (Azure)
Descripción General
Jitterbit proporciona el Agente de Cumplimiento de Documentos (Azure) a los clientes a través de Jitterbit Marketplace. Este agente automatiza el procesamiento de documentos enfocado en el cumplimiento al recuperar archivos PDF de Azure Blob Storage, extraer su contenido textual utilizando reconocimiento óptico de caracteres (OCR) y aplicar análisis impulsado por IA para detectar y eliminar información de identificación personal (PII), ayudando a las organizaciones a cumplir con los requisitos de privacidad de datos sin revisión manual de documentos.
El agente recupera archivos PDF de un contenedor de origen configurado, envía cada archivo a un servicio de OCR para su análisis y recopila el texto completo extraído. Un LLM luego analiza el texto extraído en dos pasadas: una para identificar y almacenar datos de PII, y otra para producir una versión saneada con toda la PII eliminada. Ambos archivos de salida se escriben en un servidor SFTP, el PDF original se archiva en un contenedor de archivo separado de Azure Blob Storage y se elimina del contenedor de origen, y se envían notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.
El agente realiza las siguientes tareas:
- Recupera una lista de archivos PDF de un contenedor de origen configurado de Azure Blob Storage.
- Envía cada PDF a Azure Document Intelligence para la extracción de texto OCR y recopila el texto extraído.
- Envía el texto extraído a un LLM para detectar y extraer datos de PII, y escribe la salida en un archivo en un servidor SFTP.
- Envía el texto extraído al LLM para producir una versión limpia con toda la PII eliminada, y escribe la salida en un archivo en un servidor SFTP.
- Archiva los archivos PDF procesados en un contenedor de archivo de Azure Blob Storage de destino configurado y elimina los originales del contenedor de origen.
- Envía notificaciones por correo electrónico a los destinatarios configurados cuando ocurren errores de procesamiento.
Este documento explica cómo configurar y operar este agente de IA. Cubre arquitectura, requisitos previos y pasos para instalar, configurar y operar el agente de IA.
Arquitectura del agente de IA
Este agente de IA conecta Azure Blob Storage, Azure Document Intelligence, un LLM y un servidor SFTP para extraer y sanitizar texto de documentos PDF. Un ciclo de procesamiento típico sigue estos pasos:
- La operación
Initial Controllerinicializa las variables de procesamiento y activa el paso de listado de blobs. - El agente se conecta al contenedor de origen de Azure Blob Storage configurado y recupera una lista de archivos PDF disponibles.
- Para cada archivo, el agente construye la URL de origen de Document Intelligence y envía el PDF a Azure Document Intelligence para el procesamiento OCR.
- El agente recupera el resultado del análisis OCR completado y recopila el texto completo extraído.
- El agente envía el texto extraído al LLM con un aviso de detección de PII. Los datos de PII identificados se escriben en un archivo en el servidor SFTP.
- El agente envía el texto extraído al LLM con un aviso de limpieza de datos para producir una versión sanitizada. El texto limpio se escribe en un archivo en el servidor SFTP.
- El PDF original se mueve al contenedor de archivo de Azure Blob Storage y se elimina del contenedor de origen.
- Se envían notificaciones por correo electrónico a los destinatarios configurados si ocurren errores durante el procesamiento.
Diagrama de flujo de trabajo
El siguiente diagrama muestra la principal canalización de procesamiento para el Agente de Cumplimiento de Documentos (Azure).
Document Compliance
Agent (Azure)" } BLOBSRC[Azure Blob Storage
Source Container] ADI[Azure Document
Intelligence] LLM[fas:fa-brain
LLM] SFTP[fas:fa-server
SFTP Server] BLOBARC[Azure Blob Storage
Archive Container] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| BLOBSRC JSP <-->|2. OCR request / extracted text| ADI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| SFTP JSP -->|6. Archive and delete PDF| BLOBARC JSP -->|7. Error notification| EMAIL
Requisitos previos
Necesitas los siguientes componentes para usar este agente de IA.
Componentes de Harmony
Debes tener una licencia de Jitterbit Harmony con acceso a los siguientes componentes:
- Jitterbit Studio
- Agente de Cumplimiento de Documentos (Azure) adquirido como un complemento de licencia
Puntos finales compatibles
El agente de IA se conecta a los siguientes puntos finales. Puedes acomodar otros sistemas modificando las configuraciones de puntos finales y flujos de trabajo del proyecto.
Modelo de lenguaje grande (LLM)
El agente utiliza Azure AI Foundry para acceder a modelos de lenguaje grandes para la detección de PII y la sanitización de datos. Azure AI Foundry es una plataforma administrada que proporciona acceso a modelos de proveedores como OpenAI, Microsoft y Meta. Debes tener una suscripción de Azure con un hub de Azure AI Foundry y un proyecto configurado, y un modelo desplegado y accesible a través de la API de Foundry.
Almacenamiento de Blob de Azure
El agente utiliza Azure Blob Storage tanto como fuente de PDF como destino de archivo. Debe tener una suscripción de Azure con dos contenedores configurados: uno para archivos PDF entrantes y otro para archivar archivos procesados. Ambos contenedores requieren tokens de firma de acceso compartido (SAS) con permisos de lectura, escritura y listado.
Inteligencia Documental de Azure
El agente utiliza Azure Document Intelligence para la extracción OCR de archivos PDF. Debe tener un recurso de Azure Document Intelligence con una URL de endpoint válida y una clave API.
SFTP
El agente escribe archivos de salida procesados (datos PII y texto limpio) en un servidor SFTP. Debe tener un servidor SFTP accesible desde Jitterbit con credenciales de conexión válidas.
Correo Electrónico
El agente envía notificaciones de error a través de correo electrónico SMTP. La configuración predeterminada utiliza Gmail (smtp.gmail.com). Debe tener una cuenta de correo electrónico de remitente con acceso SMTP habilitado y, si utiliza Gmail, una contraseña de aplicación configurada.
Instalación, configuración y operación
Siga estos pasos para instalar, configurar y operar este agente de IA:
- Descargar e instalar el proyecto
- Configurar recursos de Azure
- Configurar variables del proyecto
- Probar conexiones
- Desplegar el proyecto
- Revisar flujos de trabajo del proyecto
- Activar los flujos de trabajo del proyecto
Para orientación sobre solución de problemas, consulte Solución de problemas.
Descargar e instalar el proyecto
Siga estos pasos para instalar el proyecto de Studio para el agente de IA:
-
Inicie sesión en el portal de Harmony en https://login.jitterbit.com y abra Marketplace.
-
Localice el agente de IA llamado Agente de Cumplimiento Documental de Jitterbit (Azure). Para localizar el agente, utilice la barra de búsqueda o, en el panel de Filtros bajo Tipo, seleccione Agente de IA para limitar la visualización a agentes de IA.
-
Haz clic en el enlace de Documentación del agente para abrir su documentación en una pestaña separada. Mantén la pestaña abierta para consultarla después de iniciar el proyecto.
-
Haz clic en Iniciar Proyecto para abrir un cuadro de diálogo de configuración.
Nota
Si aún no has comprado el agente de IA, se mostrará Obtener agente en su lugar. Haz clic en él para abrir un cuadro de diálogo informativo, luego haz clic en Enviar para que un representante se comunique contigo sobre la compra del agente de IA.
Consejo
El cuadro de diálogo de configuración incluye una advertencia de no importar la plantilla antes de aplicar las personalizaciones del punto final. Esa advertencia no se aplica a este agente de IA y se puede ignorar. En su lugar, sigue el orden de pasos recomendado en esta documentación.
-
En el cuadro de diálogo Crear un Nuevo Proyecto, selecciona un entorno donde se creará el proyecto de Studio, luego haz clic en Crear Proyecto.
-
Después de que el cuadro de diálogo de progreso indique que el proyecto ha sido creado, utiliza el enlace del cuadro de diálogo Ir a Studio o abre el proyecto directamente desde la página de Proyectos de Studio.
Configurar recursos de Azure
Antes de configurar las variables del proyecto, configura los recursos de Azure requeridos.
Crear contenedores de Azure Blob Storage
-
Inicia sesión en el portal de Azure y busca Cuentas de almacenamiento en la barra de búsqueda superior.
-
Haz clic en + Crear, completa la suscripción, el grupo de recursos y el nombre de la cuenta de almacenamiento, establece Rendimiento en Estándar y Redundancia en LRS, luego haz clic en Revisar + Crear y Crear.
-
Después de que se complete la implementación, haz clic en Ir al recurso, luego ve a Almacenamiento de datos > Contenedores.
-
Haz clic en + Contenedor, ingresa un nombre para el contenedor de origen, establece el nivel de acceso en Privado y haz clic en Crear.
-
Repite el paso 4 para crear un contenedor de archivo.
-
Para cada contenedor, genera un token SAS:
- En la cuenta de almacenamiento, ve a Seguridad + red > Firma de acceso compartido.
- Habilita los servicios de Blob, los tipos de recursos Contenedor y Objeto, y los permisos de Lectura, Escritura y Lista.
- Establece una fecha de caducidad y haz clic en Generar SAS y cadena de conexión.
- Copia el token SAS de inmediato; se muestra solo una vez.
Crear un recurso de Azure Document Intelligence
-
En el portal de Azure, haz clic en + Crear un recurso, busca Document Intelligence y haz clic en Crear.
-
Configura el recurso, seleccionando Standard S0 como el nivel de precios para cargas de trabajo de producción.
-
Haz clic en Revisar + Crear, luego en Crear. Después de que se complete la implementación, haz clic en Ir al recurso.
-
Ve a Gestión de recursos > Claves y punto de conexión y copia la URL del punto de conexión y Clave 1 para usar en las variables del proyecto.
Crear un proyecto de Azure AI Foundry
-
Ve a ai.azure.com e inicia sesión con tu cuenta de Azure.
-
Haz clic en Nuevo hub, completa la configuración del hub (suscripción, grupo de recursos, nombre y región) y haz clic en Crear.
-
Dentro del hub, haz clic en Nuevo proyecto, ingresa un nombre para el proyecto y haz clic en Crear.
-
Ve a Configuración > Detalles del proyecto y copia la URL del punto de conexión del proyecto y la clave API para usar en las variables del proyecto.
Configurar variables del proyecto
En el proyecto de Studio instalado desde Marketplace, establece valores para las siguientes variables del proyecto.
Para configurar las variables del proyecto, utiliza el menú de acciones del proyecto y selecciona Variables del proyecto para abrir el panel de configuración.
Almacenamiento de Blob de Azure
| Nombre de la variable | Descripción |
|---|---|
Azure_Blob_Endpoint_URL |
URL del punto de conexión de Azure Blob Storage (por ejemplo, https://<account>.blob.core.windows.net). |
Azure_Source_Container_Name |
Nombre del contenedor de origen donde se colocan los archivos PDF para su procesamiento. |
Azure_Source_Container_SAS_Token |
Token SAS para el contenedor de origen, utilizado para autenticar operaciones de lectura, escritura y listado. |
Azure_Archive_Container_Name |
Nombre del contenedor de archivo donde se mueven los PDFs procesados. |
Destination_Archive_Container_SAS_Token |
Token SAS para el contenedor de archivo, utilizado para autenticar operaciones de escritura. |
Azure Document Intelligence
| Nombre de la variable | Descripción |
|---|---|
Azure_Document_Intelligence_Endpoint_URL |
URL del punto de conexión para el recurso de Azure Document Intelligence (por ejemplo, https://<resource-name>.cognitiveservices.azure.com). |
Azure_Document_Intelligence_Key |
Clave API para autenticar solicitudes de Azure Document Intelligence. |
Document_Intelligence_Model_ID |
ID del modelo para análisis OCR (predeterminado: prebuilt-layout). |
Document_Intelligence_Locale |
Configuración regional para la extracción de texto OCR (predeterminado: en-US). |
Document_Intelligence_API_Version |
Versión de la API de Azure Document Intelligence (predeterminado: 2024-11-30). |
Azure AI Foundry
| Nombre de variable | Descripción |
|---|---|
Azure_Foundry_Base_URL |
Ubicación de la región para Azure AI Foundry (por ejemplo, us). |
Azure_AI_Foundry_Key |
Clave API para autenticar las solicitudes de Azure AI Foundry. |
Azure_AI_Foundry_Project_Name |
Nombre del proyecto de Azure AI Foundry utilizado para la inferencia de LLM. |
SFTP
| Nombre de variable | Descripción |
|---|---|
SFTP_Host |
Nombre del host del servidor SFTP donde se escriben los archivos de salida procesados. |
SFTP_UserName |
Nombre de usuario para la autenticación SFTP. |
SFTP_Password |
Contraseña para la autenticación SFTP. |
SFTP_Folder_Path |
Ruta de la carpeta en el servidor SFTP donde se escriben los archivos de salida (predeterminado: /Azure_PDF_Parser). |
| Nombre de variable | Descripción |
|---|---|
Email_Enabled |
Establecer en true para habilitar las notificaciones por correo electrónico (predeterminado: true). |
Email_Summary |
Establecer en true para habilitar las notificaciones por correo electrónico de resumen (predeterminado: true). |
Email_Data_Error |
Establecer en true para habilitar las notificaciones por correo electrónico de fallos (predeterminado: false). |
Email_SMTP_Servers |
Lista separada por comas de direcciones de servidores SMTP para enviar notificaciones (predeterminado: smtp.gmail.com). |
Email_Sender_Account |
Dirección de la cuenta de correo electrónico utilizada para enviar notificaciones. |
Email_Sender_Password |
Contraseña para la cuenta de correo electrónico del remitente. Para Gmail, genera una contraseña de aplicación en la configuración de seguridad de tu cuenta de Google. |
Email_Recipients |
Lista separada por comas de direcciones de correo electrónico de los destinatarios para las notificaciones. |
Email_Subject_Line |
Línea de asunto para los correos electrónicos de notificación (predeterminado: Agente de Azure PDF Parser - Resumen). |
Probar conexiones
Probar las configuraciones de los puntos finales para verificar la conectividad utilizando los valores de variables del proyecto definidos.
Para probar conexiones, ve a la pestaña Puntos finales y conectores del proyecto en la paleta de componentes de diseño, pasa el cursor sobre cada punto final y haz clic en Probar.
Desplegar el proyecto
Desplegar el proyecto de Studio.
Para desplegar el proyecto, utiliza el menú de acciones del proyecto y selecciona Desplegar.
Revisar flujos de trabajo del proyecto
El proyecto de Studio contiene un flujo de trabajo que implementa el pipeline de procesamiento del Agente de Cumplimiento de Documentos (Azure).
Analizador de PDF
| Operación | Descripción |
|---|---|
| Controlador Inicial | Inicializa las variables de procesamiento y comienza el pipeline. |
| Listar Blobs Desde el Contenedor de Azure | Recupera una lista de archivos PDF del contenedor de origen de Azure Blob Storage. |
| Formación de URL de Fuente de Inteligencia Documental | Construye la URL de origen para cada archivo PDF para el procesamiento de Inteligencia Documental de Azure. |
| Enviar Datos de PDF a Azure DI | Envía cada PDF a la Inteligencia Documental de Azure para el procesamiento de OCR. |
| Obtener Resultado de Análisis de Azure DI | Recupera el resultado del análisis de OCR completado de la Inteligencia Documental de Azure. |
| Formación de Solicitud de Azure Foundry | Prepara solicitudes de LLM basadas en los resultados del análisis de Inteligencia Documental. |
| Enviar Datos DI a Foundry para Datos PII | Envía el texto extraído al LLM para detectar y extraer PII. |
| Escribir Datos JSON de PII en SFTP | Escribe la salida de PII en un archivo en el servidor SFTP. |
| Enviar Datos DI a Foundry para Datos Limpios | Envía el texto extraído al LLM para producir una versión sin PII. |
| Escribir Datos JSON Limpios en SFTP | Escribe la salida saneada en un archivo en el servidor SFTP. |
| Mover Blob al Contenedor de Archivo | Copia el PDF procesado al contenedor de archivo de Azure Blob Storage. |
| Eliminar Blob del Contenedor de Origen | Elimina el PDF original del contenedor de origen después de archivar. |
Controlador Inicial
La operación Controlador Inicial sirve como el punto de entrada para el flujo de trabajo. Ejecuta el script Ejecutar Orquestador#1 para activar la operación Listar Blobs Desde Contenedor de Azure, luego ejecuta scripts de registro y el script Consolidación de Registro y Notificación para registrar detalles del procesamiento y llamar a la operación Enviar Correo Electrónico según los conteos de éxito o fracaso.
Listar Blobs Desde Contenedor de Azure
La operación Listar Blobs Desde Contenedor de Azure se conecta al contenedor de origen de Azure Blob Storage configurado y recupera una lista de blobs disponibles. La respuesta se transforma y se almacena en una variable, y el script Extraer Nombres de Blobs de la Respuesta itera a través de cada nombre de blob para llamar a la operación Formación de URL de Fuente de Inteligencia Documental.
Formación de URL de Fuente de Inteligencia Documental
La operación Formación de URL de Fuente de Inteligencia Documental ejecuta el script Formación de URL de Fuente DI, que construye la URL de origen completamente calificada para el archivo PDF y llama a la operación Publicar Datos PDF en Azure DI para comenzar el procesamiento OCR.
Publicar Datos PDF en Azure DI
La operación Publicar Datos PDF en Azure DI transforma el cuerpo de la solicitud de Inteligencia Documental de Azure y publica el PDF en Azure Document Intelligence a través de HTTP para su análisis. La respuesta se transforma, se almacena en una variable y se registra. La operación luego retrasa la ejecución para permitir que el procesamiento se complete antes de llamar a la operación Obtener Resultado de Análisis de Azure DI.
Obtener Resultado de Análisis de Azure DI
La operación Obtener Resultado de Análisis de Azure DI realiza un GET HTTP para recuperar el resultado de análisis OCR completado de Azure Document Intelligence. La respuesta se transforma y se almacena en una variable para su uso en los pasos de procesamiento LLM subsiguientes.
Formación de Solicitud de Azure Foundry
La operación Formación de Solicitud de Azure Foundry lee el resultado de Inteligencia Documental de la variable, transforma el contenido y ejecuta el script Formación de Solicitud PII para Foundry para preparar y despachar solicitudes para la detección de PII, procesamiento de datos limpios y gestión de blobs.
Publicar datos de DI en Foundry para datos PII
La operación Publicar datos de DI en Foundry para datos PII transforma el cuerpo de la solicitud PII de Azure AI Foundry y publica el texto extraído en Azure AI Foundry a través de HTTP con un aviso de detección de PII. La respuesta del LLM se transforma, se almacena en una variable y se registra.
Escribir datos JSON PII en SFTP
La operación Escribir datos JSON PII en SFTP lee los datos PII de la variable, transforma el contenido y ejecuta el script Escribir datos PII en un archivo para escribir la salida PII en un archivo en el servidor SFTP y llamar a la operación Publicar datos de DI en Foundry para datos limpios.
Publicar datos de DI en Foundry para datos limpios
La operación Publicar datos de DI en Foundry para datos limpios ejecuta el script Formación de solicitud de datos limpios para Foundry, transforma el cuerpo de la solicitud y publica el texto extraído en Azure AI Foundry con un aviso de limpieza de datos para producir una versión saneada con todos los PII eliminados. La respuesta se transforma, se almacena en una variable y se registra.
Escribir datos JSON limpios en SFTP
La operación Escribir datos JSON limpios en SFTP lee los datos limpios de la variable, transforma el contenido y ejecuta el script Escribir datos limpios en un archivo para escribir la salida saneada en un archivo en el servidor SFTP y llamar a la operación Mover blob al contenedor de archivo.
Mover blob al contenedor de archivo
La operación Mover blob al contenedor de archivo transforma el cuerpo de la solicitud de movimiento y envía una solicitud HTTP para copiar el PDF procesado del contenedor de origen al contenedor de archivo. La respuesta se transforma y se almacena en una variable.
Eliminar blob del contenedor de origen
La operación Eliminar blob del contenedor de origen envía una solicitud HTTP DELETE para eliminar el PDF original del contenedor de origen después de que ha sido archivado con éxito, asegurando que el archivo no se reprocesa en ejecuciones posteriores.
Manejo de errores
| Operación | Descripción |
|---|---|
| On Failure Email | Activa el flujo de trabajo de notificación de errores cuando ocurre un fallo en el procesamiento. |
| Send Email | Envía el correo electrónico de notificación de errores a través del punto final SMTP configurado. |
On Failure Email
La operación On Failure Email ejecuta el Send Error Email Script para registrar los detalles del error y llamar a la operación Send Email.
Send Email
La operación Send Email transforma el cuerpo del correo electrónico, envía la notificación a través del adaptador de correo electrónico configurado y transforma cualquier respuesta de error.
Activar los flujos de trabajo del proyecto
Para ejecutar el Agente de Cumplimiento de Documentos (Azure), despliega y ejecuta la operación Initial Controller. En Studio, pasa el cursor sobre la operación y haz clic en el ícono de Deploy and Run en la esquina superior derecha del mosaico de la operación.
Para automatizar el pipeline, configura operation schedules en la operación Initial Controller para que se ejecute con la frecuencia que prefieras.
Solución de problemas
Si encuentras problemas, revisa los operation logs para obtener información detallada sobre la solución de problemas.
Para asistencia adicional, contacta a Jitterbit support.