Agente de Conformidade de Documentos Jitterbit (Azure)
Visão Geral
A Jitterbit fornece o Agente de Conformidade de Documentos (Azure) aos clientes por meio do Jitterbit Marketplace. Este agente automatiza o processamento de documentos focado em conformidade, recuperando arquivos PDF do Azure Blob Storage, extraindo seu conteúdo textual usando reconhecimento óptico de caracteres (OCR) e aplicando análise impulsionada por IA para detectar e remover informações pessoalmente identificáveis (PII), ajudando as organizações a atender aos requisitos de privacidade de dados sem a revisão manual de documentos.
O agente recupera arquivos PDF de um contêiner de origem configurado, envia cada arquivo para um serviço de OCR para análise e coleta o texto completo extraído. Um LLM então analisa o texto extraído em duas etapas: uma para identificar e armazenar dados PII, e outra para produzir uma versão sanitizada com todas as PII removidas. Ambos os arquivos de saída são gravados em um servidor SFTP, o PDF original é arquivado em um contêiner de arquivo separado do Azure Blob Storage e excluído do contêiner de origem, e notificações por e-mail são enviadas para os destinatários configurados quando ocorrem erros de processamento.
O agente realiza as seguintes tarefas:
- Recupera uma lista de arquivos PDF de um contêiner de origem configurado do Azure Blob Storage.
- Envia cada PDF para o Azure Document Intelligence para extração de texto OCR e coleta o texto extraído.
- Envia o texto extraído para um LLM para detectar e extrair dados PII, e grava a saída em um arquivo em um servidor SFTP.
- Envia o texto extraído para o LLM para produzir uma versão limpa com todas as PII removidas, e grava a saída em um arquivo em um servidor SFTP.
- Arquiva arquivos PDF processados em um contêiner de arquivo de destino do Azure Blob Storage configurado e remove os originais do contêiner de origem.
- Envia notificações por e-mail para destinatários configurados quando ocorrem erros de processamento.
Este documento explica como configurar e operar este agente de IA. Ele cobre arquitetura, pré-requisitos e etapas para instalar, configurar e operar o agente de IA.
Arquitetura do agente de IA
Este agente de IA conecta o Azure Blob Storage, o Azure Document Intelligence, um LLM e um servidor SFTP para extrair e sanitizar texto de documentos PDF. Uma execução típica de processamento segue estas etapas:
- A operação
Initial Controllerinicializa as variáveis de processamento e aciona a etapa de listagem de blobs. - O agente conecta-se ao contêiner de origem do Azure Blob Storage configurado e recupera uma lista de arquivos PDF disponíveis.
- Para cada arquivo, o agente constrói a URL de origem do Document Intelligence e envia o PDF para o Azure Document Intelligence para processamento de OCR.
- O agente recupera o resultado da análise de OCR concluída e coleta o texto completo extraído.
- O agente envia o texto extraído para o LLM com um prompt de detecção de PII. Os dados de PII identificados são gravados em um arquivo no servidor SFTP.
- O agente envia o texto extraído para o LLM com um prompt de limpeza de dados para produzir uma versão sanitizada. O texto limpo é gravado em um arquivo no servidor SFTP.
- O PDF original é movido para o contêiner de arquivo do Azure Blob Storage e excluído do contêiner de origem.
- Notificações por e-mail são enviadas para os destinatários configurados se ocorrerem erros durante o processamento.
Diagrama de fluxo de trabalho
O diagrama a seguir mostra o principal pipeline de processamento para o Agente de Conformidade de Documentos (Azure).
Document Compliance
Agent (Azure)" } BLOBSRC[Azure Blob Storage
Source Container] ADI[Azure Document
Intelligence] LLM[fas:fa-brain
LLM] SFTP[fas:fa-server
SFTP Server] BLOBARC[Azure Blob Storage
Archive Container] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| BLOBSRC JSP <-->|2. OCR request / extracted text| ADI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| SFTP JSP -->|6. Archive and delete PDF| BLOBARC JSP -->|7. Error notification| EMAIL
Pré-requisitos
Você precisa dos seguintes componentes para usar este agente de IA.
Componentes do Harmony
Você deve ter uma licença do Jitterbit Harmony com acesso aos seguintes componentes:
- Jitterbit Studio
- Agente de Conformidade de Documentos (Azure) adquirido como um complemento de licença
Endpoints suportados
O agente de IA conecta-se aos seguintes endpoints. Você pode acomodar outros sistemas modificando as configurações de endpoint e fluxos de trabalho do projeto.
Modelo de linguagem grande (LLM)
O agente utiliza o Azure AI Foundry para acessar modelos de linguagem grandes para detecção de PII e sanitização de dados. O Azure AI Foundry é uma plataforma gerenciada que fornece acesso a modelos de fornecedores, incluindo OpenAI, Microsoft e Meta. Você deve ter uma assinatura do Azure com um hub e projeto do Azure AI Foundry configurados e um modelo implantado e acessível via API do Foundry.
Armazenamento de Blob do Azure
O agente utiliza o Armazenamento de Blob do Azure tanto como fonte de PDF quanto como destino de arquivamento. É necessário ter uma assinatura do Azure com dois contêineres configurados: um para arquivos PDF recebidos e outro para arquivar arquivos processados. Ambos os contêineres requerem tokens de assinatura de acesso compartilhado (SAS) com permissões de leitura, gravação e listagem.
Inteligência Documental do Azure
O agente utiliza a Inteligência Documental do Azure para extração de OCR de arquivos PDF. É necessário ter um recurso de Inteligência Documental do Azure com uma URL de endpoint válida e uma chave de API.
SFTP
O agente grava arquivos de saída processados (dados PII e texto limpo) em um servidor SFTP. É necessário ter um servidor SFTP acessível a partir do Jitterbit com credenciais de conexão válidas.
O agente envia notificações de erro via email SMTP. A configuração padrão utiliza o Gmail (smtp.gmail.com). É necessário ter uma conta de email remetente com acesso SMTP habilitado e, se estiver usando o Gmail, uma senha de aplicativo configurada.
Instalação, configuração e operação
Siga estas etapas para instalar, configurar e operar este agente de IA:
- Baixar e instalar o projeto
- Configurar recursos do Azure
- Configurar variáveis do projeto
- Testar conexões
- Implantar o projeto
- Revisar fluxos de trabalho do projeto
- Acionar os fluxos de trabalho do projeto
Para orientações de solução de problemas, consulte Solução de Problemas.
Baixar e instalar o projeto
Siga estas etapas para instalar o projeto Studio para o agente de IA:
-
Faça login no portal Harmony em https://login.jitterbit.com e abra o Marketplace.
-
Localize o agente de IA chamado Agente de Conformidade Documental Jitterbit (Azure). Para localizar o agente, utilize a barra de pesquisa ou, no painel Filtros sob Tipo, selecione Agente de IA para limitar a exibição a agentes de IA.
-
Clique no link Documentação do agente para abrir sua documentação em uma aba separada. Mantenha a aba aberta para consultar depois de iniciar o projeto.
-
Clique em Iniciar Projeto para abrir uma caixa de diálogo de configuração.
Nota
Se você ainda não comprou o agente de IA, Obter agente será exibido em vez disso. Clique nele para abrir uma caixa de diálogo informativa, em seguida, clique em Enviar para que um representante entre em contato com você sobre a compra do agente de IA.
Dica
A caixa de diálogo de configuração inclui um aviso para não importar o modelo antes de aplicar as personalizações de endpoint. Esse aviso não se aplica a este agente de IA e pode ser ignorado. Siga a ordem recomendada de etapas nesta documentação.
-
Na caixa de diálogo Criar um Novo Projeto, selecione um ambiente onde o projeto do Studio será criado, em seguida, clique em Criar Projeto.
-
Após a caixa de diálogo de progresso indicar que o projeto foi criado, use o link da caixa de diálogo Ir para o Studio ou abra o projeto diretamente na página Projetos do Studio.
Configurar recursos do Azure
Antes de configurar as variáveis do projeto, configure os recursos do Azure necessários.
Criar contêineres de Armazenamento Blob do Azure
-
Faça login no portal do Azure e pesquise por Contas de armazenamento na barra de pesquisa superior.
-
Clique em + Criar, preencha a assinatura, grupo de recursos e nome da conta de armazenamento, defina Desempenho como Padrão e Redundância como LRS, em seguida, clique em Revisar + Criar e Criar.
-
Após a conclusão da implantação, clique em Ir para o recurso, em seguida, vá para Armazenamento de dados > Contêineres.
-
Clique em + Contêiner, insira um nome para o contêiner de origem, defina o nível de acesso como Privado e clique em Criar.
-
Repita a etapa 4 para criar um contêiner de arquivo.
-
Para cada contêiner, gere um token SAS:
- Na conta de armazenamento, vá para Segurança + rede > Assinatura de acesso compartilhado.
- Ative os serviços Blob, os tipos de recurso Contêiner e Objeto, e as permissões Ler, Escrever e Listar.
- Defina uma data de expiração e clique em Gerar SAS e string de conexão.
- Copie o token SAS imediatamente — ele é exibido apenas uma vez.
Criar um recurso de Inteligência de Documentos do Azure
-
No portal do Azure, clique em + Criar um recurso, pesquise por Inteligência de Documentos e clique em Criar.
-
Configure o recurso, selecionando Standard S0 como o nível de preços para cargas de trabalho de produção.
-
Clique em Revisar + Criar, depois em Criar. Após a conclusão da implantação, clique em Ir para o recurso.
-
Vá para Gerenciamento de Recursos > Chaves e Endpoint e copie a URL do endpoint e Chave 1 para uso nas variáveis do projeto.
Criar um projeto do Azure AI Foundry
-
Acesse ai.azure.com e faça login com sua conta do Azure.
-
Clique em Novo hub, preencha a configuração do hub (assinatura, grupo de recursos, nome e região) e clique em Criar.
-
Dentro do hub, clique em Novo projeto, insira um nome para o projeto e clique em Criar.
-
Vá para Configurações > Detalhes do projeto e copie a URL do endpoint do projeto e a chave da API para uso nas variáveis do projeto.
Configurar variáveis do projeto
No projeto do Studio instalado a partir do Marketplace, defina valores para as seguintes variáveis do projeto.
Para configurar variáveis do projeto, use o menu de ações do projeto e selecione Variáveis do Projeto para abrir o painel de configuração.
Armazenamento de Blob do Azure
| Nome da variável | Descrição |
|---|---|
Azure_Blob_Endpoint_URL |
URL do endpoint do Armazenamento de Blob do Azure (por exemplo, https://<account>.blob.core.windows.net). |
Azure_Source_Container_Name |
Nome do contêiner de origem onde os arquivos PDF são colocados para processamento. |
Azure_Source_Container_SAS_Token |
Token SAS para o contêiner de origem, usado para autenticar operações de leitura, gravação e listagem. |
Azure_Archive_Container_Name |
Nome do contêiner de arquivo onde os PDFs processados são movidos. |
Destination_Archive_Container_SAS_Token |
Token SAS para o contêiner de arquivo, usado para autenticar operações de gravação. |
Inteligência de Documentos do Azure
| Nome da variável | Descrição |
|---|---|
Azure_Document_Intelligence_Endpoint_URL |
URL do endpoint para o recurso de Inteligência de Documentos do Azure (por exemplo, https://<resource-name>.cognitiveservices.azure.com). |
Azure_Document_Intelligence_Key |
Chave da API para autenticar solicitações de Inteligência de Documentos do Azure. |
Document_Intelligence_Model_ID |
ID do modelo para análise de OCR (padrão: prebuilt-layout). |
Document_Intelligence_Locale |
Localidade para extração de texto OCR (padrão: en-US). |
Document_Intelligence_API_Version |
Versão da API de Inteligência de Documentos do Azure (padrão: 2024-11-30). |
Azure AI Foundry
| Nome da variável | Descrição |
|---|---|
Azure_Foundry_Base_URL |
Localização da região para o Azure AI Foundry (por exemplo, us). |
Azure_AI_Foundry_Key |
Chave da API para autenticar solicitações do Azure AI Foundry. |
Azure_AI_Foundry_Project_Name |
Nome do projeto do Azure AI Foundry usado para inferência de LLM. |
SFTP
| Nome da variável | Descrição |
|---|---|
SFTP_Host |
Nome do host do servidor SFTP onde os arquivos de saída processados são gravados. |
SFTP_UserName |
Nome de usuário para autenticação SFTP. |
SFTP_Password |
Senha para autenticação SFTP. |
SFTP_Folder_Path |
Caminho da pasta no servidor SFTP onde os arquivos de saída são gravados (padrão: /Azure_PDF_Parser). |
| Nome da variável | Descrição |
|---|---|
Email_Enabled |
Defina como true para habilitar notificações por e-mail (padrão: true). |
Email_Summary |
Defina como true para habilitar notificações por e-mail de resumo (padrão: true). |
Email_Data_Error |
Defina como true para habilitar notificações por e-mail de falha (padrão: false). |
Email_SMTP_Servers |
Lista separada por vírgulas de endereços de servidores SMTP para envio de notificações (padrão: smtp.gmail.com). |
Email_Sender_Account |
Endereço da conta de e-mail usada para enviar notificações. |
Email_Sender_Password |
Senha para a conta de e-mail do remetente. Para Gmail, gere uma senha de aplicativo nas configurações de segurança da sua Conta Google. |
Email_Recipients |
Lista separada por vírgulas de endereços de e-mail dos destinatários para notificações. |
Email_Subject_Line |
Linha de assunto para e-mails de notificação (padrão: Azure PDF Parser Agent - Summary). |
Testar conexões
Teste as configurações de endpoint para verificar a conectividade usando os valores de variáveis de projeto definidos.
Para testar conexões, vá para a aba Endpoints e conectores do projeto na paleta de componentes de design, passe o mouse sobre cada endpoint e clique em Testar.
Implantar o projeto
Implantar o projeto do Studio.
Para implantar o projeto, use o menu de ações do projeto e selecione Implantar.
Revisar fluxos de trabalho do projeto
O projeto do Studio contém um fluxo de trabalho que implementa o pipeline de processamento do Agente de Conformidade de Documentos (Azure).
Analisador de PDF
| Operação | Descrição |
|---|---|
| Controlador Inicial | Inicializa as variáveis de processamento e inicia o pipeline. |
| Listar Blobs do Contêiner Azure | Recupera uma lista de arquivos PDF do contêiner de origem do Azure Blob Storage. |
| Formação da URL de Fonte de Inteligência de Documentos | Constrói a URL de origem para cada arquivo PDF para processamento de Inteligência de Documentos do Azure. |
| Enviar Dados de PDF para Azure DI | Envia cada PDF para a Inteligência de Documentos do Azure para processamento de OCR. |
| Obter Resultado da Análise do Azure DI | Recupera o resultado da análise de OCR concluída da Inteligência de Documentos do Azure. |
| Formação de Solicitação do Azure Foundry | Prepara solicitações de LLM com base nos resultados da análise de Inteligência de Documentos. |
| Enviar Dados DI para Foundry para Dados PII | Envia o texto extraído para o LLM detectar e extrair PII. |
| Gravar Dados JSON de PII no SFTP | Grava a saída de PII em um arquivo no servidor SFTP. |
| Enviar Dados DI para Foundry para Dados Limpos | Envia o texto extraído para o LLM produzir uma versão sem PII. |
| Gravar Dados JSON Limpos no SFTP | Grava a saída sanitizada em um arquivo no servidor SFTP. |
| Mover Blob para o Contêiner de Arquivo | Copia o PDF processado para o contêiner de arquivo do Azure Blob Storage. |
| Excluir Blob do Contêiner de Origem | Exclui o PDF original do contêiner de origem após a arquivação. |
Controlador Inicial
A operação Controlador Inicial serve como o ponto de entrada para o fluxo de trabalho. Ela executa o script Executar Orquestrador#1 para acionar a operação Listar Blobs do Contêiner Azure, em seguida, executa scripts de registro e o script Consolidação de Registro e Notificação para registrar detalhes do processamento e chamar a operação Enviar Email com base nas contagens de sucesso ou falha.
Listar Blobs do Contêiner Azure
A operação Listar Blobs do Contêiner Azure conecta-se ao contêiner de armazenamento de blobs do Azure configurado e recupera uma lista de blobs disponíveis. A resposta é transformada e armazenada em uma variável, e o script Extrair Nomes de Blobs da Resposta itera por cada nome de blob para chamar a operação Formação de URL de Fonte de Inteligência Documental.
Formação de URL de Fonte de Inteligência Documental
A operação Formação de URL de Fonte de Inteligência Documental executa o script Formação de URL de Fonte DI, que constrói a URL de fonte totalmente qualificada para o arquivo PDF e chama a operação Postar Dados PDF para Azure DI para iniciar o processamento de OCR.
Postar Dados PDF para Azure DI
A operação Postar Dados PDF para Azure DI transforma o corpo da solicitação de Inteligência Documental do Azure e posta o PDF para a Inteligência Documental do Azure via HTTP para análise. A resposta é transformada, armazenada em uma variável e registrada. A operação então retarda a execução para permitir que o processamento seja concluído antes de chamar a operação Obter Resultado de Análise do Azure DI.
Obter Resultado de Análise do Azure DI
A operação Obter Resultado de Análise do Azure DI realiza um GET HTTP para recuperar o resultado da análise de OCR concluída da Inteligência Documental do Azure. A resposta é transformada e armazenada em uma variável para uso nas etapas subsequentes de processamento LLM.
Formação de Solicitação do Azure Foundry
A operação Formação de Solicitação do Azure Foundry lê o resultado da Inteligência Documental da variável, transforma o conteúdo e executa o script Formação de Solicitação PII para Foundry para preparar e despachar solicitações para detecção de PII, processamento de dados limpos e gerenciamento de blobs.
Post DI Data to Foundry for PII Data
A operação Post DI Data to Foundry for PII Data transforma o corpo da solicitação PII do Azure AI Foundry e envia o texto extraído para o Azure AI Foundry via HTTP com um prompt de detecção de PII. A resposta do LLM é transformada, armazenada em uma variável e registrada.
Write PII JSON Data to SFTP
A operação Write PII JSON Data to SFTP lê os dados de PII da variável, transforma o conteúdo e executa o script Write PII Data in a file para gravar a saída de PII em um arquivo no servidor SFTP e chamar a operação Post DI Data to Foundry for Clean Data.
Post DI Data to Foundry for Clean Data
A operação Post DI Data to Foundry for Clean Data executa o script Clean Data Request Formation for Foundry, transforma o corpo da solicitação e envia o texto extraído para o Azure AI Foundry com um prompt de limpeza de dados para produzir uma versão sanitizada com todas as PII removidas. A resposta é transformada, armazenada em uma variável e registrada.
Write Clean JSON Data to SFTP
A operação Write Clean JSON Data to SFTP lê os dados limpos da variável, transforma o conteúdo e executa o script Write Clean Data in a file para gravar a saída sanitizada em um arquivo no servidor SFTP e chamar a operação Move Blob to Archive Container.
Move Blob to Archive Container
A operação Move Blob to Archive Container transforma o corpo da solicitação de movimentação e envia uma solicitação HTTP para copiar o PDF processado do contêiner de origem para o contêiner de arquivo. A resposta é transformada e armazenada em uma variável.
Delete Blob from Source Container
A operação Delete Blob from Source Container envia uma solicitação HTTP DELETE para remover o PDF original do contêiner de origem após ter sido arquivado com sucesso, garantindo que o arquivo não seja reprocessado em execuções subsequentes.
Tratamento de Erros
| Operação | Descrição |
|---|---|
| Email em Caso de Falha | Aciona o fluxo de notificação de erro quando ocorre uma falha no processamento. |
| Enviar Email | Envia o email de notificação de erro através do endpoint SMTP configurado. |
Email em Caso de Falha
A operação Email em Caso de Falha executa o Script de Envio de Email de Erro para registrar os detalhes do erro e chamar a operação Enviar Email.
Enviar Email
A operação Enviar Email transforma o corpo do email, envia a notificação através do adaptador de Email configurado e transforma qualquer resposta de erro.
Acionar os fluxos de trabalho do projeto
Para executar o Agente de Conformidade de Documentos (Azure), implante e execute a operação Controlador Inicial. No Studio, passe o mouse sobre a operação e clique no ícone Implantar e Executar no canto superior direito do bloco da operação.
Para automatizar o pipeline, configure agendas de operações na operação Controlador Inicial para serem executadas na frequência desejada.
Solução de Problemas
Se você encontrar problemas, revise os logs de operações para informações detalhadas de solução de problemas.
Para assistência adicional, entre em contato com o suporte da Jitterbit.