Ir para o conteúdo

Agente de Conformidade de Documentos (Google)

Visão Geral

A Jitterbit fornece o Agente de Conformidade de Documentos (Google) aos clientes por meio do Jitterbit Marketplace. Este agente automatiza o processamento de documentos focados em conformidade, recuperando arquivos PDF do Google Cloud Storage, extraindo seu conteúdo textual usando reconhecimento óptico de caracteres (OCR) e aplicando análise impulsionada por IA para detectar e remover informações pessoalmente identificáveis (PII), ajudando as organizações a atender aos requisitos de privacidade de dados sem a necessidade de revisão manual de documentos.

O agente recupera arquivos PDF de um bucket de origem configurado, autentica-se com o Google Cloud usando uma conta de serviço e um token de acesso OAuth2 em cache, e envia cada arquivo para o Google Document AI para extração de OCR. Um LLM então analisa o texto extraído em duas etapas: uma para identificar e armazenar dados PII, e outra para produzir uma versão sanitizada com todas as PII removidas. Ambos os arquivos de saída são gravados em um servidor FTP, o PDF original é copiado para um bucket de arquivo separado no Google Cloud Storage e excluído da origem, e notificações por e-mail são enviadas aos destinatários configurados quando ocorrem erros de processamento.

O agente realiza as seguintes tarefas:

  • Autentica-se com o Google Cloud usando um JWT de conta de serviço e armazena em cache o token de acesso OAuth2 para reutilização em execuções de processamento.
  • Recupera uma lista de arquivos PDF de um bucket de origem configurado no Google Cloud Storage.
  • Envia cada arquivo PDF para o Google Document AI para extração de texto OCR e coleta o texto completo extraído.
  • Envia o texto extraído para um LLM para detectar e extrair dados PII, e grava a saída em um arquivo em um servidor FTP.
  • Envia o texto extraído para o LLM para produzir uma versão limpa com todas as PII removidas, e grava a saída em um arquivo em um servidor FTP.
  • Arquiva arquivos PDF processados em um bucket de destino configurado no Google Cloud Storage e remove os originais do bucket de origem.
  • Envia notificações por e-mail aos destinatários configurados quando ocorrem erros de processamento.

Este documento explica como configurar e operar este agente de IA. Ele abrange arquitetura, pré-requisitos e etapas para instalar, configurar e operar o agente de IA.

Arquitetura do agente de IA

Este agente de IA conecta o Google Cloud Storage, o Google Document AI, um LLM e um servidor FTP para extrair e sanitizar texto de documentos PDF. Uma execução típica de processamento segue estas etapas:

  1. A operação GCP Controller verifica o cache em busca de um token de acesso OAuth2 válido. Se nenhum existir, ela aciona a operação Generate AccessToken para autenticar com o Google Cloud usando as credenciais da conta de serviço configurada.
  2. O agente conecta-se ao bucket de origem do Google Cloud Storage configurado e recupera uma lista de arquivos PDF disponíveis.
  3. Para cada arquivo, o agente envia o PDF ao Google Document AI para extração de texto OCR e coleta o texto completo extraído.
  4. O agente envia o texto extraído ao LLM com um prompt de detecção de PII. Os dados de PII identificados são gravados como um arquivo JSON no servidor FTP.
  5. O agente envia o texto extraído ao LLM com um prompt de limpeza de dados para produzir uma versão sanitizada. O texto limpo é gravado como um arquivo JSON no servidor FTP.
  6. O PDF processado é copiado para o bucket de arquivo de destino do Google Cloud Storage e, em seguida, excluído do bucket de origem.
  7. Se qualquer etapa do pipeline falhar, uma notificação por e-mail é enviada aos destinatários configurados com detalhes do erro.

Diagrama de fluxo de trabalho

O diagrama a seguir mostra o principal pipeline de processamento para o Agente de Conformidade de Documentos (Google).

--- config: flowchart: padding: 20 nodeSpacing: 80 --- flowchart LR classDef default fill:white, stroke:black, stroke-width:3px, rx:15px, ry:15px JSP@{ shape: hex, label: "
Document Compliance
Agent (Google)" } GCSSRC[fab:fa-google
Google Cloud Storage
Source Bucket] DOCAI[fab:fa-google
Google Document AI] LLM[fas:fa-brain
LLM] FTP[fas:fa-server
FTP Server] GCSARC[fab:fa-google
Google Cloud Storage
Archive Bucket] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| GCSSRC JSP <-->|2. OCR request / extracted text| DOCAI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| FTP JSP -->|6. Archive and delete PDF| GCSARC JSP -->|7. Error notification| EMAIL

Pré-requisitos

Você precisa dos seguintes componentes para usar este agente de IA.

Componentes do Harmony

Você deve ter uma licença do Jitterbit Harmony com acesso aos seguintes componentes:

  • Jitterbit Studio
  • Agente de Conformidade de Documentos (Google) adquirido como um complemento de licença

Endpoints suportados

O agente de IA se conecta aos seguintes endpoints. É possível acomodar outros sistemas modificando as configurações de endpoint e os fluxos de trabalho do projeto.

Modelo de linguagem grande (LLM)

O agente utiliza Google Vertex AI para acessar modelos de linguagem grandes para detecção de PII e sanitização de dados. O projeto está configurado para usar o Gemini 2.5 Flash por padrão. É possível substituir outro modelo suportado pelo Vertex AI atualizando a variável de projeto GCP_Model. É necessário ter um projeto do Google Cloud com a API do Vertex AI habilitada e uma conta de serviço com o papel de Usuário do Vertex AI.

Google Cloud Storage

O agente utiliza o Google Cloud Storage tanto como fonte de PDF quanto como destino de arquivamento. É necessário ter um projeto do Google Cloud com a API do Cloud Storage habilitada, duas buckets do Cloud Storage configuradas (uma para arquivos PDF recebidos e outra para arquivar arquivos processados) e uma conta de serviço com o papel de Administrador de Objetos de Armazenamento em ambas as buckets.

Google Document AI

O agente utiliza o Google Document AI para extração de texto OCR de arquivos PDF. É necessário ter a API do Cloud Document AI habilitada em seu projeto do Google Cloud, um processador do Document AI criado e uma conta de serviço com o papel de Usuário da API do Document AI.

FTP

O agente grava arquivos de saída processados (dados de PII e texto limpo) em um servidor FTP. É necessário ter um servidor FTP acessível a partir do Jitterbit com credenciais de conexão válidas.

Email

O agente envia notificações de erro via email SMTP. A configuração padrão utiliza o Gmail (smtp.gmail.com). É necessário ter uma conta de email remetente com acesso SMTP habilitado e, se estiver usando o Gmail, uma senha de aplicativo configurada.

Instalação, configuração e operação

Siga estas etapas para instalar, configurar e operar este agente de IA:

  1. Baixar e instalar o projeto
  2. Configurar recursos do GCP
  3. Configurar variáveis do projeto
  4. Testar conexões
  5. Implantar o projeto
  6. Revisar fluxos de trabalho do projeto
  7. Acionar os fluxos de trabalho do projeto

Para orientações de solução de problemas, consulte Solução de Problemas.

Baixar e instalar o projeto

Siga estas etapas para instalar o projeto do Studio para o agente de IA:

  1. Faça login no portal Harmony em https://login.jitterbit.com e abra o Marketplace.

  2. Localize o agente de IA chamado Document Compliance Agent (Google). Para localizar o agente, use a barra de pesquisa ou, no painel Filtros, sob Tipo, selecione Agente de IA para limitar a exibição a agentes de IA.

  3. Clique no link Documentação do agente para abrir sua documentação em uma nova aba. Mantenha a aba aberta para consultar depois de iniciar o projeto.

  4. Clique em Iniciar Projeto para abrir uma caixa de diálogo de configuração.

    Nota

    Se você ainda não comprou o agente de IA, Obter este agente será exibido em vez disso. Clique nele para abrir uma caixa de diálogo informativa e, em seguida, clique em Enviar para que um representante entre em contato com você sobre a compra do agente de IA.

    Dica

    A caixa de diálogo de configuração inclui um aviso para não importar o modelo antes de aplicar as personalizações de endpoint. Esse aviso não se aplica a este agente de IA e pode ser ignorado. Siga a ordem recomendada de etapas nesta documentação.

  5. Na caixa de diálogo Criar um Novo Projeto, selecione um ambiente onde o projeto do Studio será criado e clique em Criar Projeto.

  6. Após a caixa de diálogo de progresso indicar que o projeto foi criado, use o link da caixa de diálogo Ir para o Studio ou abra o projeto diretamente na página Projetos do Studio.

Configurar recursos do GCP

Antes de configurar as variáveis do projeto, configure os recursos necessários do Google Cloud Platform.

Ativar APIs necessárias

  1. Abra o Google Cloud Console e selecione seu projeto.

  2. Abra o menu de navegação e vá para APIs e Serviços > Biblioteca.

  3. Pesquise e ative cada uma das seguintes APIs:

    • API do Cloud Storage
    • API do Cloud Document AI
    • API do Vertex AI

Criar uma conta de serviço

  1. No Google Cloud Console, abra IAM & Admin > Contas de Serviço e clique em Criar Conta de Serviço.

  2. Insira um nome para a conta de serviço e clique em Criar e Continuar.

  3. Atribua os seguintes papéis IAM à conta de serviço:

    • Administrador de Objetos de Armazenamento (necessário para ler, arquivar e excluir arquivos em ambos os buckets do Cloud Storage)
    • Usuário da API Document AI (necessário para extração de texto OCR)
    • Usuário do Vertex AI (necessário para inferência de LLM)
  4. Clique em Concluído para criar a conta de serviço.

  5. Na lista de contas de serviço, clique na conta de serviço que você acabou de criar. Abra a aba Chaves, clique em Adicionar Chave > Criar nova chave, selecione JSON e clique em Criar. O arquivo da chave será baixado automaticamente.

  6. Abra o arquivo da chave JSON baixado e anote os seguintes valores para uso nas variáveis do projeto:

    • O valor client_email mapeia para a variável do projeto GCP_clientEmail.
    • O valor private_key mapeia para a variável do projeto GCP_privateKey.
    • O valor private_key_id mapeia para a variável do projeto GCP_privateKeyId.

Criar buckets do Cloud Storage

  1. No Google Cloud Console, abra Cloud Storage > Buckets e clique em Criar.

  2. Crie o bucket de origem onde os arquivos PDF serão colocados para processamento. Anote o nome do bucket para a variável do projeto GCP_Get_BucketName.

  3. Crie um segundo bucket para servir como destino de arquivamento para os arquivos processados. Anote seu nome para a variável do projeto GCP_Archive_BucketName.

  4. Certifique-se de que ambos os buckets estão na mesma região do Google Cloud.

Criar um processador Document AI

  1. No Google Cloud Console, abra Document AI > Meus processadores e clique em Criar processador.

  2. Selecione Document OCR como o tipo de processador.

  3. Insira um nome para o processador, selecione uma região e clique em Criar. Anote a região para a variável do projeto GCP_DocumentAI_Location.

  4. Após o processador ser criado, copie o ID do processador da página de detalhes do processador. Use este valor para a variável do projeto GCP_Processor_ID.

Configurar variáveis do projeto

No projeto do Studio instalado a partir do Marketplace, defina valores para as seguintes variáveis do projeto.

Para configurar variáveis do projeto, use o menu de ações do projeto e selecione Variáveis do Projeto para abrir o painel de configuração.

Google Cloud Platform

Nome da variável Descrição
GCP_Project_ID ID do projeto do Google Cloud.
GCP_clientEmail Endereço de e-mail da conta de serviço do JSON da chave da conta de serviço.
GCP_privateKeyId ID da chave privada do JSON da chave da conta de serviço.
GCP_privateKey Chave privada do JSON da chave da conta de serviço em formato PEM.
GCP_tokenURI URI do endpoint de token OAuth2 para autenticação com o Google Cloud. Use o valor padrão: https://oauth2.googleapis.com/token.
GCP_scope Escopo OAuth2 para a conta de serviço. Use o valor padrão: https://www.googleapis.com/auth/cloud-platform.

Google Document AI

Nome da variável Descrição
GCP_DocumentAI_Location Código de localização para a API Document AI (por exemplo, us).
GCP_Processor_ID ID do processador Document AI. Veja Criar um processador Document AI.

Google Vertex AI

Nome da variável Descrição
GCP_VertexAI_Location Região do Vertex AI (por exemplo, us-central1).
GCP_Model Nome do modelo Gemini usado para detecção de PII e sanitização de dados (por exemplo, gemini-2.5-flash).
GCP_temperature Temperatura de amostragem do LLM. Valores mais baixos produzem respostas mais determinísticas (por exemplo, 0.1).
GCP_maxOutputTokens Número máximo de tokens na resposta do LLM (por exemplo, 8192).

Google Cloud Storage

Nome da variável Descrição
GCP_Get_BucketName Nome do bucket de origem do Google Cloud Storage onde os arquivos PDF são colocados para processamento.
GCP_Archive_BucketName Nome do bucket de arquivo do Google Cloud Storage onde os arquivos processados são movidos após a análise.

FTP

Nome da variável Descrição
FTP_Host Nome do host do servidor FTP.
FTP_UserName Nome de usuário do FTP.
FTP_Password Senha do FTP.
FTP_File_Path Caminho da pasta de destino do FTP (por exemplo, /PDF_Parser/).

Email

Nome da variável Descrição
SMTP_Host Nome do host do servidor SMTP para envio de notificações de erro (por exemplo, smtp.gmail.com).
SMTP_Username Nome de usuário do SMTP.
SMTP_Password Senha do SMTP. Para Gmail, gere uma senha de aplicativo nas configurações de segurança da sua Conta Google.
Email_From_Recipients Endereço de e-mail do remetente para mensagens de notificação de erro.
Email_To_Recipients Endereço(s) de e-mail do(s) destinatário(s) para mensagens de notificação de erro.

Agent

Nome da variável Descrição
debug Defina como 1 para habilitar o registro de depuração ou 0 para desabilitá-lo.

Testar conexões

Teste as configurações de endpoint para verificar a conectividade usando os valores de variáveis de projeto definidos.

Para testar conexões, vá para a aba Endpoints e conectores do projeto no painel de componentes de design, passe o mouse sobre cada endpoint e clique em Testar.

Implantar o projeto

Implante o projeto do Studio.

Para implantar o projeto, use o menu de ações do projeto e selecione Implantar.

Revisar fluxos de trabalho do projeto

O projeto do Studio contém um fluxo de trabalho que implementa o pipeline de processamento do Agente de Conformidade de Documentos (Google).

GCP PDF Parser

Operação Descrição
GCP Controller Verifica o cache em busca de um token de acesso válido e inicializa o pipeline de processamento.
Generate AccessToken Autentica-se com o Google Cloud usando credenciais de conta de serviço e recupera um token de acesso OAuth2.
Read List of PDFs from Google Cloud Storage Recupera uma lista de arquivos PDF disponíveis do bucket de Cloud Storage de origem.
Extract data from PDF using Google Document_AI Envia um arquivo PDF para o Google Document AI para extração de texto OCR.
Extract PII data using Google Vertex_AI Envia o texto extraído para o LLM para detectar e extrair dados PII, em seguida, grava o resultado no servidor FTP.
Extract Non_PII data using Google Vertex_AI Envia o texto extraído para o LLM para produzir uma versão sanitizada sem PII, em seguida, grava o resultado no servidor FTP.
Send File to FTP Grava um payload JSON processado no destino do servidor FTP configurado.
Copy PDFs from Google Cloud Storage Copia o PDF processado do bucket de origem para o bucket de arquivo.
Delete PDFs from Google Cloud Storage Exclui o PDF processado do bucket de origem após ter sido arquivado.
Error Notification Envia uma notificação por e-mail com detalhes do erro quando ocorre uma falha no processamento.
GCP Controller

A operação GCP Controller serve como o ponto de entrada para o fluxo de trabalho. Ela verifica o cache em busca de um token de acesso OAuth2 existente. Se um token válido for encontrado, o fluxo de trabalho prossegue diretamente para a leitura de arquivos PDF do Cloud Storage. Se nenhum token existir, a operação aciona Generate AccessToken para obter um antes de continuar.

Generate AccessToken

A operação Generate AccessToken autentica o agente com o Google Cloud usando as credenciais da conta de serviço configurada. Ela constrói um JWT a partir da chave privada da conta de serviço, assina-o e o troca pelo endpoint de token OAuth2 do Google para recuperar um token de acesso. O token é armazenado em cache para reutilização em operações subsequentes.

Read List of PDFs from Google Cloud Storage

A operação Read List of PDFs from Google Cloud Storage envia uma solicitação HTTP autenticada para a API do Cloud Storage para recuperar uma lista de nomes de arquivos PDF no bucket de origem. A operação itera pela lista retornada, acionando o pipeline de extração para cada arquivo.

Extract data from PDF using Google Document_AI

A operação Extract data from PDF using Google Document_AI envia o arquivo PDF para a API do Google Document AI usando o processador configurado. A API retorna o conteúdo de texto extraído, que a operação armazena para uso nas etapas subsequentes de análise do LLM.

Extract PII data using Google Vertex_AI

A operação Extract PII data using Google Vertex_AI envia o texto do documento extraído para o modelo Gemini configurado via API do Vertex AI com um prompt para identificar e extrair informações pessoalmente identificáveis. A resposta do LLM é analisada e limpa, e em seguida passada para a operação Send File to FTP para entrega ao destino FTP configurado.

Extract Non_PII data using Google Vertex_AI

A operação Extract Non_PII data using Google Vertex_AI envia o texto do documento extraído para o modelo Gemini via API do Vertex AI com um prompt para produzir uma versão sanitizada com todas as PII removidas. A resposta limpa é passada para a operação Send File to FTP para entrega ao destino FTP configurado.

Enviar Arquivo para FTP

A operação Enviar Arquivo para FTP grava a carga útil JSON processada no servidor FTP no caminho configurado pela variável de projeto FTP_File_Path. Esta operação é chamada uma vez para a saída de PII e uma vez para a saída de não-PII para cada arquivo PDF processado.

Copiar PDFs do Google Cloud Storage

A operação Copiar PDFs do Google Cloud Storage utiliza a API do Cloud Storage para copiar o PDF processado do bucket de origem para o bucket de arquivo, criando um registro permanente do arquivo processado.

Excluir PDFs do Google Cloud Storage

A operação Excluir PDFs do Google Cloud Storage envia uma solicitação DELETE autenticada para a API do Cloud Storage para remover o PDF processado do bucket de origem após ter sido arquivado com sucesso, evitando que seja reprocessado em execuções subsequentes.

Notificação de Erro

A operação Notificação de Erro constrói um e-mail de erro com o nome do fluxo de trabalho, carimbo de data/hora e detalhes do erro, e o envia para os endereços configurados na variável de projeto Email_To_Recipients. Após enviar a notificação, a operação levanta o erro para interromper a execução adicional.

Acionar os fluxos de trabalho do projeto

Para executar o Agente de Conformidade de Documentos (Google), implante e execute a operação GCP Controller. No Studio, passe o mouse sobre a operação e clique no ícone Implantar e Executar no canto superior direito do bloco da operação.

Para automatizar o pipeline, configure agendas de operações na operação GCP Controller para serem executadas na frequência desejada.

Solução de Problemas

Se você encontrar problemas, revise os logs de operações para informações detalhadas de solução de problemas.

Para assistência adicional, entre em contato com o suporte do Jitterbit.