Zum Inhalt springen

Dokumenten-Compliance-Agent (Google)

Übersicht

Jitterbit stellt den Dokumenten-Compliance-Agenten (Google) über den Jitterbit Marketplace seinen Kunden zur Verfügung. Dieser Agent automatisiert die dokumentenverarbeitungsorientierte Compliance, indem er PDF-Dateien aus Google Cloud Storage abruft, deren Textinhalt mithilfe von optischer Zeichenerkennung (OCR) extrahiert und KI-gestützte Analysen anwendet, um personenbezogene Daten (PII) zu erkennen und zu entfernen. Dadurch hilft er Organisationen, die Anforderungen an den Datenschutz zu erfüllen, ohne eine manuelle Dokumentenprüfung durchführen zu müssen.

Der Agent ruft PDF-Dateien aus einem konfigurierten Quell-Bucket ab, authentifiziert sich bei Google Cloud mit einem Dienstkonto und einem zwischengespeicherten OAuth2-Zugriffstoken und übermittelt jede Datei an Google Document AI zur OCR-Extraktion. Ein LLM analysiert dann den extrahierten Text in zwei Durchgängen: einmal, um PII-Daten zu identifizieren und zu speichern, und ein weiteres Mal, um eine bereinigte Version mit allen entfernten PII zu erstellen. Beide Ausgabedateien werden auf einen FTP-Server geschrieben, die ursprüngliche PDF wird in einen separaten Google Cloud Storage-Archiv-Bucket kopiert und aus der Quelle gelöscht, und E-Mail-Benachrichtigungen werden an konfigurierte Empfänger gesendet, wenn Verarbeitungsfehler auftreten.

Der Agent führt die folgenden Aufgaben aus:

  • Authentifiziert sich bei Google Cloud mit einem Dienstkonto-JWT und speichert das OAuth2-Zugriffstoken zur Wiederverwendung über die Verarbeitungsdurchläufe.
  • Ruft eine Liste von PDF-Dateien aus einem konfigurierten Google Cloud Storage Quell-Bucket ab.
  • Übermittelt jede PDF-Datei an Google Document AI zur OCR-Text-Extraktion und sammelt den vollständigen extrahierten Text.
  • Sendet den extrahierten Text an ein LLM, um PII-Daten zu erkennen und zu extrahieren, und schreibt die Ausgabe in eine Datei auf einem FTP-Server.
  • Sendet den extrahierten Text an das LLM, um eine bereinigte Version mit allen entfernten PII zu erstellen, und schreibt die Ausgabe in eine Datei auf einem FTP-Server.
  • Archiviert verarbeitete PDF-Dateien in einen konfigurierten Ziel-Google Cloud Storage-Bucket und entfernt die Originale aus dem Quell-Bucket.
  • Sendet E-Mail-Benachrichtigungen an konfigurierte Empfänger, wenn Verarbeitungsfehler auftreten.

Dieses Dokument erklärt, wie man diesen KI-Agenten einrichtet und betreibt. Es behandelt die Architektur, Voraussetzungen und Schritte zur Installation, Konfiguration und zum Betrieb des KI-Agenten.

KI-Agentenarchitektur

Dieser KI-Agent verbindet Google Cloud Storage, Google Document AI, ein LLM und einen FTP-Server, um Text aus PDF-Dokumenten zu extrahieren und zu bereinigen. Ein typischer Verarbeitungsablauf folgt diesen Schritten:

  1. Der GCP Controller-Betrieb überprüft den Cache auf ein gültiges OAuth2-Zugriffstoken. Wenn keines vorhanden ist, wird der Betrieb Generate AccessToken ausgelöst, um sich mit Google Cloud unter Verwendung der konfigurierten Dienstkontodaten zu authentifizieren.
  2. Der Agent verbindet sich mit dem konfigurierten Google Cloud Storage-Quellbucket und ruft eine Liste der verfügbaren PDF-Dateien ab.
  3. Für jede Datei reicht der Agent die PDF bei Google Document AI zur OCR-Textextraktion ein und sammelt den vollständig extrahierten Text.
  4. Der Agent sendet den extrahierten Text an das LLM mit einem PII-Erkennungs-Prompt. Die identifizierten PII-Daten werden als JSON-Datei auf den FTP-Server geschrieben.
  5. Der Agent sendet den extrahierten Text an das LLM mit einem Datenbereinigungs-Prompt, um eine bereinigte Version zu erstellen. Der bereinigte Text wird als JSON-Datei auf den FTP-Server geschrieben.
  6. Die verarbeitete PDF wird in den Ziel-Google Cloud Storage-Archivbucket kopiert und dann aus dem Quellbucket gelöscht.
  7. Wenn ein Schritt in der Pipeline fehlschlägt, wird eine E-Mail-Benachrichtigung an die konfigurierten Empfänger mit Einzelheiten zum Fehler gesendet.

Workflow-Diagramm

Das folgende Diagramm zeigt die Hauptverarbeitungspipeline für den Document Compliance Agent (Google).

--- config: flowchart: padding: 20 nodeSpacing: 80 --- flowchart LR classDef default fill:white, stroke:black, stroke-width:3px, rx:15px, ry:15px JSP@{ shape: hex, label: "
Document Compliance
Agent (Google)" } GCSSRC[fab:fa-google
Google Cloud Storage
Source Bucket] DOCAI[fab:fa-google
Google Document AI] LLM[fas:fa-brain
LLM] FTP[fas:fa-server
FTP Server] GCSARC[fab:fa-google
Google Cloud Storage
Archive Bucket] EMAIL[fas:fa-envelope
Email] JSP <-->|1. List and get PDFs| GCSSRC JSP <-->|2. OCR request / extracted text| DOCAI JSP <-->|3. PII detection prompt / PII data| LLM JSP <-->|4. Clean data prompt / cleaned text| LLM JSP -->|5. Write output files| FTP JSP -->|6. Archive and delete PDF| GCSARC JSP -->|7. Error notification| EMAIL

Voraussetzungen

Sie benötigen die folgenden Komponenten, um diesen KI-Agenten zu verwenden.

Harmony-Komponenten

Sie müssen über eine Jitterbit Harmony-Lizenz mit Zugriff auf die folgenden Komponenten verfügen:

  • Jitterbit Studio
  • Document Compliance Agent (Google), der als Lizenz-Add-on erworben wurde

Unterstützte Endpunkte

Der KI-Agent verbindet sich mit den folgenden Endpunkten. Sie können andere Systeme integrieren, indem Sie die Endpunktkonfigurationen und Workflows des Projekts anpassen.

Großes Sprachmodell (LLM)

Der Agent verwendet Google Vertex AI, um auf große Sprachmodelle für die Erkennung von PII und die Datenbereinigung zuzugreifen. Das Projekt ist standardmäßig so konfiguriert, dass es Gemini 2.5 Flash verwendet. Sie können ein anderes von Vertex AI unterstütztes Modell verwenden, indem Sie die Projektvariable GCP_Model aktualisieren. Sie müssen ein Google Cloud-Projekt mit aktivierter Vertex AI API und ein Dienstkonto mit der Rolle Vertex AI-Benutzer haben.

Google Cloud Storage

Der Agent verwendet Google Cloud Storage sowohl als PDF-Quelle als auch als Archivziel. Sie müssen ein Google Cloud-Projekt mit aktivierter Cloud Storage API, zwei konfigurierte Cloud Storage-Buckets (einen für eingehende PDF-Dateien und einen für das Archivieren verarbeiteter Dateien) und ein Dienstkonto mit der Rolle Storage Object Admin für beide Buckets haben.

Google Document AI

Der Agent verwendet Google Document AI für die OCR-Textextraktion aus PDF-Dateien. Sie müssen die Cloud Document AI API in Ihrem Google Cloud-Projekt aktiviert, einen Document AI-Prozessor erstellt und ein Dienstkonto mit der Rolle Document AI API-Benutzer haben.

FTP

Der Agent schreibt verarbeitete Ausgabedateien (PII-Daten und bereinigten Text) auf einen FTP-Server. Sie müssen einen FTP-Server haben, der von Jitterbit aus zugänglich ist, mit gültigen Verbindungsdaten.

E-Mail

Der Agent sendet Fehlermeldungen über SMTP-E-Mail. Die Standardkonfiguration verwendet Gmail (smtp.gmail.com). Sie müssen ein Absender-E-Mail-Konto mit aktiviertem SMTP-Zugang haben und, falls Sie Gmail verwenden, ein App-Passwort konfiguriert haben.

Installation, Konfiguration und Betrieb

Befolgen Sie diese Schritte, um diesen KI-Agenten zu installieren, zu konfigurieren und zu betreiben:

  1. Projekt herunterladen und installieren
  2. GCP-Ressourcen konfigurieren
  3. Projektvariablen konfigurieren
  4. Verbindungen testen
  5. Projekt bereitstellen
  6. Projekt-Workflows überprüfen
  7. Projekt-Workflows auslösen

Für Troubleshooting-Anleitungen siehe Troubleshooting.

Projekt herunterladen und installieren

Befolge diese Schritte, um das Studio-Projekt für den KI-Agenten zu installieren:

  1. Melde dich im Harmony-Portal unter https://login.jitterbit.com an und öffne den Marktplatz.

  2. Suche den KI-Agenten mit dem Namen Document Compliance Agent (Google). Um den Agenten zu finden, benutze die Suchleiste oder wähle im Bereich Filter unter Typ KI-Agent aus, um die Anzeige auf KI-Agenten zu beschränken.

  3. Klicke auf den Link Dokumentation des Agenten, um dessen Dokumentation in einem separaten Tab zu öffnen. Halte den Tab geöffnet, um später darauf zurückzugreifen.

  4. Klicke auf Projekt starten, um einen Konfigurationsdialog zu öffnen.

    Hinweis

    Wenn du den KI-Agenten noch nicht gekauft hast, wird stattdessen Diesen Agenten erhalten angezeigt. Klicke darauf, um einen Informationsdialog zu öffnen, und klicke dann auf Absenden, damit ein Vertreter dich bezüglich des Kaufs des KI-Agenten kontaktiert.

    Tipp

    Der Konfigurationsdialog enthält eine Warnung, die besagt, dass die Vorlage nicht importiert werden soll, bevor die Endpunktanpassungen angewendet werden. Diese Warnung gilt nicht für diesen KI-Agenten und kann ignoriert werden. Befolge stattdessen die empfohlene Reihenfolge der Schritte in dieser Dokumentation.

  5. Wähle im Dialog Neues Projekt erstellen eine Umgebung aus, in der das Studio-Projekt erstellt werden soll, und klicke dann auf Projekt erstellen.

  6. Nachdem der Fortschrittsdialog anzeigt, dass das Projekt erstellt wurde, benutze den Dialoglink Gehe zu Studio oder öffne das Projekt direkt von der Studio-Seite Projekte aus.

GCP-Ressourcen konfigurieren

Bevor du die Projektvariablen konfigurierst, richte die erforderlichen Google Cloud Platform-Ressourcen ein.

Erforderliche APIs aktivieren

  1. Öffne die Google Cloud Console und wähle dein Projekt aus.

  2. Öffne das Navigationsmenü und gehe zu APIs & Dienste > Bibliothek.

  3. Suche nach und aktiviere jede der folgenden APIs:

    • Cloud Storage API
    • Cloud Document AI API
    • Vertex AI API

Erstellen eines Dienstkontos

  1. Öffnen Sie in der Google Cloud Console IAM & Admin > Dienstkonten und klicken Sie auf Dienstkonto erstellen.

  2. Geben Sie einen Namen für das Dienstkonto ein und klicken Sie auf Erstellen und Fortfahren.

  3. Weisen Sie dem Dienstkonto die folgenden IAM-Rollen zu:

    • Storage Object Admin (erforderlich zum Lesen, Archivieren und Löschen von Dateien in beiden Cloud Storage-Buckets)
    • Document AI API User (erforderlich für die OCR-Textextraktion)
    • Vertex AI User (erforderlich für LLM-Inferenz)
  4. Klicken Sie auf Fertig, um das Dienstkonto zu erstellen.

  5. Klicken Sie in der Liste der Dienstkonten auf das gerade erstellte Dienstkonto. Öffnen Sie die Registerkarte Schlüssel, klicken Sie auf Schlüssel hinzufügen > Neuen Schlüssel erstellen, wählen Sie JSON aus und klicken Sie auf Erstellen. Die Schlüsseldatei wird automatisch heruntergeladen.

  6. Öffnen Sie die heruntergeladene JSON-Schlüsseldatei und notieren Sie die folgenden Werte zur Verwendung in den Projektvariablen:

    • Der Wert client_email entspricht der Projektvariablen GCP_clientEmail.
    • Der Wert private_key entspricht der Projektvariablen GCP_privateKey.
    • Der Wert private_key_id entspricht der Projektvariablen GCP_privateKeyId.

Erstellen von Cloud Storage-Buckets

  1. Öffnen Sie in der Google Cloud Console Cloud Storage > Buckets und klicken Sie auf Erstellen.

  2. Erstellen Sie den Quell-Bucket, in dem PDF-Dateien zur Verarbeitung abgelegt werden. Notieren Sie den Bucket-Namen für die Projektvariable GCP_Get_BucketName.

  3. Erstellen Sie einen zweiten Bucket, der als Archivziel für verarbeitete Dateien dient. Notieren Sie seinen Namen für die Projektvariable GCP_Archive_BucketName.

  4. Stellen Sie sicher, dass sich beide Buckets in derselben Google Cloud-Region befinden.

Erstellen eines Document AI-Prozessors

  1. Öffnen Sie in der Google Cloud Console Document AI > Meine Prozessoren und klicken Sie auf Prozessor erstellen.

  2. Wählen Sie Document OCR als Prozessor-Typ aus.

  3. Geben Sie einen Namen für den Prozessor ein, wählen Sie eine Region aus und klicken Sie auf Erstellen. Notieren Sie die Region für die Projektvariable GCP_DocumentAI_Location.

  4. Nachdem der Prozessor erstellt wurde, kopieren Sie die Prozessor-ID von der Detailseite des Prozessors. Verwenden Sie diesen Wert für die Projektvariable GCP_Processor_ID.

Projektvariablen konfigurieren

Im im Marketplace installierten Studio-Projekt Werte für die folgenden Projektvariablen festlegen.

Um Projektvariablen zu konfigurieren, verwenden Sie das Aktionsmenü des Projekts und wählen Sie Projektvariablen aus, um die Konfigurationsleiste zu öffnen.

Google Cloud Platform

Variablenname Beschreibung
GCP_Project_ID Google Cloud-Projekt-ID.
GCP_clientEmail E-Mail-Adresse des Dienstkontos aus dem JSON-Schlüssel des Dienstkontos.
GCP_privateKeyId Private Schlüssel-ID aus dem JSON-Schlüssel des Dienstkontos.
GCP_privateKey Privater Schlüssel aus dem JSON-Schlüssel des Dienstkontos im PEM-Format.
GCP_tokenURI OAuth2-Token-Endpunkt-URI zur Authentifizierung bei Google Cloud. Verwenden Sie den Standardwert: https://oauth2.googleapis.com/token.
GCP_scope OAuth2-Bereich für das Dienstkonto. Verwenden Sie den Standardwert: https://www.googleapis.com/auth/cloud-platform.

Google Document AI

Variablenname Beschreibung
GCP_DocumentAI_Location Standortcode für die Document AI API (zum Beispiel us).
GCP_Processor_ID Document AI-Prozessor-ID. Siehe Erstellen eines Document AI-Prozessors.

Google Vertex AI

Variablenname Beschreibung
GCP_VertexAI_Location Vertex AI-Region (zum Beispiel us-central1).
GCP_Model Name des Gemini-Modells, das zur Erkennung von PII und zur Datenbereinigung verwendet wird (zum Beispiel gemini-2.5-flash).
GCP_temperature LLM-Sampling-Temperatur. Niedrigere Werte erzeugen deterministischere Antworten (zum Beispiel 0.1).
GCP_maxOutputTokens Maximale Anzahl von Tokens in der LLM-Antwort (zum Beispiel 8192).

Google Cloud Storage

Variablenname Beschreibung
GCP_Get_BucketName Name des Google Cloud Storage-Quellbuckets, in dem PDF-Dateien zur Verarbeitung abgelegt werden.
GCP_Archive_BucketName Name des Google Cloud Storage-Archivbuckets, in den verarbeitete Dateien nach der Analyse verschoben werden.

FTP

Variablenname Beschreibung
FTP_Host Hostname des FTP-Servers.
FTP_UserName FTP-Benutzername.
FTP_Password FTP-Passwort.
FTP_File_Path Pfad zum Zielordner auf dem FTP-Server (zum Beispiel /PDF_Parser/).

Email

Variablenname Beschreibung
SMTP_Host Hostname des SMTP-Servers zum Versenden von Fehlermeldungen (zum Beispiel smtp.gmail.com).
SMTP_Username SMTP-Benutzername.
SMTP_Password SMTP-Passwort. Für Gmail ein App-Passwort in den Sicherheitseinstellungen Ihres Google-Kontos generieren.
Email_From_Recipients Absender-E-Mail-Adresse für Fehlermeldungen.
Email_To_Recipients Empfänger-E-Mail-Adresse(n) für Fehlermeldungen.

Agent

Variablenname Beschreibung
debug Auf 1 setzen, um das Debug-Logging zu aktivieren, oder auf 0, um es zu deaktivieren.

Verbindungen testen

Testen Sie die Endpunktkonfigurationen, um die Konnektivität mit den definierten Projektvariablenwerten zu überprüfen.

Um Verbindungen zu testen, gehen Sie zum Tab Projektendpunkte und -verbinder in der Design-Komponentenpalette , fahren Sie mit der Maus über jeden Endpunkt und klicken Sie auf Test.

Projekt bereitstellen

Projekt bereitstellen das Studio-Projekt.

Um das Projekt bereitzustellen, verwenden Sie das Aktionsmenü des Projekts und wählen Sie Bereitstellen.

Projekt-Workflows überprüfen

Das Studio-Projekt enthält einen Workflow, der die Verarbeitungs-Pipeline des Document Compliance Agent (Google) implementiert.

GCP PDF-Parser

Operation Beschreibung
GCP Controller Überprüft den Cache auf ein gültiges Zugriffstoken und initialisiert die Verarbeitungs-Pipeline.
AccessToken generieren Authentifiziert sich bei Google Cloud mit Dienstkonto-Anmeldeinformationen und ruft ein OAuth2-Zugriffstoken ab.
Liste der PDFs aus Google Cloud Storage lesen Ruft eine Liste verfügbarer PDF-Dateien aus dem Quell-Cloud-Speicher-Bucket ab.
Daten aus PDF mit Google Document_AI extrahieren Reicht eine PDF-Datei bei Google Document AI zur OCR-Textextraktion ein.
PII-Daten mit Google Vertex_AI extrahieren Sendet den extrahierten Text an das LLM, um PII-Daten zu erkennen und zu extrahieren, und schreibt das Ergebnis dann auf den FTP-Server.
Nicht-PII-Daten mit Google Vertex_AI extrahieren Sendet den extrahierten Text an das LLM, um eine PII-freie, bereinigte Version zu erstellen, und schreibt das Ergebnis dann auf den FTP-Server.
Datei an FTP senden Schreibt eine verarbeitete JSON-Nutzlast an das konfigurierte Ziel des FTP-Servers.
PDFs aus Google Cloud Storage kopieren Kopiert die verarbeitete PDF vom Quell-Bucket in den Archiv-Bucket.
PDFs aus Google Cloud Storage löschen Löscht die verarbeitete PDF aus dem Quell-Bucket, nachdem sie archiviert wurde.
Fehlermeldung Sendet eine E-Mail-Benachrichtigung mit Fehlerdetails, wenn ein Verarbeitungsfehler auftritt.
GCP Controller

Die GCP Controller-Operation dient als Einstiegspunkt für den Workflow. Sie überprüft den Cache auf ein vorhandenes OAuth2-Zugriffstoken. Wenn ein gültiges Token gefunden wird, fährt der Workflow direkt mit dem Lesen von PDF-Dateien aus dem Cloud Storage fort. Wenn kein Token vorhanden ist, löst die Operation Generate AccessToken aus, um eines zu erhalten, bevor sie fortfährt.

Generate AccessToken

Die Generate AccessToken-Operation authentifiziert den Agenten mit Google Cloud unter Verwendung der konfigurierten Dienstkonto-Anmeldeinformationen. Sie erstellt ein JWT aus dem privaten Schlüssel des Dienstkontos, signiert es und tauscht es am Google OAuth2-Token-Endpunkt aus, um ein Zugriffstoken abzurufen. Das Token wird für die Wiederverwendung in nachfolgenden Operationen im Cache gespeichert.

Read List of PDFs from Google Cloud Storage

Die Read List of PDFs from Google Cloud Storage-Operation sendet eine authentifizierte HTTP-Anfrage an die Cloud Storage API, um eine Liste von PDF-Dateinamen im Quell-Bucket abzurufen. Die Operation durchläuft die zurückgegebene Liste und löst die Extraktionspipeline für jede Datei aus.

Extract data from PDF using Google Document_AI

Die Extract data from PDF using Google Document_AI-Operation reicht die PDF-Datei über den konfigurierten Prozessor an die Google Document AI API ein. Die API gibt den extrahierten Textinhalt zurück, den die Operation für die Verwendung in den nachfolgenden LLM-Analyse-Schritten speichert.

Extract PII data using Google Vertex_AI

Die Extract PII data using Google Vertex_AI-Operation sendet den extrahierten Dokumenttext über die Vertex AI API an das konfigurierte Gemini-Modell mit einer Aufforderung, persönlich identifizierbare Informationen zu identifizieren und zu extrahieren. Die LLM-Antwort wird analysiert und bereinigt und dann an die Send File to FTP-Operation zur Lieferung an das konfigurierte FTP-Ziel übergeben.

Extract Non_PII data using Google Vertex_AI

Die Extract Non_PII data using Google Vertex_AI-Operation sendet den extrahierten Dokumenttext über die Vertex AI API an das Gemini-Modell mit einer Aufforderung, eine bereinigte Version mit allen entfernten PII zu erstellen. Die bereinigte Antwort wird an die Send File to FTP-Operation zur Lieferung an das konfigurierte FTP-Ziel übergeben.

Datei an FTP senden

Die Send File to FTP-Operation schreibt die verarbeiteten JSON-Daten an den FTP-Server unter dem Pfad, der durch die Projektvariable FTP_File_Path konfiguriert ist. Diese Operation wird einmal für PII-Ausgaben und einmal für Nicht-PII-Ausgaben für jede verarbeitete PDF-Datei aufgerufen.

PDFs aus Google Cloud Storage kopieren

Die Copy PDFs from Google Cloud Storage-Operation verwendet die Cloud Storage API, um die verarbeitete PDF vom Quell-Bucket in den Archiv-Bucket zu kopieren und so einen dauerhaften Nachweis der verarbeiteten Datei zu erstellen.

PDFs aus Google Cloud Storage löschen

Die Delete PDFs from Google Cloud Storage-Operation sendet eine authentifizierte DELETE-Anfrage an die Cloud Storage API, um die verarbeitete PDF aus dem Quell-Bucket zu entfernen, nachdem sie erfolgreich archiviert wurde, um zu verhindern, dass sie bei nachfolgenden Durchläufen erneut verarbeitet wird.

Fehlerbenachrichtigung

Die Error Notification-Operation erstellt eine Fehler-E-Mail mit dem Workflow-Namen, dem Zeitstempel und den Fehlerdetails und sendet sie an die in der Projektvariable Email_To_Recipients konfigurierten Adressen. Nach dem Senden der Benachrichtigung wird der Fehler ausgelöst, um die weitere Ausführung zu stoppen.

Triggern der Projekt-Workflows

Um den Document Compliance Agent (Google) auszuführen, implementieren und starten Sie die GCP Controller-Operation. In Studio fahren Sie mit der Maus über die Operation und klicken auf das Deploy and Run-Symbol in der oberen rechten Ecke der Operationsteilfläche.

Um die Pipeline zu automatisieren, konfigurieren Sie Betriebspläne für die GCP Controller-Operation, um sie in der von Ihnen bevorzugten Häufigkeit auszuführen.

Fehlersuche

Wenn Sie auf Probleme stoßen, überprüfen Sie die Betriebsprotokolle für detaillierte Informationen zur Fehlersuche.

Für zusätzliche Unterstützung kontaktieren Sie Jitterbit-Support.