LLM Prompt Sanitization: Verhinderung von PII-Lecks
Persönlich identifizierbare Informationen (PII) umfassen alle Daten, die eine bestimmte Person eindeutig identifizieren könnten, wie z. B. Sozialversicherungsnummern, E-Mail-Adressen, Telefonnummern oder proprietäre API-Schlüssel.
Das Einfügen roher Kundendaten in LLMs von Drittanbietern (wie ChatGPT oder Claude) stellt einen massiven Verstoß gegen die DSGVO-Compliance dar. Dieser Sanitizer nutzt komplexe RegEx-Muster, um sensible Entitäten vollständig clientseitig zu erkennen und zu maskieren, bevor die Eingabeaufforderung jemals das Netzwerk berührt.
Formel & Berechnungsmethode
Rohtext + RegEx-Detektoren ➔ MASKED_ENTITY ➔ API-Aufruf ➔ Neuinjektion
Das System ersetzt echte E-Mails durch Platzhalter wie „[EMAIL_1]“, sendet den anonymisierten Text an die KI und tauscht nach Erhalt der Antwort automatisch die echten E-Mails wieder in den Text ein.
Best Practices & Tipps
- Vertrauen Sie KI-Anbietern niemals mit Geheimnissen: Auch wenn ein KI-Anbieter behauptet, dass er nicht auf API-Eingaben trainiert, können serverseitige Protokolle gehackt oder vorgeladen werden. Wenn die Daten Ihren Browser nie verlassen, können sie nicht verloren gehen.
- Interne IDs bereinigen: Stellen Sie sicher, dass Sie nicht nur Namen und E-Mails, sondern auch interne Datenbank-UUIDs oder sequentielle Kunden-IDs bereinigen, da diese Informationen über Ihre Waage oder Ihr Benutzervolumen an Konkurrenten weitergeben können.
- Maskierte Ausgabe manuell überprüfen: Die RegEx-Erkennung ist nicht perfekt. Überprüfen Sie die bereinigte Ausgabe immer visuell, um sicherzustellen, dass eine E-Mail-Adresse oder eine Telefonnummer, die stark vom Standard abweicht, nicht durch die Filter geschlüpft ist.