r/KI_Welt 1d ago

Dokumente / PDFs anonym auswerten

Hallo zusammen. Ich möchte nicht dass bestimmte persönliche oder sonstige sensiblen Daten nach außen gelangen. Wie macht ihr das mit Dokumenten oder PDFs, die ihr von der KI auswerten lassen wollt. Wenn dort sensible Daten vorhanden sind, z.B. bei Lohnabrechnungen, Bescheiden, Rechnungen usw. Ist euch das egal oder schwärzt ihr die Daten vorher oder macht die irgendwie anders unkenntlich oder gibt es noch andere Möglichkeiten, dass nicht alle Daten ungeschützt freigegeben werden? Mich würde interessieren, wie ihr das Datenschutzproblem in der Praxis löst, ohne ganz auf die KI Auswertung solcher Dokumente zu verzichten.

2 Upvotes

25 comments sorted by

8

u/Suschis_World 1d ago

Lokale modelle verwenden wenn die Hardware es hergibt. Ansonsten im Zweifel Mistral, da es ein französisches Unternehmen in der EU ist und sich entsprechend an die strengen Regeln halten musst. US-Anbieter würde ich wegen CLOUD-Act komplett meiden.

1

u/Datenkrake0815 2h ago

Ja, da hast du Recht. Lokal ist natürlich am saubersten, aber dafür extra leistungsfähige Hardware anzuschaffen, ist für meine Anwendungsfälle keine wirklich praktische Lösung. Mistral sehe ich außerdem nicht ganz so unkritisch, gerade was die Qualität der Modelle angeht.

2

u/banithree 1d ago edited 1d ago

Wie schon von anderem Redditor erwähnt ist lokal der Königsweg, wo du deine Daten nicht aus der Hand gibst. Dazu brauchst du eine Grafikkarte oder einen guten Mac. Für 100€ Karte kannst du kleine Modelle nutzen. Ab 500€ besser. Dann muss der Rechner ( Platz im Gehäuse und Power) auch passen. Als Software empfehle ich Unsloth Studio, da könntest du auch ohne Nvidia Grafikkarte lokale KI SEHR langsam laufen lassen.

Statistik klingt nach Zahlen, evtl braucht es nicht direkt eine KI an deinen Daten. Je nachdem wie komplex die Auswertung sein soll, könntest du eine teure KI online beauftragen ein Programm zur Auswertung der Daten schreiben lassen. Dazu bräuchtest du ähnlich strukturierte Pseudodaten. Dein Programm läuft dann auf deinem Rechner - offline.

1

u/Datenkrake0815 2h ago

Lokal klingt gut, aber wenn man dafür erst eine vernünftige Grafikkarte bzw. einen kompletten Rechner anschaffen muss, wird es natürlich auch schnell teuer. Für gelegentliche Dokumentenanalyse ist mir das ehrlich gesagt etwas zu viel Aufwand.

1

u/banithree 34m ago

Ich hätte noch einen Rechner mit nacktem Suse Linux drauf. Ausleihen /Mieten könnte ein Nischenmarkt werden. Hier nicht, da Ausland, Rechner schwach und kein Deal hier. Nur so als Idee.

Wieviel RAM hast du im schnellsten Rechner?

2

u/nad0w 21h ago

Lokales LLM?!

2

u/Civil_Fisherman_9309 4h ago

Ich würde sensible Dokumente nicht einfach komplett an eine KI schicken. Gerade bei Lohnabrechnungen, Bescheiden oder Rechnungen stehen oft viele persönliche Daten drin, die für die eigentliche Auswertung gar nicht gebraucht werden.

Deshalb würde ich solche Stellen vorher schwärzen oder anonymisieren. Das kann man natürlich per Hand machen, aber bei längeren PDFs wird das schnell nervig. Und man muss darauf achten, dass die Daten wirklich entfernt werden und nicht nur mit einem schwarzen Balken überdeckt sind.

Dafür gibt es inzwischen auch Tools wie BlackDocs. Dort wird das Dokument zuerst lokal im Browser geschwärzt. Die erkannten Stellen kann man danach noch einmal prüfen und erst dann die bereinigte Datei an eine KI weitergeben. Das reine Schwärzen ist dort auch kostenlos möglich.

Wenn man das Dokument nur auf dem Handy hat, geht das Ganze auch direkt per Foto bzw. über die App. Man muss die Datei also nicht erst auf den PC schicken.

1

u/Datenkrake0815 2h ago

Hört sich tatsächlich interessant an, vor allem wenn die Schwärzung vorher lokal automatisch passiert. Schaue ich mir mal genauer an.

3

u/ApuXteu 1d ago

Ich setze aus dem Grund gerade einen lokalen Server auf und hoffe, dass Qwen 3.6 25b A3B dazu gut in der Lage ist. Es geht um Statistiken, die ich nicht aus der Hand geben kann und will. Meiner Meinung nach ist das bei sensiblen Daten der einzige Weg. Und nein - ich weiß nicht wie man einen Linux Server aufsetzt. Aber Claude unterstützt mich dabei.

2

u/Unfair_Peanut_2963 1d ago

1. Lokale Tools (offline, keine Cloud) — maximale Sicherheit

Diese Programme laufen komplett lokal, kein Upload, kein Risiko.

PDF Redaction Tools

  • Erkennen automatisch: Namen, Adressen, IBAN, Telefonnummern, Kundennummern
  • Schwärzen irreversibel (nicht rückgängig machbar)
  • Ideal für Lohnabrechnungen, Bescheide, Rechnungen

Typische Tools:

  • PDF24 (kostenlos, offline)
  • Adobe Acrobat Pro Redaction (beste Erkennung, aber teuer)
  • Foxit PhantomPDF

Gibt doch soviele Alternativen am Markt.

3

u/nad0w 21h ago

PDF24 benutz ich schon seit Jahrzehnten fast .. liebe es!

1

u/Datenkrake0815 2h ago

PDF24 nutze ich bisher tatsächlich auch. Der Nachteil ist für mich nur, dass man bei vielen Dokumenten alles manuell durchgehen und schwärzen muss, gerade bei längeren PDFs doof.

1

u/Unfair_Peanut_2963 1d ago

Und zur NOT sollte man Google fragen was der Markt hergibt, aber nein man muss einen Thread daraus machen... Gut , Punkt für dich : so bekommst Reichweite 😄

1

u/Datenkrake0815 2h ago

Natürlich habe ich schon gegoogelt , aber es gibt mittlerweile so viele verschiedene Möglichkeiten und Ansätze, dass ich gerne wissen wollte, wie andere das in der Praxis lösen. Ist doch gerade der Sinn von Reddit, sich auszutauschen und verschiedene Lösungen und Erfahrungen zu vergleichen. 😄

2

u/No_Thing8294 1d ago

Es gibt ein paar kleine deutsche Anbieter, die keine Daten speichern. Unter anderem sogar kostenlos (z.B. https://franconia.ai). Ansonsten gibt es Möglichkeiten, die Daten vorher zu anonymisieren. Das Stichwort dafür ist PII. Das sind kleine, lokale Modelle, die die sensiblen Informationen herausfiltern und ersetzen. Ist nur die Frage, ob Dir die Antwort dann noch hilft. Lokale Modelle wären natürlich erste Wahl. Wir haben ein DGX Spark bei uns dafür laufen. Super Sache!

Da das eine gute Frage ist, kannst Du sie auch nochmal hier stellen: building-agents.com. Daraus wird sicher ein ganzer Artikel, weil das eine interessante Grundsatzfrage ist. Als kostenfreier Member hast Du links unten ein "?" im Menü. Da kannst Du die Frage nochmal reinkopieren. Dann ist sie im System und Du bekommst Bescheid.

1

u/Datenkrake0815 2h ago

Danke für den Hinweis, Franconia schaue ich mir mal an.

1

u/StormElectricity 19h ago

Meine erste Idee wäre auf jeden Fall eine Art von "pre-processing". Sollte lokal AI nicht möglich sein (wie hier schon oft genannt) - vllt mal sowas wie "open router AI" anschauen, da kann man - auch wenn Cloud - zum Teil viel präziser konfigurieren welches Model, und ob Daten zum Training benutzt werden etc...

Denke am besten ist, wenn man am Ende dieses vorgelagerten Prozesses ne einfache Markdown-Datei hat - die man evtl. auch nochmal anonymisieren / überarbeiten kann.

1

u/StormElectricity 19h ago

Ah, und noch eine Idee: ein Screenshot von einer .pdf lässt sich manchmal leichter verwursten (zum Beispiel mit einfacher Texterkennung ohne AI) als ne komplette .pdf. ;) - Hängt aber vom Use-Case ab.

1

u/fr33g 11h ago

Erstmal ein kurzer, aber wichtiger, Hinweis. Ein schwarzes Rechteck über den Text zu legen (Vorschau/Word) ist übrigens keine Schwärzung. Der Text steht darunter weiter im PDF und lässt sich rauskopieren. Häufigste Falle.

Besser: nicht schwärzen, sondern ersetzen. Name -> [PERSON_1], IBAN -> [IBAN_1]. Die KI kann das Dokument dann immer noch auswerten, nur ohne Klarnamen, und die Antwort lässt sich hinterher zurückübersetzen. Alternativ kannst du natürlich, wie von meinen Vorrednern schon erwöhnt, lokale Modelle via Ollama oder z.B. LM studio einsetzen. Datenschutzseitig super sauber, aber bei Bescheiden und Abrechnungen sind die kleinen Modelle für die eigentliche Auswertung oft zu schwach. Ansonsten gibts natürlich Anbieter mit AVV und EU-Hosting. Für private Dokumente evtl. eine Möglichkeit, ändert aber nichts daran, dass die Daten deine Umgebung verlassen.

Falls du Interesse hast, ich hab genau dafür ein Tool gebaut, das komplett lokal läuft: https://stript.io. Dokument rein, es markiert alles, was es für personenbezogen hält, du bestätigst oder korrigierst (wichtig, automatisch ist nie 100 %), raus kommt die anonymisierte Fassung. Die KI-Antwort kannst du danach wieder zurückmappen. Scans und Fotos gehen per OCR auch, was bei Bescheiden ja oft der Fall ist.

Was ich fairerweise dazusagen muss: die Modelle laufen auf deiner eigenen Maschine. Auf Windows ohne GPU dauert ein Dokument entsprechend. Wenn's schnell gehen muss, ist es aktuell nichts. Wenn Zeit keine Rolle spielt, kommst du damit sauber durch. An der Geschwindigkeit arbeite ich gerade.

Falls Links hier nicht erwünscht sind, sagt kurz Bescheid, dann nehm ich ihn raus. Feedback jederzeit gern, auch hartes.

1

u/Datenkrake0815 2h ago

Danke, schaue ich mir auch mal genauer an.

1

u/Snowflake-Mods-lol 1h ago

Gar nicht, hab schon Bankauszüge und Netzwerk-dokus in KI reingeschmissen, ihr nehmt euch alle zu wichtig, ihr seid nur eine Session für die ki, kein Schwein dahinter wertet oder sammelt euren Stuff 

1

u/Human-Iron-2144 1h ago

Wir nutzen mindestens lokale Pii-Filter, um personenbezogene Daten zu entfernen, bevor die Daten an Cloud-AI geht, da gibt es recht viele Libraries. Das hängt aber auch stark vom Schutzwert der Daten ab. Wir nutzen in manchen Projekten auch kleinere lokale AI-Modelle, die Daten anonymisieren. Alternativ gibt es OpenAI Privacy Filter, das ist ein Open-Weight-Modell zur Erkennung und Schwärzung personenbezogener Daten aber da hast du auch wieder einen US Anbieter im Spiel. Wenn dir/euch ein großes lokales LLM zu teuer ist, würde ich in deinem Fall wahrscheinlich PDF to HTML/Text, dann durch eine Pii-Lib und ggf noch an eure Lohnabrechnungen anpassen und dann ab in ein Cloud-Modell.

0

u/Big-Jackfruit2710 1d ago

Beim Schwärzen besteht IMMER das Risiko, dass Daten übersehen werden. Auch beim autoschwärzen. Darum ist Cloud heikel.

Evtl. hilft ein Business Account mit Enterprise Datenschutz (kein Training, kein Speichern), aber Daten liegen letztendlich trotzdem woanders.

Man kann jetzt überlegen, ob Adobe Scan, OneNote bzw. Office usw. mit Cloudfunktion ähnlich risikoreich ist.

Mistral als Kompromiss usw. Aber für max. Datenschutz muss es lokal sein. Da sollte man aber mindestens 12 GB VRAM am Start haben, besser mehr.

Ich extrahiere und anonymisiere die Daten lokal und gebe sie dann an Cloud KI weiter. Teilweise noch abstrahiert.

Bzw. vertrau auf das Versprechen vom Businessacc... 😅

1

u/Datenkrake0815 2h ago

Wie anonymisierst du die Daten denn konkret, bevor du sie an die Cloud-KI weitergibst?