Erklärstück
RAG und DSGVO
„Dürfen wir unsere eigenen Dokumente überhaupt durch ein Sprachmodell laufen lassen?“
Der Weg
Zwei Wege, die man auseinanderhalten muss
Einmal je Dokument
Aufnahme eines Dokuments. Ein Bestandsdokument wird in Abschnitte zerlegt, jeder Abschnitt behält Herkunft und Seitenzahl, wird in einen Vektor überführt und in der Datenbank abgelegt. Das geschieht einmal je Dokument und ist kein Training: der Inhalt geht in eine Datenbank, nicht in ein Modell.
Das ist kein Training. Der Inhalt landet in einer Datenbank, die Sie leeren können, nicht in Gewichten, aus denen ihn niemand wieder herausbekommt.
Bei jeder Frage
Beantwortung einer Frage. Die Frage wird in denselben Vektorraum überführt, die nächstgelegenen Abschnitte werden gesucht, und nur diese Abschnitte gehen zusammen mit der Frage an das Modell. Die Antwort trägt die Fundstellen der benutzten Abschnitte. Findet die Suche nichts Passendes, sagt die Antwort das.
Das Modell sieht nie das ganze Archiv, sondern nur die Abschnitte, die die Rolle des Fragenden freigibt. Wer die Personalakte nicht sehen darf, bekommt auch keine Antwort daraus.
Die Frage hinter der Frage
„Dürfen wir das?" meint in der Praxis fast immer eine von drei Sorgen: Unsere Dokumente landen bei einem amerikanischen Anbieter. Unsere Dokumente werden Teil eines Modells und tauchen bei anderen wieder auf. Wir bekommen sie nicht mehr heraus.
Alle drei sind berechtigt, und alle drei lassen sich beantworten, aber nur, wenn man sie auseinanderhält. Sie betreffen unterschiedliche Stellen im Ablauf und haben unterschiedliche Antworten.
Datenbank oder Modellgewicht: der Unterschied, an dem alles hängt
Beim Retrieval passiert mit Ihren Dokumenten zweierlei, und der Unterschied ist datenschutzrechtlich der wichtigste des ganzen Themas.
In die Datenbank geht der Text: in Abschnitte zerlegt, jeder mit einer Zahlenfolge daneben, die seine Bedeutung abbildet. Diese Datenbank steht in Ihrer Umgebung. Sie können sie einsehen, exportieren, einzelne Einträge löschen und sie im Ganzen leeren. Ein Löschbegehren nach Art. 17 DSGVO lässt sich darin erfüllen wie in jeder anderen Datenbank.
In das Modell geht nichts. Das Modell bekommt bei jeder Anfrage die Abschnitte, die zur Frage passen, formuliert daraus eine Antwort und vergisst sie. Es lernt dabei nicht. Die Gewichte, aus denen es besteht, sind nach der Anfrage dieselben wie davor.
Das ist der Unterschied zum Training. Beim Training werden Inhalte in die Gewichte eingerechnet, und aus Gewichten bekommt sie niemand gezielt wieder heraus. Es gibt kein Verfahren, das ein einzelnes Dokument aus einem trainierten Modell entfernt. Wer Kundendaten dorthin gibt, hat ein Problem, das sich nicht mehr lösen, sondern nur noch verwalten lässt.
Deshalb steht in jedem Vertrag, den wir schließen, die Zusage, dass mit Ihren Inhalten nicht trainiert wird. Und deshalb ist sie prüfbar: Sie steht auch im Vertrag mit dem Modellanbieter, über dessen Endpunkt wir zugreifen.
Wer ist hier wessen Auftragsverarbeiter
Die Kette ist kürzer, als sie aussieht, und sie muss vollständig im Vertrag stehen.
Sie sind Verantwortlicher nach Art. 4 Nr. 7 DSGVO. Sie entscheiden über Zwecke und Mittel der Verarbeitung.
Wir sind Auftragsverarbeiter nach Art. 28. Der AV-Vertrag regelt, was wir mit den Daten tun dürfen, welche technischen und organisatorischen Maßnahmen gelten und wie lange etwas aufbewahrt wird.
Der Betreiber der Halle ist Unterauftragsverarbeiter. Er hat keinen Zugriff auf die Inhalte, stellt aber die Maschinen, auf denen sie liegen. Er gehört namentlich in die Liste der Unterauftragsverarbeiter, nicht als Kategorie.
Der Modellanbieter ist ebenfalls Unterauftragsverarbeiter, sobald Anfragen an seinen Endpunkt gehen. Auch er gehört namentlich in die Liste. Wo Modelle auf eigener Hardware laufen, entfällt er, und das ist einer der Gründe, aus denen Häuser mit hohen Anforderungen diesen Weg wählen.
Eine Liste, die einen dieser vier nicht nennt, ist unvollständig. Das fällt spätestens bei der ersten Prüfung auf.
Rechtsgrundlage: meist keine neue
Ein Missverständnis, das viel Zeit kostet: Retrieval schafft keinen neuen Verarbeitungszweck, solange es nur zugänglich macht, was ohnehin zulässig gespeichert ist.
Wer einen Rahmenvertrag zur Vertragsdurchführung speichert, darf ihn auch durchsuchbar machen. Die Verarbeitung dient demselben Zweck. Dasselbe gilt für Anlagendokumentationen, Bedingungswerke und technische Handbücher, in denen häufig gar keine personenbezogenen Daten stehen.
Anders liegt es an zwei Stellen, und beide brauchen eine eigene Prüfung:
Personalunterlagen. Wer Bewerbungen, Beurteilungen oder Krankmeldungen durchsuchbar macht, verarbeitet besonders schutzwürdige Daten und verschiebt oft auch den Zweck. Hier steht die rechtliche Prüfung vor der technischen, und in vielen Häusern endet sie mit einem Nein.
Auswertungen über Personen. Sobald aus dem Bestand Schlüsse über einzelne Beschäftigte gezogen werden könnten, wer wie oft welche Frage stellt, wer welche Vorgänge bearbeitet, ist das eine andere Verarbeitung als ein Wissenszugriff. Sie ist außerdem mitbestimmungspflichtig.
Löschung, praktisch
Drei Ebenen, und alle drei müssen funktionieren.
Der Bestand. Wird ein Dokument im Quellsystem gelöscht, muss es aus dem Index verschwinden. Das geschieht beim nächsten Abgleich, und wie oft der läuft, ist eine Festlegung, nicht eine Vermutung. Bei uns steht sie im Vertrag.
Der Index. Ein einzelner Abschnitt lässt sich gezielt entfernen. Das klingt selbstverständlich und ist es nicht: Wer den Index als eine große unstrukturierte Datei führt, kann einzelne Einträge nur durch Neuaufbau löschen.
Die Protokolle. Sie enthalten Fragen, Fundstellen und Zeitstempel und sind damit selbst personenbezogen. Ihre Aufbewahrungsdauer gehört in den Vertrag und in das Verzeichnis der Verarbeitungstätigkeiten. Neunzig Tage sind ein üblicher Wert; entschieden wird er bei Ihnen und nicht bei uns.
Rechte im Retrieval: die häufigste Fehlkonstruktion
Der naheliegende Weg ist, beim Indexieren zu vermerken, wer einen Abschnitt sehen darf. Er ist schnell gebaut und datenschutzrechtlich der schlechtere.
Er erzeugt einen zweiten Rechtebestand: eine Kopie Ihres Verzeichnisses, die veraltet, sobald jemand die Abteilung wechselt. Aus Sicht der DSGVO heißt das: Der tatsächliche Zugriff weicht von der dokumentierten Berechtigung ab, und zwar unbemerkt. Ein Verzeichnis der Verarbeitungstätigkeiten, das eine Berechtigungsstruktur beschreibt, die es so nicht mehr gibt, ist falsch.
Geprüft wird deshalb bei jeder einzelnen Anfrage gegen das Verzeichnis. Es gibt genau einen Rechtebestand, und das ist Ihrer. Was wegen fehlender Berechtigung wegfällt, steht als Verweigerung im Protokoll, und diese Zeile ist der Nachweis, dass die Prüfung stattgefunden hat.
Was in das Verzeichnis der Verarbeitungstätigkeiten gehört
Sechs Angaben, und sie sind alle absehbar:
Zweck der Verarbeitung. Kategorien betroffener Personen und Daten. Empfänger, einschließlich der Unterauftragsverarbeiter. Verarbeitungsort. Löschfristen je Datenart, getrennt nach Index und Protokoll. Technische und organisatorische Maßnahmen.
Diese Angaben liefern wir vollständig und in einer Form, die sich übernehmen lässt. Das Verzeichnis führen Sie. Es ist Ihre Pflicht nach Art. 30 DSGVO und bleibt es.
Die Grenze dieser Seite
Was hier steht, ist die technische Beschreibung und die Einordnung, die sich daraus ergibt. Eine Rechtsberatung ist es nicht und darf es nicht sein: Die Bewertung Ihres konkreten Falls trifft Ihre Rechtsabteilung oder Ihre Datenschutzbeauftragte.
Was wir dafür liefern, ist die Grundlage: vollständig, prüfbar und ohne Lücken an den Stellen, an denen es unbequem wird.
Fragen
Was dazu meistens gefragt wird
Ist RAG Training?
Nein. Beim Retrieval geht der Inhalt in eine Datenbank, aus der er wieder gelöscht werden kann. Beim Training geht er in Modellgewichte, aus denen ihn niemand gezielt entfernt. Das ist datenschutzrechtlich der entscheidende Unterschied, weil Art. 17 DSGVO ein Recht auf Löschung kennt.
Brauchen wir für RAG eine eigene Rechtsgrundlage?
In der Regel nicht zusätzlich zu der, auf der die Dokumente ohnehin verarbeitet werden. Wer einen Vertrag zulässig speichert, darf ihn auch durchsuchbar machen. Anders liegt es, wenn personenbezogene Daten für einen neuen Zweck ausgewertet werden, dann steht die Zweckänderung nach Art. 6 Abs. 4 DSGVO zur Prüfung.
Was ist mit dem Modellanbieter?
Er wird Unterauftragsverarbeiter und gehört namentlich in den AV-Vertrag. Zu prüfen sind drei Punkte: Verarbeitungsort, Zusage gegen Training mit übermittelten Inhalten und Aufbewahrungsdauer der Anfragen beim Anbieter.
Weiterlesen
Was wir dazu tun
Kontakt
Eine Frage dazu, die offen bleibt
Schreiben Sie sie uns. Die Antwort kommt als Text und nicht als Angebot.