W jednym zdaniu
Rozpoznawanie danych osobowych działa u nas w tym samym systemie co wszystko inne — żadnego dodatkowego podmiotu przetwarzającego, który widziałby Państwa teksty spraw w postaci jawnej, i żadnego modelu zmuszonego do zgadywania nazwisk.
Dlaczego to w ogóle jest pytanie
Kto kupuje chmurę AI dla kancelarii, napotyka drugi problem: zanim tekst trafi do modelu, dane osobowe powinny z niego zniknąć. Rozpowszechnioną drogą jest dokupienie osobnej usługi rozpoznawania. Rozwiązuje to kwestię techniczną — i tworzy nową: ta usługa musi zobaczyć tekst przed maskowaniem, a więc w postaci jawnej. Dla Państwa staranności przy wyborze oznacza to jedno miejsce więcej przetwarzające tajemnicę zawodową, jedną umowę więcej, jeden wpis więcej w rejestrze czynności przetwarzania.
Co robimy zamiast tego: wyszukujemy, zamiast zgadywać
Model rozpoznający musi wywnioskować ze zdania, że „Kraus" jest tu osobą. My nie musimy tego wnioskować — już to wiemy. Kto jest klientem, stroną przeciwną, świadkiem czy biegłym w Państwa aktach, figuruje już z określonym typem w Państwa sieci faktów; powstała ona przy czytaniu dokumentów. Przy maskowaniu wyszukujemy tam, zamiast szacować — łącznie z formami odmienionymi, na których zawodzi zwykła lista słów (dopełniacz, forma skrócona, derywacja przymiotnikowa).
Dochodzi do tego to, co daje się rozpoznać strukturalnie i nie wymaga żadnego modelu: formy prawne takie jak GmbH, AG czy GmbH & Co. KG rozpoznaje się po przyrostku, numery IBAN i dokumentów po sumie kontrolnej, formuły grzecznościowe i diagnostyczne po ich stałej budowie.
Trzy wnioski
Zbiór reguł da się sprawdzić. Mogą Państwo przeczytać, dlaczego dana informacja została zastąpiona. Model nie odpowie na to pytanie — zdecydował, ale nie potrafi uzasadnić swojej decyzji. Dla udokumentowanej decyzji o wyborze to różnica między dowodem a twierdzeniem.
Jakość jest zmierzona, nie oszacowana. Sprawdzamy rozpoznawanie na stałym zbiorze 246 dokumentów testowych z 280 oznaczonymi fragmentami. Pomiar jest częścią naszej kontroli build: jeśli wskaźnik rozpoznawania spadnie poniżej ustalonego progu, build kończy się niepowodzeniem. Tego samego zbioru używamy do próby przeciwnej — 22 dokumenty celowo zawierające pojęcia, których nie wolno maskować: sądy, organy, przepisy ustaw. Również dla tego istnieje od niedawna twardy próg: ani jednego fałszywego alarmu.
Żadnej dodatkowej umowy. Nie ma usługodawcy, któremu musieliby Państwo powierzyć na tym etapie swoje teksty spraw.
Czego wyraźnie nie twierdzimy
Żadna metoda maskowania nie rozpoznaje wszystkiego i nie twierdzimy inaczej. Dwie granice nazywamy otwarcie, ponieważ wynikają z konstrukcji:
Sądów i organów strukturalnie nie obejmujemy. Nasze rozpoznawanie organizacji zaczepia się o formę prawną — „Amtsgericht München" jej nie nosi. To nie przeoczenie, lecz właśnie mechanizm, który utrzymuje zobowiązanie „zero fałszywych alarmów": reguła dość szeroka, by wyłapać nazwy organów, nieuchronnie zabrałaby też nazwy ustaw i nazwy miejscowości.
Pojęcia prawne zostają. „Erwerbsminderungsrente" (renta z tytułu częściowej niezdolności do pracy) to pojęcie prawne, a nie informacja o zdrowiu określonej osoby — pozostawiamy je nietknięte. Właśnie takie przypadki model rozpoznający regularnie myli.
A najważniejsze zastrzeżenie pozostaje merytoryczne: samo usunięcie nazwisk nie czyni tekstu anonimowym, jeśli przypisanie wynika z kontekstu. Dlatego maskowanie jest u nas jednym ze środków ochrony wśród kilku — nie jedynym i nie gwarancją.
Gdzie to Państwo zobaczą
Przełącznik znajduje się w ustawieniach Państwa kancelarii; które agenty maskują, a które celowo pracują na danych jawnych, jest tam wymienione pojedynczo. Szczegóły są w podręczniku pod hasłem ochrona danych i maskowanie, umiejscowienie na naszej stronie zgodności oraz w porównaniu dostawców.






