Usługi profesjonalne · Ochrona danych i RODO
Dane osobowe usunięte, zanim w ogóle trafią do analizy
InSaaS.ai przetwarza duże ilości tekstów z mediów społecznościowych, forów internetowych i od klientów na potrzeby badań rynku i planowania produktów. W każdym zbiorze mogą się kryć dane osobowe, które trzeba usunąć przed analizą, a ręczne sprawdzanie przy takiej skali było niemożliwe. Zintegrowaliśmy ShareMedix jako API do anonimizacji, które wykrywa i maskuje dane osobowe w całym potoku danych.
Kluczowe rezultaty
Klient: InSaaS.ai
Firma analityczna, która dostarcza wiedzę na potrzeby marketingu, badań rynku i rozwoju produktów.
- Branża
- Usługi profesjonalne i badania rynku
- Zastosowanie
- Anonimizacja danych osobowych w tekstach
- Podejście AI
- Wykrywanie danych osobowych oparte na NLP
- Źródło danych
- Media społecznościowe, fora, dane klientów
- Integracja
- API z przetwarzaniem równoległym
- Produkt
- ShareMedix (theBlue.ai)
W skrócie
Dlaczego danych nie można było od razu wykorzystać
- Praca InSaaS.ai opiera się na analizie postów w mediach społecznościowych, dyskusji na forach, opinii klientów i wewnętrznych zbiorów danych, a wszystkie te źródła zawierają dane osobowe.
- Zgodnie z RODO takich danych nie można analizować w surowej postaci. Każdą informację osobową trzeba najpierw znaleźć i usunąć, a ilość i różnorodność danych wykluczały proces ręczny.
- ShareMedix działa teraz w potoku jako API: dane wchodzą, zanonimizowane dane wychodzą, bez ręcznej obsługi i bez osobnego interfejsu.
- Dostępne stały się też źródła, które wcześniej były zbyt ryzykowne, by z nich korzystać, co poszerzyło zakres wniosków, jakie InSaaS.ai może dostarczać.
Punkt wyjścia
Wyzwanie
InSaaS.ai musiało dostosować ogromne ilości tekstów do wymogów RODO, zanim można je było analizować, a ilość i różnorodność danych osobowych wykluczały ręczną anonimizację na taką skalę.
InSaaS.ai tworzy rozwiązania analityczne dla marketingu, badań rynku i rozwoju produktów, a ta praca opiera się na dużych ilościach tekstu: postach w mediach społecznościowych, dyskusjach na forach, opiniach klientów i wewnętrznych zbiorach danych.
Wiedza ukryta w tych danych jest cenna. Same dane są jednak pełne imion i nazwisk, adresów, numerów telefonów, numerów IBAN i innych wrażliwych informacji.
Zgodnie z RODO żadnej z nich nie można przetwarzać w surowej postaci, więc każdą informację osobową trzeba wykryć i usunąć, zanim dane trafią do potoku analitycznego. Ręczne przetwarzanie nie wchodziło w grę: za dużo danych, za wiele rodzajów danych osobowych i zbyt wysoka stawka regulacyjna jak na proces wykonywany przez ludzi.
Budowa
Co zbudowaliśmy
Zintegrowaliśmy ShareMedix, nasz silnik anonimizacji oparty na NLP, bezpośrednio z potokiem przetwarzania InSaaS.ai za pomocą API. Dane osobowe są wykrywane i maskowane, zanim tekst dotrze do warstwy analitycznej.
Dane osobowe wykrywane w tekstach bez struktury
ShareMedix rozpoznaje za pomocą NLP imiona i nazwiska, adresy, numery telefonów, numery IBAN, adresy e-mail i inne identyfikatory. Radzi sobie z danymi z bardzo różnych źródeł: z postem w mediach społecznościowych pisanym potocznym językiem, z ustrukturyzowanym rekordem klienta i ze wszystkim pomiędzy.
API zamiast narzędzia do ręcznego uruchamiania
ShareMedix działa jako API, które InSaaS.ai wywołuje z poziomu istniejącego potoku, więc nie wymaga osobnej aplikacji ani ręcznej obsługi. Dane wchodzą, zanonimizowane dane wychodzą i nikt nie musi pamiętać o uruchomieniu anonimizacji.
Anonimizacja nie staje się wąskim gardłem
Zbiory danych z badań rynku bywają ogromne. API obsługuje wiele jednoczesnych żądań, więc duże wolumeny przechodzą przez system, a anonimizacja nie spowalnia przygotowania danych.
Reguły, które można dostosować
Różne źródła i zastosowania wymagają różnego podejścia. ShareMedix obsługuje białe listy, czarne listy i konfigurowalne reguły, dzięki czemu InSaaS.ai decyduje, co jest maskowane, a co zostaje, i może to zmieniać wraz ze zmianami przepisów i źródeł danych.
Co się zmieniło
Rezultaty
Przed
Dane osobowe rozproszone w ogromnych zbiorach tekstów. Ręczna weryfikacja niemożliwa przy takiej skali, zgodność z RODO trudna do zagwarantowania, a część danych nieużywana z powodu ryzyka dla prywatności.
Po
Automatyczne wykrywanie i maskowanie przez API. Zgodność wbudowana w potok, pełne zbiory danych dostępne do analizy i ani jednego ręcznego kroku.
InSaaS.ai może przetwarzać i analizować cały wolumen danych, a zgodność z przepisami jest zachowywana automatycznie. Anonimizacja przestała hamować pracę i stała się niewidoczną częścią potoku.
Dostępne stały się też dane, które wcześniej były zbyt ryzykowne, by z nich korzystać. Dane klientów i inne wrażliwe źródła, które wymagałyby żmudnej ręcznej weryfikacji, przechodzą teraz przez system automatycznie.
To poszerza zakres tego, co InSaaS.ai może przekazać swoim klientom, a tego zwykle nie oczekuje się od rozwiązania z zakresu zgodności z przepisami.
Pytania o ten projekt
Anonimizacja danych osobowych w tekstach. InSaaS.ai musiało dostosować ogromne ilości tekstów do wymogów RODO, zanim można je było analizować, a ilość i różnorodność danych osobowych wykluczały ręczną anonimizację na taką skalę.
Pełna zgodność z europejskimi przepisami o ochronie danych: RODO. Zintegrowane bezpośrednio z istniejącym potokiem danych: API. Wiele jednoczesnych żądań anonimizacji na dużą skalę: Równolegle. Maskowanie imion i nazwisk, adresów, numerów telefonów i numerów IBAN: Automatycznie.
Wykrywanie danych osobowych oparte na NLP. Wykorzystana technologia: Natural Language Processing, Named Entity Recognition, Wykrywanie danych osobowych, Integracja przez API, Platforma ShareMedix, Zgodność z RODO.
Wykorzystana technologia
Porozmawiaj z zespołem, który to zbudował
Odpowiadamy w ciągu jednego dnia roboczego.
Więcej projektów

Ochrona zdrowia · Zarządzanie szpitalem
Automatyczna anonimizacja danych pacjentów na serwerach szpitala
Czytaj więcej
Farmacja · Farmakowigilancja i analiza rynku
Sygnały bezpieczeństwa leków w tekstach, których nikt nie przeczyta w całości
Czytaj więcej
Wydarzenia · Analityka social media