LLM i agenci AI · Analiza tekstu
Skąd komputer wie, o czym jest tekst? Topic modeling dla firm
Opinie klientów, zgłoszenia do supportu, umowy, dokumenty polityczne: firmy mają znacznie więcej tekstów, niż ktokolwiek jest w stanie przeczytać. Topic modeling automatycznie znajduje powtarzające się w nich tematy i pokazuje, o czym mówią ludzie, bez czytania każdego dokumentu z osobna.
Najważniejsze w skrócie
- Topic modeling to metoda nienadzorowanego uczenia maszynowego, która grupuje dokumenty według powtarzających się w nich tematów.
- Klasyczna metoda, ukryta alokacja Dirichleta (LDA), traktuje każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów.
- Nowsze metody grupują teksty według znaczenia za pomocą embeddingów, a nazwy tematów nadają modele językowe. Wyniki są dzięki temu czytelniejsze.
- Firmy wykorzystują topic modeling do analizy opinii i zgłoszeń, monitoringu mediów i polityki, wykrywania trendów oraz ulepszania wyszukiwania.
Czym jest topic modeling
Przetwarzanie języka naturalnego (NLP) łączy uczenie maszynowe z językoznawstwem, żeby automatycznie analizować tekst. Jednym z jego najbardziej użytecznych zastosowań jest topic modeling, czyli odkrywanie abstrakcyjnych tematów, które pojawiają się w dużym zbiorze dokumentów.
Topic modeling to metoda uczenia nienadzorowanego. Nikt nie musi wcześniej definiować kategorii ani oznaczać przykładów. Metoda odnajduje ukryte struktury, grupując słowa i dokumenty, które do siebie pasują. Człowiekowi przeczytanie tysięcy dokumentów i wyciągnięcie z nich spójnych wniosków zajęłoby o wiele za dużo czasu. Topic modeling daje taki przegląd w ułamku tego czasu.
Gdzie topic modeling opłaca się firmom
- Opinie klientów i support: pokazuje, czego naprawdę dotyczą recenzje, ankiety i zgłoszenia oraz których problemów przybywa.
- Monitoring mediów tradycyjnych i społecznościowych: wskazuje, które tematy dominują w rozmowach o marce, produkcie lub wydarzeniu.
- Monitoring polityczny i regulacyjny: porządkuje duże wolumeny dokumentów instytucji i pozwala wcześnie wychwycić istotne tematy.
- Wyszukiwanie i rekomendacje: grupuje powiązane dokumenty, dzięki czemu użytkownicy znajdują to, co pasuje do ich pytania.
- Wykrywanie trendów: śledzi, jak z czasem zmienia się waga poszczególnych tematów.
Z praktyki: Policy-Insider.AI
Zespoły public affairs ręcznie śledziły dokumenty polityczne z różnych instytucji i w różnych językach. Dla Policy-Insider.AI zbudowaliśmy platformę, która za pomocą NLP i modeli językowych zbiera, porządkuje i analizuje miliony dokumentów politycznych w kilku językach. Użytkownicy mają osobiste dashboardy i streszczenia generowane przez AI w czasie rzeczywistym.
Jak działa klasyczny topic modeling
Podstawowe założenie jest proste: w tekście o zdrowym odżywianiu często pojawiają się słowa „owoce” i „warzywa”, a w tekście o samochodach słowa takie jak „silnik” czy „koło”. Tematy to skupiska słów, które zwykle występują razem. Całe podejście opiera się na statystyce.
Najbardziej znanym algorytmem jest ukryta alokacja Dirichleta (latent Dirichlet allocation, LDA). Przedstawia każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów, posługując się dwoma prawdopodobieństwami: jak prawdopodobne jest dane słowo w temacie i jak prawdopodobny jest dany temat w dokumencie.
- Przygotowanie tekstu: usuwamy interpunkcję, dzielimy tekst na słowa, odrzucamy bardzo częste słowa, takie jak „i” czy „w”, i sprowadzamy słowa do formy podstawowej (lematyzacja).
- Reprezentacja słów: każdy dokument staje się „workiem słów” (bag of words), czyli zestawieniem tego, jakie słowa w nim występują i jak często. Kolejność słów nie ma znaczenia.
- Trenowanie modelu: LDA znajduje zadaną liczbę tematów i podaje dla każdego z nich najbardziej prawdopodobne słowa.
- Interpretacja wyniku: temat ze słowami „makaron, pizza, restauracja” wyraźnie dotyczy kuchni włoskiej, a temat ze słowami „koło, zawieszenie, napęd” samochodów.
Liczbę tematów trzeba ustalić z góry, choć nikt jeszcze jej nie zna. Często trenuje się więc kilka modeli z różną liczbą tematów i porównuje ich spójność tematów (topic coherence), czyli miarę tego, jak dobrze słowa w danym temacie do siebie pasują. Przy zbyt wielu tematach powstają nakładające się podtematy z powtarzającymi się słowami kluczowymi. Narzędzia wizualne pomagają sprawdzić, czy tematy są od siebie wyraźnie oddzielone.
Co się zmieniło: embeddingi i modele językowe
LDA pozostaje solidną, przejrzystą metodą. Od pierwszej wersji tego artykułu uzupełniły ją nowsze podejścia:
| Klasyczne (LDA) | Embeddingi i modele językowe | |
|---|---|---|
| Porównywanie tekstów | według wspólnych słów | według znaczenia, także przy innym sformułowaniu |
| Krótkie teksty | często słabe wyniki | dobre wyniki, np. przy zgłoszeniach czy postach |
| Nazwy tematów | listy słów, które interpretuje człowiek | modele językowe proponują czytelne nazwy |
| Nakład | niewielka moc obliczeniowa, łatwo wyjaśnić wyniki | większa moc obliczeniowa, często lepsze wyniki |
Metody takie jak BERTopic zamieniają teksty na embeddingi, czyli liczbowe reprezentacje znaczenia, grupują podobne teksty, a następnie opisują każdą grupę. Model językowy może nadać tematom nazwy i je streścić, tak by zespoły biznesowe mogły od razu korzystać z wyników.
Z praktyki: Re-Work
Organizator konferencji Re-Work chciał wiedzieć, co uczestnicy piszą w mediach społecznościowych w trakcie wydarzeń na żywo. Zbudowaliśmy narzędzie działające w czasie rzeczywistym, które ocenia nastroje, wskazuje najbardziej wpływowe głosy i automatycznie wykrywa pojawiające się tematy, bez ręcznego przeglądania postów.
Od czego zacząć topic modeling
- Wybierz pytanie: na przykład czego dotyczą reklamacje albo które tematy polityczne są ważne dla Twojej firmy.
- Zbierz teksty: zgromadź dokumenty, zgłoszenia lub posty i wyjaśnij kwestie ochrony danych osobowych.
- Wybierz metodę: LDA przy długich dokumentach i wynikach, które trzeba umieć wyjaśnić, metody oparte na embeddingach przy krótkich tekstach i czytelnych nazwach tematów.
- Sprawdź wyniki z zespołem merytorycznym: tematy mają wartość dopiero wtedy, gdy osoby znające daną dziedzinę uznają je za sensowne.
Jak budujemy analizę tekstu na danych firmowych, pokazujemy na stronie Rozwój LLM.
Chcesz znaleźć tematy w swoich tekstach?
Razem z Tobą ustalamy, w których tekstach kryją się potrzebne Ci odpowiedzi, która metoda pasuje i jak może wyglądać pierwsza analiza na Twoich danych.
Zapytaj o analizę procesuNajczęściej zadawane pytania
To metoda nienadzorowanego uczenia maszynowego, która automatycznie znajduje powtarzające się tematy w dużym zbiorze tekstów, bez z góry zdefiniowanych kategorii.
Ukryta alokacja Dirichleta przedstawia każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów. Uczy się tych rozkładów na podstawie częstości słów i podaje dla każdego tematu najbardziej prawdopodobne słowa.
Trenuje się kilka modeli z różną liczbą tematów i porównuje ich spójność (topic coherence), czyli miarę tego, jak dobrze słowa w danym temacie do siebie pasują.
Grupują teksty według znaczenia, a nie wspólnych słów, lepiej radzą sobie z krótkimi tekstami i potrafią nadać tematom czytelne nazwy oraz streszczenia.