LLM i agenci AI · Analiza tekstu

Skąd komputer wie, o czym jest tekst? Topic modeling dla firm

Opinie klientów, zgłoszenia do supportu, umowy, dokumenty polityczne: firmy mają znacznie więcej tekstów, niż ktokolwiek jest w stanie przeczytać. Topic modeling automatycznie znajduje powtarzające się w nich tematy i pokazuje, o czym mówią ludzie, bez czytania każdego dokumentu z osobna.

Roman Kaczorowski 6 min czytania
Świecący mózg z linii obwodów elektronicznych nad dłońmi piszącymi na laptopie

Najważniejsze w skrócie

  • Topic modeling to metoda nienadzorowanego uczenia maszynowego, która grupuje dokumenty według powtarzających się w nich tematów.
  • Klasyczna metoda, ukryta alokacja Dirichleta (LDA), traktuje każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów.
  • Nowsze metody grupują teksty według znaczenia za pomocą embeddingów, a nazwy tematów nadają modele językowe. Wyniki są dzięki temu czytelniejsze.
  • Firmy wykorzystują topic modeling do analizy opinii i zgłoszeń, monitoringu mediów i polityki, wykrywania trendów oraz ulepszania wyszukiwania.

Czym jest topic modeling

Przetwarzanie języka naturalnego (NLP) łączy uczenie maszynowe z językoznawstwem, żeby automatycznie analizować tekst. Jednym z jego najbardziej użytecznych zastosowań jest topic modeling, czyli odkrywanie abstrakcyjnych tematów, które pojawiają się w dużym zbiorze dokumentów.

Topic modeling to metoda uczenia nienadzorowanego. Nikt nie musi wcześniej definiować kategorii ani oznaczać przykładów. Metoda odnajduje ukryte struktury, grupując słowa i dokumenty, które do siebie pasują. Człowiekowi przeczytanie tysięcy dokumentów i wyciągnięcie z nich spójnych wniosków zajęłoby o wiele za dużo czasu. Topic modeling daje taki przegląd w ułamku tego czasu.

Gdzie topic modeling opłaca się firmom

  • Opinie klientów i support: pokazuje, czego naprawdę dotyczą recenzje, ankiety i zgłoszenia oraz których problemów przybywa.
  • Monitoring mediów tradycyjnych i społecznościowych: wskazuje, które tematy dominują w rozmowach o marce, produkcie lub wydarzeniu.
  • Monitoring polityczny i regulacyjny: porządkuje duże wolumeny dokumentów instytucji i pozwala wcześnie wychwycić istotne tematy.
  • Wyszukiwanie i rekomendacje: grupuje powiązane dokumenty, dzięki czemu użytkownicy znajdują to, co pasuje do ich pytania.
  • Wykrywanie trendów: śledzi, jak z czasem zmienia się waga poszczególnych tematów.

Z praktyki: Policy-Insider.AI

Zespoły public affairs ręcznie śledziły dokumenty polityczne z różnych instytucji i w różnych językach. Dla Policy-Insider.AI zbudowaliśmy platformę, która za pomocą NLP i modeli językowych zbiera, porządkuje i analizuje miliony dokumentów politycznych w kilku językach. Użytkownicy mają osobiste dashboardy i streszczenia generowane przez AI w czasie rzeczywistym.

Zobacz projekt Policy-Insider.AI

Jak działa klasyczny topic modeling

Podstawowe założenie jest proste: w tekście o zdrowym odżywianiu często pojawiają się słowa „owoce” i „warzywa”, a w tekście o samochodach słowa takie jak „silnik” czy „koło”. Tematy to skupiska słów, które zwykle występują razem. Całe podejście opiera się na statystyce.

Najbardziej znanym algorytmem jest ukryta alokacja Dirichleta (latent Dirichlet allocation, LDA). Przedstawia każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów, posługując się dwoma prawdopodobieństwami: jak prawdopodobne jest dane słowo w temacie i jak prawdopodobny jest dany temat w dokumencie.

  1. Przygotowanie tekstu: usuwamy interpunkcję, dzielimy tekst na słowa, odrzucamy bardzo częste słowa, takie jak „i” czy „w”, i sprowadzamy słowa do formy podstawowej (lematyzacja).
  2. Reprezentacja słów: każdy dokument staje się „workiem słów” (bag of words), czyli zestawieniem tego, jakie słowa w nim występują i jak często. Kolejność słów nie ma znaczenia.
  3. Trenowanie modelu: LDA znajduje zadaną liczbę tematów i podaje dla każdego z nich najbardziej prawdopodobne słowa.
  4. Interpretacja wyniku: temat ze słowami „makaron, pizza, restauracja” wyraźnie dotyczy kuchni włoskiej, a temat ze słowami „koło, zawieszenie, napęd” samochodów.

Liczbę tematów trzeba ustalić z góry, choć nikt jeszcze jej nie zna. Często trenuje się więc kilka modeli z różną liczbą tematów i porównuje ich spójność tematów (topic coherence), czyli miarę tego, jak dobrze słowa w danym temacie do siebie pasują. Przy zbyt wielu tematach powstają nakładające się podtematy z powtarzającymi się słowami kluczowymi. Narzędzia wizualne pomagają sprawdzić, czy tematy są od siebie wyraźnie oddzielone.

Co się zmieniło: embeddingi i modele językowe

LDA pozostaje solidną, przejrzystą metodą. Od pierwszej wersji tego artykułu uzupełniły ją nowsze podejścia:

Klasyczne (LDA)Embeddingi i modele językowe
Porównywanie tekstówwedług wspólnych słówwedług znaczenia, także przy innym sformułowaniu
Krótkie tekstyczęsto słabe wynikidobre wyniki, np. przy zgłoszeniach czy postach
Nazwy tematówlisty słów, które interpretuje człowiekmodele językowe proponują czytelne nazwy
Nakładniewielka moc obliczeniowa, łatwo wyjaśnić wynikiwiększa moc obliczeniowa, często lepsze wyniki

Metody takie jak BERTopic zamieniają teksty na embeddingi, czyli liczbowe reprezentacje znaczenia, grupują podobne teksty, a następnie opisują każdą grupę. Model językowy może nadać tematom nazwy i je streścić, tak by zespoły biznesowe mogły od razu korzystać z wyników.

Z praktyki: Re-Work

Organizator konferencji Re-Work chciał wiedzieć, co uczestnicy piszą w mediach społecznościowych w trakcie wydarzeń na żywo. Zbudowaliśmy narzędzie działające w czasie rzeczywistym, które ocenia nastroje, wskazuje najbardziej wpływowe głosy i automatycznie wykrywa pojawiające się tematy, bez ręcznego przeglądania postów.

Zobacz projekt Re-Work

Od czego zacząć topic modeling

  1. Wybierz pytanie: na przykład czego dotyczą reklamacje albo które tematy polityczne są ważne dla Twojej firmy.
  2. Zbierz teksty: zgromadź dokumenty, zgłoszenia lub posty i wyjaśnij kwestie ochrony danych osobowych.
  3. Wybierz metodę: LDA przy długich dokumentach i wynikach, które trzeba umieć wyjaśnić, metody oparte na embeddingach przy krótkich tekstach i czytelnych nazwach tematów.
  4. Sprawdź wyniki z zespołem merytorycznym: tematy mają wartość dopiero wtedy, gdy osoby znające daną dziedzinę uznają je za sensowne.

Jak budujemy analizę tekstu na danych firmowych, pokazujemy na stronie Rozwój LLM.

Chcesz znaleźć tematy w swoich tekstach?

Razem z Tobą ustalamy, w których tekstach kryją się potrzebne Ci odpowiedzi, która metoda pasuje i jak może wyglądać pierwsza analiza na Twoich danych.

Zapytaj o analizę procesu

Najczęściej zadawane pytania

To metoda nienadzorowanego uczenia maszynowego, która automatycznie znajduje powtarzające się tematy w dużym zbiorze tekstów, bez z góry zdefiniowanych kategorii.

Ukryta alokacja Dirichleta przedstawia każdy dokument jako mieszankę tematów, a każdy temat jako mieszankę słów. Uczy się tych rozkładów na podstawie częstości słów i podaje dla każdego tematu najbardziej prawdopodobne słowa.

Trenuje się kilka modeli z różną liczbą tematów i porównuje ich spójność (topic coherence), czyli miarę tego, jak dobrze słowa w danym temacie do siebie pasują.

Grupują teksty według znaczenia, a nie wspólnych słów, lepiej radzą sobie z krótkimi tekstami i potrafią nadać tematom czytelne nazwy oraz streszczenia.

O autorze

Roman Kaczorowski

AI Engineer

Roman Kaczorowski napisał pierwszą wersję tego artykułu w 2018 roku jako AI Engineer w theBlue.ai. W 2026 roku artykuł został zaktualizowany z myślą o firmach.