Naukowcy z arXiv zaproponowali innowacyjną metodę łączącą Gaussian Mixture Models z Large Language Models do radzenia sobie z niedoborem danych reprezentujących mniejszościowe tematy w zadaniach klasteryzacji tekstowej. Problem wynika z faktu, że w nienadzorowanych zadaniach NLP standardowe algorytmy grupowania często nie potrafią odpowiednio uchwycić klastrów reprezentujących niedoreprezentowane tematy, co prowadzi do pogorszenia jakości analizy.
Proponowana metoda działa w dwóch etapach. Najpierw GMM ze względu na swoją elastyczność i odporność identyfikuje klastry odpowiadające niedoreprezentowanym obszarom w danych. Następnie LLM generuje syntetyczne dokumenty specjalnie zaprojektowane do wzbogacenia tych słabych klastrów, poprawiając ich reprezentację. Takie podejście umożliwia dokładniejszą i bardziej zrównoważoną klasteryzację tekstu.
Eksperymenty przeprowadzone na różnych niezbalansowanych zbiorach danych tekstowych wykazały, że metoda zachowuje wydajność grupowania we wszystkich testowanych przypadkach, a jednocześnie często poprawia interpretowalność klastrów. To stanowi ważny krok w kierunku bardziej niezawodnych i skalowalnych rozwiązań dla problemów niezrównoważonych danych w nienadzorowanych zadaniach NLP, zwłaszcza w domach gdzie dostęp do danych dla mniejszościowych tematów jest ograniczony.