Naukowcy z KSE-Web przeprowadzili badanie nad wyszukiwaniem semantycznym w języku khmerskim, jednym z największych wyzwań dla współczesnych systemów AI. Język khmertski, będąc językiem słabo zasobnym, boryka się z wieloma problemami: brak dużych zbiorów danych treningowych, trudne do zidentyfikowania granice między wyrazami, słaba reprezentacja w wielojęzycznych modelach embedding oraz częste mieszanie khmerskiego z angielskim w praktycznym użyciu.
Dla badania zespół zebrał około 17 tys. kandydatów na dokumenty khmerskie, ostatecznie czyszcząc i preparując 3 tys. pełnotekstowych dokumentów. Testowali cztery podejścia: klasyczne wyszukiwanie BM25 oparte na n-gramach znakowych, gęste retrieval multilingwalne, hybrydę obu metod oraz rozszerzanie zapytań wspomagane LLM przy użyciu modeli Qwen2.5. Ewaluacja obejmowała 300 ręcznie przejrzanych zapytań w stylu użytkownika z częściową weryfikacją człowieka.
Wyniki okazały się zaskakujące dla współczesnych trendów w AI: tradycyjny BM25 zdominował konkurencję z Recall 0.943 i nDCG 0.876, podczas gdy gęste retrieval samo z siebie osiągnęło niższe wyniki. Podejście hybrydowe (BM25 + dense) było zbliżone do czystego BM25 z wartościami 0.929 i 0.871 odpowiednio. Ciekawostką była obserwacja, że rozszerzanie zapytań przez LLM nie prowadziło do lepszych wyników ogółem, choć pokazało znaczącą zależność od rozmiaru modelu - Qwen2.5-3B generował znacznie lepsze rozszerzenia niż mniejszy Qwen2.5-0.5B. Problem polegał na tym, że bezpośrednie rozszerzanie LLM wprowadzało drift tematyczny, generyczne terminy i hałaśliwe przeformułowania, co ostatecznie degradowało jakość wyszukiwania.