Naukowcy opracowali LLM-Detector, ramę do detekcji anomalii w danych tabelarycznych, która zamiast tradycyjnego fine-tuningu wykorzystuje in-context learning możliwości dużych modeli językowych. Kluczowa innowacja polega na przekształceniu normalnych danych treningowych w statystyczne podsumowania, mapy zależności przyczynowych i destylowane prototypy, które są organizowane w prompt instruujący model do wygenerowania specjalistycznego kodu oceniającego.
Istniejące detektory anomalii w danych tabelarycznych zazwyczaj polegają na sygnałach geometrycznych lub rekonstrukcyjnych, a wcześniejsze podejścia oparte na LLM-ach głównie dostrajały modele na próbkach normalnych lub generowały syntetyczne anomalie. Problem polega na tym, że anomalie w danych tabelarycznych często pojawiają się nie jako proste odchylenia marginalne, ale jako naruszenia zależności między cechami. LLM-Detector rozwiązuje to, generując kod, który ocenia jednocześnie odchylenia statystyczne, niespójności strukturalne i anomalie oparte na gęstości rozkładu.
W eksperymentach na 24 zbiorach danych tabelarycznych metoda wykazała konsystentną poprawę w stosunku do 15 innych najnowocześniejszych rozwiązań, zarówno dla danych mieszanego typu, jak i wyłącznie ciągłych. Znaczącą zaletą jest eliminacja potrzeby fine-tuningu LLM-a i trenowania sieci neuronowych, co drastycznie zmniejsza wymagania obliczeniowe i czyni rozwiązanie praktycznym dla rzeczywistych systemów pracujących z danymi tabelarycznymi, gdzie anomalie są problematyczne ale zasoby obliczeniowe ograniczone.