Naukowcy opublikowali TabRank, nowy framework do trenowania kompaktowych modeli rerankerów zdolnych do logicznego wnioskowania nad tabelami. Praca pokazuje, że zastosowanie chain-of-thought distillation - techniki przenoszenia umiejętności reasoning z większych modeli (LRM) na mniejsze - działa efektywnie również w domenie retrieval'u tabelarycznego.
Jądrem innowacji jest zbiór 6728 reasoning traces stworzony dla Natural Questions Tables dataset. Zespół eksperymentował z dwoma podejściami: eksplicytną destylacją CoT oraz kondycjonowaniem studenta na podstawie reasoning trace'u nauczyciela bezpośrednio w promptie. Oba warianty pozwoliły na znaczące poprawy - Acc@10 wzrosła o 30.5% na HybridQA, 15.2% na SQA, 52.9% na TabFact i 13.1% na TATQA. Testy out-of-distribution wykazały solidną generalizację na różne domeny i scenariusze wielotabelowe.
To jest istotne, bo dotychczasowe systemy retrieval'u strukturalnych informacji opierały się głównie na gęstych czy rzadkich modelach wektorowych. TabRank pokazuje, że przeniesienie podejść z large reasoning models do rankingowania tabel otwiera nowe możliwości dla bardziej zaawansowanego rozumienia skomplikowanych zapytań nad danymi ustrukturyzowanymi - a format tabel pojawia się wszędzie, od finansów po naukę.