Meta FAIR wraz z partnerami z Oksfordu i UCL zaprezentowała Research Preference Models - specjalne modele AI do rankingowania eksperymentów uczenia maszynowego zanim zostaną uruchomione. Problem jest prosty: agenci badawczy potrafią generować dziesiątki kandydatów na eksperymenty, ale trenowanie każdego pochłania godziny lub dni mocy GPU. RPM-y rozwiązują to poprzez porównywanie kandidatów parami w turnieju eliminacyjnym - tylko zwycięzca trafia do wykonania.
System nie stara się przewidywać ostatecznych wyników liczbowych - badacze odkryli, że LLM-y są zawodne w takim prognozowaniu. Zamiast tego RPM-y wykorzystują kontekst poprzednich eksperymentów z drzewa wyszukiwania, patrzą na wyniki walidacji już przetestowanych węzłów i podejmują decyzje względne: który z dwóch kandydatów jest bardziej obiecujący. To podejście okazało się dużo bardziej niezawodne niż przewidywanie bezwzględnych metryk.
Rozwiązanie jest częściowo dostępne. RPM-y działają z zamrożonymi, pretrenowanymi modelami bez konieczności fine-tuningu, framework AIRA-dojo i benchmark AIRS-Bench są open source, a model Qwen 3.6-27B ma otwarte wagi. To oznacza, że naukowcy mogą zacząć eksperymentować z RPM-ami bez przeszkód licencyjnych i skalować własne agenty badawcze.