Xaira Therapeutics wykazała, że w przewidywaniu zmian ekspresji genów dane wysokiej jakości są ważniejsze niż wzrost liczby parametrów. Gdy model 3.1B zatrzymywał się w wydajności mimo zmniejszającego się loss treningowego, diagnoza była jasna: brakuje informacji w danych, a dodatkowe parametry nie rozwiążą problemu. Rozwiązaniem było zebranie ~30 razy bogatszych danych przyczynowych poprzez eksperymenty - to pozwoliło modelowi ponownie skalować się wraz z dodatkowym compute i parametrami.
Podejście Xairy odbiega od dominującej w AI strategii masowego pre-trainingu. Zamiast inwestować miliardy tokenów w ogólne dane, zespoły Chu i Wanga skupiły się na zebraniu high-quality danych eksperymentalnych. Szacunkowy budżet kilkadziesiąt milionów na kolekcję danych i infrastrukturę, plus kilka milionów na compute i badania, bardziej przypomina budżet reinforcement learning rolloutów niż klasycznych modelowych pre-treningów. To pokazuje, że dla specjalistycznych zadań naukowych jakość przebija ilość.
Promocja Chu i Wanga na pozycje odpowiadające za odkrywanie i AI podkreśla, jak fundamentalnie Xaira postrzega tę zmianę. W kontekście AI-driven drug discovery, gdzie każde błędne przewidnienie może oznaczać zmarnowanego miesiące na badaniach, model oparty na przyczynowych danych może być przełomem. Podejście sugeruje, że przyszłość AI w naukach przyrodniczych leży nie w większych modelach ogólnozachowawczych, ale w modelach wytrenowanych na boganych, zaplanowanych eksperymentalnie danych.