Naukowcy z dziedziny NLP przekonwertowali kodery zdań trenowane dla zadań wyszukiwania na modele, które podejmują typowane decyzje - odpowiadają na pytania schematyczne w jednym przejściu forward i zwracają kalibrowane prawdopodobieństwa. Pytaniem badawczym było, czy kodery biomedyczne to dobre punkty startowe dla takich modeli.

Aby to przetestować, zespół stworzył SBERT2S1 - metodę transformującą Sentence-Transformers w modele bi-encoder z trzema architekturami: cross-head (C), prior-fused residual (PFR) oraz wariantami treningowymi. Do tego dołożyli BIODECIDE - zestaw zadań decyzyjnych w domenie biomedycznej - oraz MEDLINE-S1, bazę 243 tysięcy decyzji treningowych pochodzących z systemu indeksowania MEDLINE Narodowej Biblioteki Medycyny. Eksperymentowanie przebiegało na sześciu parach modeli-retrieverów.

Wyniki były zróżnicowane. Trening na wyszukiwaniu rzeczywiście poprawiał zeroshootowe dopasowanie opcji niosących znaczenie, ale w fine-tuningu efekt zależał od architektury. PFR - model zachowujący wcześniejszą wiedzę z wyszukiwania - zyskiwał na takim treningach w 10 z 15 porównań. Model C natomiast prawie w ogóle nie korzystał z tego wariantu. Przechodziły też do analizy funkcji strat: popularna metoda RLCD traciła 2,5-3,0 punktów względem cross-entropii, głównie przez błędną normalizację reward'u. Po kalibrowaniu temperatury żaden cel treningowy nie wyróżniał się znacząco lepszą kalibracją. Naukowcy udostępnili kod, etykiety oraz wytrenowany model.