Aktywacyjne sondy monitorujące wdrożone duże modele językowe muszą być trenowane na syntetycznych rozmowach, ale do tej pory nie było jasne, ile takich próbek rzeczywiście potrzeba. Naukowcy przeanalizowali krzywe uczenia się dla trzech koncepcji monitoringu - sytuacji wysokiego ryzyka, odpowiedzi szkodliwych dla użytkownika i odpowiedzi nie idących za instrukcjami - korzystając z 10 do 590 syntetycznych próbek na czternastu różnych dystrybucjach testowych.

Badanie przeprowadzono na czterech modelach sond, testując też wpływ różnych generatorów LLM i szczegółowości promptów. Okazało się, że sondy monitorujące odpowiedzi wysokiego ryzyka i szkodliwe osiągają satysfakcjonujące wyniki już przy 80 próbkach na modelu Gemma-3-27B-IT, podczas gdy sondy sprawdzające zgodność z instrukcjami potrzebują znacznie więcej - kilka razy większej próby. Porządek pozostaje niezmienny również na trzech mniejszych modelach sond i przy testowaniu na rzeczywistych próbkach ze zbioru deweloperskiego.

Najważniejsze odkrycie dotyczy czynnika wpływającego na rozmiar potrzebnych zbiorów: to zasięg i różnorodność typów danych, a nie trudność poszczególnych typów. Koncepcja i dystrybucja stanowią 42-45% wariancji w wielkości potrzebnych próbek, podczas gdy generator, model sondy i szczegółowość prompta odpowiadają za poniżej 10%. Każdy typ danych potrzebuje medianowo jedynie 7-11 syntetycznych próbek własnego typu, aby nasycić daną dystrybucję, niezależnie od koncepcji monitoringu. Różnica pojawia się w tym, jak dobrze próbki jednego typu przenoszą się na inne dystrybucje - tutaj zasięg pokrycia okazuje się decydujący.