Zespół Qiushi Engine opublikował wyniki długoterminowego, autonomicznego programu badawczego dotyczącego trenowania modeli języka w warunkach ograniczonej ilości danych na benchmarku BabyLM 2026 Strict-Small. Badania odbywały się w ramach 10 milionów słów z corpus oraz 100 milionów kumulatywnych prezentacji słów - znacznie mniej niż tradycyjne modele rozmiaru frontier.

Badacze podzielili swoje podejście na trzy etapy. Pierwsze dwa etapy skupiały się na odkryciu nowych zasad: znaleźli, że dokładne powtórzenia tekstu oraz wyrażenia wyrównane (aligned restatements) tworzą bardzo różne wzorce, w jakie model używa kontekstu. Odkrycie to było kluczowe - okazało się, że odzyskanie poziomu wydajności na znanych danych nie gwarantowało, że model będzie w stanie efektywnie używać wyuczonych obliczeń na nowych danych wejściowych. To doprowadziło do sformułowania testowanej zasady uczenia się: zorganizować doświadczenie wokół zależności kontekstowych potrzebnych do predykcji, oddzielnie zaprojektować dostępne informacje, nadzór i zachowanie wyuczonych umiejętności.

W trzecim etapie zespół zastosował nowe podejście: zachowali oryginalny tekst, zwiększyli maskowanie lokalnych wskazówek, wybrali konkretne cele do nadzoru i zachowali predykcje na zwykle maskowanych wejściach. Wynik był obiecujący - dwa nasiona kontynuacji z tego samego modelu rodzicielskiego przewyższyły zwykłą kontynuację na kompletnym zbiorze dziewięciu metryk. Zagregowany wynik wzrósł z 42.02 do 42.25 na przestrzeni dwóch pokoleń modelu, przy czym drugi osiągnął najwyższy wynik w publicznym benchmarku Strict-Small.