Naukowcy pokazali, że model Nemotron 3 Ultra można efektywnie trenować do rozwiązywania najtrudniejszych problemów matematycznych ze światowych olimpiad. System zbudowany na trzech checkpointach tego modelu - ogólnym i dwóch specjalistycznych - generuje, weryfikuje i doskonali kandydatów na dowody w sposób iteracyjny, używając tylko naturalnego języka bez wsparcia formalnych proverów czy dostępu do internetu.
Trenowanie podzielono na dwie fazy: supervised fine-tuning nauczył model struktury dowodów matematycznych na podstawie dostępnych rozwiązań, a reinforcement learning optymalizował wybory w trakcie generowania poprzez nagradzanie poprawnych ścieżek. Test-time compute pipeline łączy te komponenty - najpierw generuje i weryfikuje potencjalne rozwiązania, a następnie osobny etap o dużych zasobach obliczeniowych wybiera finalne odpowiedzi do submission.
Wynik 30 na 42 punkty w IMO 2026 jest znaczący, bo oznacza, że system jest na poziomie konkurencji złotomedalistów. Naukowcy zdecydowali się udostępnić pełne rezultaty: dwa post-trained checkpointy, dane treningowe, cały kod do treningu i inferencji, przesłane rozwiązania oraz Nemotron-IMO-Bench - nowy benchmark z 200 problemami olimpijskich.