Programista wytrenował od podstaw model języka w Rust-ie zupełnie samodzielnie, za 164 dolary czasu GPU na wynajętym serwerze H100, rezygnując z całej ekosystemu Python-PyTorch.
To samo w sobie byłoby ciekawostką, ale prawdziwy wkład pracy to szczegółowy raport defektów w dwóch głównych frameworkach ML dla Rust-a - Candle i Burn. Autor znalazł 5 poważnych błędów w Candle, w tym kernele które milcząco nie generują gradientów, oraz 3 w Burn, łącznie z backward passem działającym na zaledwie 3 procent teoretycznej przepustowości GPU i ścieżką fusion kerneli powodującą segfault w trakcie treningu modeli miliardowych. Niebezpieczne było, że każdy z tych błędów przejdzie normalną inspekcję loss curve - żaden nie ujawnia się automatycznie.
Autor opracował metodę weryfikacji opartą na gradient-flow arbiterze, teście który sprawdza czy każdy parametr otrzymuje skończony, niezerowy gradient. Model wytrenowany na 2 miliardach tokenów z naciskiem na bengalski osiągnął silny sygnał modelowania języka dla bengalskiego, ale wynik zerowy na angielskich testach commonsense - dokładnie to co było zamierzone dla celów tego eksperymentu.