Nowe badania z arXiv wyjaśniają, jak dokładnie sieci neuronowe z dropout mogą aproksymować funkcje matematyczne i jaki rozmiar sieci jest do tego potrzebny. Problem wychodzi poza stwierdzenie, że coś jest teoretycznie możliwe - autorzy pokazali konkretnie, ile neuronów i krawędzi trzeba zarezerwować.
Team skupił się na sieciach ReLU, gdzie każda krawędź zostaje zachowana niezależnie z prawdopodobieństwem p. Ich konstrukcja osiąga błąd aproksymacji na całej domenie wejściowej z gwarancją, że pojedyncza losowo próbkowana sieć spełni warunki z prawdopodobieństwem co najmniej 1-δ. Kluczowe jest to, że rozmiar sieci wynosi O(p^-9 * ε^-max{d/n,2} * log(1/δ)), gdzie d to wymiar wejścia, n to gładkość funkcji docelowej (rząd pochodnych), ε to błąd, a δ to poziom pewności.
Co ważne, teoretycy uzyskali również dolne ograniczenia - pokazując, ile krawędzi co najmniej trzeba, aby taki problem rozwiązać. W wielu scenariuszach górne i dolne oszacowania pokrywają się w kluczowych parametrach, co oznacza, że znaleźli praktycznie optymalny rozmiar sieci. Wyniki rozszerzają się na bardziej ogólne przestrzenie Sobolewa. Pozostają otwarte pytania o optymalne zależności od współczynnika retention i czynniki logarytmiczne, ale praca stanowi istotny krok w zrozumieniu matematycznych fundamentów dropout.