Badacze odkryli poważny problem w treningu grafowych sieci neuronowych, które uczą się przewidywać nowe połączenia w sieciach danych. Chodzi konkretnie o to, że podczas dzielenia danych na małe porcje do treningu mogą zabraknąć pewnych typów krawędzi, co wypacza wyniki modelu i zmniejsza jego dokładność. Problem ten, zwany błędem composycji mini-batch, systematycznie wpływa na przedykcję linków - zadanie polegające na zgadywaniu, które węzły w grafie powinny być ze sobą połączone.
Predykcja linków to jeden z fundamentalnych wyzwań w machine learningu operującym na grafach, znajdujący zastosowanie w rekomendacjach produktów, sugestiach znajomych w mediach społecznościowych czy odkrywaniu ukrytych powiązań między danymi. Jeśli podczas treningu modelu brakuje reprezentacji wszystkich możliwych typów relacji w poszczególnych batch'ach, sieć neuronowa uczy się zniekształconych wzorców. Zjawisko to jest szczególnie problematyczne w dużych, złożonych grafach, gdzie różne rodzaje połączeń mogą mieć muito zróżnicowaną częstość występowania.
Odkrycie wskazuje na konieczność opracowania bardziej inteligentnych strategii próbkowania danych podczas przygotowania mini-batch'y. Zamiast losowego dzielenia zbioru treningowego na porcje, naukowcy sugerują wykorzystanie zaawansowanych technik próbkowania, które zapewniałyby bardziej równomierny rozkład poszczególnych typów krawędzi w każdej porcji. To może znacznie poprawić zarówno dokładność, jak i stabilność treningu grafowych sieci neuronowych stosowanych w praktycznych aplikacjach biznesowych i naukowych.