Naukowcy z arXiv zbadali, jak trenować sieci neuronowe na wyspecjalizowanych danych projektowych, korzystając ze zbioru JONES-19 opartego na Victorian design patterns z ikonicznego dzieła The Grammar of Ornament z 1857 roku. Zestawili dwa podejścia do trenowania CNN: tradycyjne pretraining na ImageNet, który ma dostarczać ogólne zrozumienie świata wizualnego, oraz naukę od zera bezpośrednio na danych projektowych z technikami augmentacji multi-crop.
Najważniejszy wniosek? Dla danych o wyraźnej strukturze i zasadach projektowych (jak ornamenty architektoniczne) sama nauka od zera z inteligentnie dobraną augmentacją osiąga wyniki porównywalne z pretreninem na wielomilionowych zbiorach ogólnych. To stanowi wyzwanie dla powszechnego przekonania, że zawsze potrzeba masowych danych pretreningowych. Badanie pokazuje, że cechy lokalne i powtarzające się motywy w danych projektowych dostarczają wystarczającej bazy do efektywnego uczenia.
Wnioski mają praktyczne znaczenie: zamiast investować w ogromne zbiory danych, zespoły pracujące nad wyspecjalizowanymi domenami projektowymi mogą osiągnąć lepsze rezultaty poprzez staranną kurację mniejszych zbiorów wysokiej jakości, które zasadzają się na empirycznych i formalnych zasadach danej dziedziny. To alternatywa dla powszechnego trendu polegającego na scalaniu coraz większych zbiorów danych bez zwracania uwagi na ich charakter i strukturę.