Naukowcy zidentyfikowali trzy fundamentalne problemy w metodologii ewaluacji Deep Imbalanced Regression, czyli podejścia do modelowania danych, gdzie wartości docelowe są nierównomiernie rozpowszechnione. Model regresji ma tendencję do działania najlepiej w gęstych regionach danych, ignorując przy tym rzadkie, ale operacyjnie ważne przypadki.
Pierwszą kwestią jest dominacja benchmarków opartych na zadaniach obrazowych, które nie wystarczają do pełnej oceny DIR. Badacze wprowadzili multimodalny benchmark MuViS zawierający dziewięć zadań regresji szeregów czasowych z sześciu fizycznych dziedzin, gdzie rzadkie wartości docelowe odpowiadają rzeczywiście ważnym scenariuszom operacyjnym. Drugą przeszkodą jest brak w pełni diagnostycznych metryk decyzyjnych - zespół zaproponował nową metrykę bMASE (balanced Mean Absolute Scaled Error), która umożliwia porównanie metod niezależnie od skali problemu.
Trzecia, najbardziej niepokojąca obserwacja dotyczy stabilności. Przeprowadzona ponowna ewaluacja sześciu reprezentatywnych metod DIR z różnymi inicjalizacjami pokazała, że regiony ogonowe, które stanowią cel DIR, wykazują niezwykle wysoką wrażliwość na zmienność inicjalizacji. Standardowe modele virtual-sensing ukrywają znaczne degradacje w rare tail regionsach za ogólnym MAE, a istniejące metody DIR nie w pełni rozwiązują ten problem.