Naukowcy opracowali Obshazard-bench - pierwszy benchmark specjalnie zaprojektowany do testowania multimodalnych dużych modeli językowych w kontekście rzeczywistego reagowania na katastrofy. W odróżnieniu od istniejących benchmarków, które korzystają ze statycznych, już przetworzonych danych satelitarnych, nowe narzędzie pracuje z surowymi, wysokoczęstotliościowymi strumieniami danych ze satelitów obserwacyjnych wysyłanymi w czasie rzeczywistym.

Benchmark obejmuje 8 głównych kategorii katastrof i 28 podkategorii rozciągających się na ponad 60 krajów. Zawiera on ponad 120 historycznie udokumentowanych przypadków zdarzeń ekstremalnych oraz tysiące próbek zadań wizualno-pytających zorientowanych na cykl życia kryzysu. Dane integrują surowe strumienie satelitarne z równoczesnymi obserwacjami ze stacji naziemnych, historycznymi rekordami katastrof i wskaźnikami społeczno-ekonomicznymi, omijając opóźnioną obróbkę ekspertów i tradycyjne procesy fizycznego modelowania.

Test definiuje trzyetapową taksonomię oceny wyrównaną z operacyjnym przepływem pracy przy reagowaniu na katastrofy: przewidywanie i antycypacja kryzysu dla wczesnego ostrzegania przed zagrożeniami, aktywne śledzenie ewolucji katastrof w trakcie ich trwania oraz ocena długoterminowych skutków. To podejście znacznie lepiej odzwierciedla warunki rzeczywistych sytuacji nadzwyczajnych, gdzie decyzje muszą być podejmowane pod presją czasową i przy dostępie do dynamicznych danych obserwacyjnych, a nie statycznych produktów przetworzonych post-hoc.