Naukowcy przetestowali model Prithvi-EO-2.0 do klasyfikacji upraw w 12 krajach rozsianych po trzech kontynentach i stwierdzili dramatyczny spadek wydajności poza danymi treningowymi. Podczas gdy model osiągał 65 procent dokładności w Stanach Zjednoczonych, jego wydajność w Europie spadła do 40 procent. Jeszcze bardziej niepokojące jest to, że model często pozostawał pewny swoich błędnych predykcji, co zmniejsza praktyczną użyteczność takich systemów w rzeczywistych aplikacjach monitorowania upraw.
Głównym sprawcą problemów okazał się czasowy aspekt obserwacji satelitarnych. Gdy okno obserwacyjne nie pokrywało się z lokalnym cyklem fenologicznym upraw, dokładność gwałtownie spadała, podczas gdy pewność modelu pozostawała wysoka. W niektórych przypadkach 12-51 procent obrazu zawierało pewne i błędne klasyfikacje. Jednak badacze odkryli również, że znaczna część spadku wydajności między kontynentami wynikała właśnie z tej fenologicznej niezgodności, a nie z braku ogólnej transferowalności modelu.
Badanie podkreśla kluczową lukę między teoretyczną transferowalnością large foundation models a ich rzeczywistą niezawodnością w terenie. Chociaż dwie proste korekty pozwoliły na odzyskanie dokładności bez dalszego trenowania, odkrycie pokazuje, że modele oparte na satelitarnych archiwach wymagają znacznie bardziej zaawansowanego podejścia do adaptacji fenologicznej i oceny zaufania dla praktycznego wdrożenia. To ma implikacje dla całego obszaru geospatialnych foundation models i ich gotowości do wsparcia rzeczywistych systemów monitorowania rolnictwa.