Naukowcy przeprowadzili systematyczne badanie zdolności dużych modeli językowych do generalizacji w zadaniach ekstrakcji wyrażeń czasowych i zdarzeń. Analizie poddano wiele konfiguracji modeli z różnych rodzin i architektur, testując je w czterech wymiarach generalizacji - przesunięciu dziedzinowego, perturbacjach adversarialnych, złożoności składniowej i zwiększaniu długości tekstu.
Wyniki pokazują, że choć silna wydajność bazowa na znanych danych generalnie prognozuje lepszą generalizację, relacja ta robi się słabsza w warunkach znaczących zmian rozkładu. Inductive prompting wykazał się największą spójnością we wszystkich czterech wymiarach, podczas gdy korzyści ze zwiększania parametrów modelu, zmian architektury czy alternatywnych strategii promptowania (deductive i abductive) były nieprzewidywalne i zależne od konkretnego wymiaru.
To badanie ma istotne implikacje dla praktycznego wdrażania LLM w rzeczywistych scenariuszach, gdzie modele napotykają nieznane wcześniej domeny i formaty tekstów. Autorzy podkreślają, że tradycyjne ewaluacje opierające się wyłącznie na danych in-domain dają fałszywą pewność niezawodności systemu. Do budowy bardziej odpornych systemów ekstrakcji czasowej potrzebne są strategie promptowania, które lepiej radzą sobie z rozmaitością warunków, a także bardziej kompleksowe protokoły testowania obejmujące wiele wymiarów generalizacji.