Naukowcy z Uniwersytetu Zhejiang wprowadzili Holtercare-Bench, pierwszy kompleksowy benchmark do oceny multimodalnych dużych modeli językowych (MLLM) w analizie długoterminowych zapisów EKG z holterów. Problem jest istotny, bo większość obecnych MLLM sprawdza się lepiej w analizie statycznych obrazów lub krótkich sygnałów, podczas gdy dynamiczne elektrokardiogramy wymagają złożonego rozumowania czasowego i generowania raportów diagnostycznych.

Benchmark bazuje na nowym zbiorze danych Holtercare-23K obejmującym 22.980 par pytań i odpowiedzi wyekstrahowanych z 788 klinicznych zapisów holterowskich. Kluczowa innowacja to tri-modalna wyrównanie danych - połączenie sygnału EKG, nagrania wideo oraz tekstu. Benchmark ocenia modele w trzech aspektach: lokalizacji czasowej anomalii, diagnostyce klinicznej oraz globalnym podsumowaniu badania. Ewaluacja pokazała, że prowadzące MLLM mają znaczące problemy z przetwarzaniem ultra-długich patologicznych sekwencji - problem, którym dotąd nikt systematycznie się nie zajmował w kontekście medycyny.

Testy zero-shot ujawniły wyraźną lukę w wydajności, ale gdy autorzy przeprowadzili fine-tuning reprezentatywnych modeli na zbiorze Holtercare, uzyskali zasadnicze ulepszenia. To sugeruje, że problemem nie jest fundamentalna architektura MLLM, ale brak dostępu do odpowiednio bogatych danych treningowych. Praca stanowi punkt wyjścia dla nowej generacji medycznych modeli AI specjalizujących się w długoterminowej analizie sygnałów elektrofizjologicznych, co ma znaczenie dla diagnostyki kardiologicznej.