Integracja danych genomicznych i klinicznych dla jednoczesnego przewidywania podtypu raka piersi i czasu przeżycia pacjenta stanowi jedno z największych wyzwań w medycynie precyzyjnej. Dotychczasowe rozwiązania miały poważne ograniczenia: traktowały każdy typ danych jako jeden duży wektor cech, zamiast analizować je na poziomie poszczególnych tokenów, używały prostych metod fuzji takich jak średniowanie, oraz optymalizowały cele klasyfikacji i predykcji niezależnie od siebie.

Nowa architektura Token-Level Cross-Modal Transformer zmienia to podejście. Zamiast traktować dane genomiczne i kliniczne jako całościowe bloki, model pracuje na poziomie pojedynczych tokenów, co pozwala na bardziej złożone i precyzyjne interakcje między różnymi modalności. Strukturalna wymiana informacji między tokenami daje głębsze zrozumienie, jak cechy genomiczne wiążą się z parametrami klinicznymi pacjenta.

Kluczową innowacją jest zastosowanie contrastive multi-task learning, czyli wspólnej optymalizacji klasyfikacji podtypu raka i predykcji przeżycia z wykorzystaniem sygnału regularyzacyjnego łączącego oba cele. Takie podejście powinna dać lepsze wyniki niż optymalizowanie tych zadań oddzielnie. Dla onkologów oznacza to potencjał na bardziej wiarygodne prognozy i lepsze decyzje terapeutyczne oparte na kompleksowej analizie danych pacjenta.