Naukowcy wprowadzili BioPhys-Bridge, nowy benchmark specjalnie zaprojektowany do testowania zdolności modeli języka do analizy artykułów biofizyki z zachowaniem ścisłej wiarygodności źródeł. Dataset zawiera 500 przypadków z 1517 zadaniami, obejmując sześć domen biologicznych i dziewięć rodzin modeli fizyki. Każdy przypadek zawiera bloki evidencji, identyfikatory źródeł, wartości ilościowe, jednostki, równania, założenia oraz mechanizmy biologiczne, które stanowią cele do oceny systemów question answering i retrieval-augmented generation (RAG).
Wymaganie do poprawnych odpowiedzi w biofizyce jest wysokie - modele muszą zakorzenić obserwowane dane w źródłach, interpretować je przez pryzmat ilościowego modelu fizyki i powiązać z mechanizmami biologicznymi. To wymaga złożonego, wieloetapowego rozumowania naukowego, które stanowi wyzwanie nawet dla zaawansowanych systemów AI. Benchmark został przygotowany z surowymi kontrolami jakości, w tym weryfikacją schematu, integralności źródeł, normalizacją jednostek i recenzją ekspertów domeny dla 81 przypadków.
Wstępne wyniki pokazują skalę problemu - DeepSeek-V4-Flash osiągnął najlepszy wynik F1 na poziomie 0.360 w zadaniu identyfikacji identyfikatorów evidencji, następnie Qwen3.7-Max z 0.316 i GPT-4o-mini z 0.294. Te relatywnie niskie wyniki sugerują, że nawet najlepsze modele mają trudności z utrzymaniem wierności źródłom i unikaniem halucynacji w interdyscyplinarnym rozumowaniu naukowym. BioPhys-Bridge ma na celu wspieranie rozwoju systemów AI zdolnych do rzetelnej analizy złożonych badań naukowych.