Naukowcy opublikowali DrawingVQA, pierwszy benchmark specjalnie zaprojektowany do oceny multimodalnych dużych modeli językowych na rzeczywistych rysunkach budowlanych. Rysunki budowlane stanowią kluczowy materiał w praktyce architektonicznej i inżynieryjnej, ale dotychczas brakło narzędzi do systematycznej oceny zdolności AI w ich interpretacji.
Benchmark zawiera 33 pełnoprawne rysunki "Issued for Construction" oraz 92 starannie przygotowane pary pytań i odpowiedzi stworzone przez ekspertów branżowych. Unikalne w stosunku do zwykłych testów multimodalnych jest to, że rysunki budowlane łączą abstrakcyjną geometrię, notację symboliczną, dane tabelaryczne, adnotacje i specjalistyczny tekst, tworząc wyjątkowo złożoną domenę wizualno-tekstową. Pytania podzielono na trzy poziomy złożoności: percepcję wizualną, interpretację kontekstową oraz rozumowanie na poziomie eksperta domeny.
Ewaluacja obecnych najlepszych multimodalnych modeli językowych ujawniła istotną lukę między ich wydajnością a wydajnością specjalistów. Problem pogłębia się na wyższych poziomach rozumowania, gdzie modele powinny nie tylko zidentyfikować elementy rysunku, ale też zrozumieć ich znaczenie inżynieryjne i kontekst całego projektu. Naukowcy przedstawili również pierwszy framework do mapowania rzeczywistych procedur inżynieryjnych na zdolności rozumowania AI, co otwiera drogę do dalszych badań nad integracją systemów sztucznej inteligencji z rzeczywistymi procesami inżynieryjnymi i architektonicznymi.