Naukowcy opracowali BEAMS - nowy benchmark do testowania, jak dobrze modele AI potrafią modelować i symulować złożone systemy fizyczne oraz matematyczne. To narzędzie stanowi systematyczną metodę ewaluacji zdolności AI w zadaniach, które wymagają przewidywania zachowania skomplikowanych zjawisk z rzeczywistego świata. Dotychczas brakowało standaryzowanego sposobu porównywania wydajności różnych systemów w tego typu zagadnieniach, co utrudniało zarówno naukowców, jak i inżynierów pracujących nad doskonaleniem sztucznej inteligencji.
Benchmark wypełnia istotną lukę w portfolio narzędzi do oceny AI. Modelowanie symulacyjne to jeden z filarów współczesnej inżynierii, nauk ścisłych i zarządzania ryzykiem - od prognozowania pogody po projektowanie samolotów czy optymalizację procesów chemicznych. Im bardziej wiarygodne modele AI potrafią być w tych zadaniach, tym większą praktyczną wartość mają dla branży. BEAMS pozwala naukowcom dokładnie zmierzyć, gdzie obecne systemy radzą sobie dobrze, a gdzie ciągle mają problemy.
Pojawienie się takiego benchmarku powinno przyspieszyć postęp w tym obszarze. Znormalizowane testy sprawiają, że zespoły mogą porównywać swoje rozwiązania na wspólnych warunkach, śledzić postępy w czasie i budować modele bardziej odporyczne na błędy. W dłuższej perspektywie BEAMS może stać się standardem branżowym, podobnie jak istniejące już benchmarki dla innych aspektów AI - od rozumienia języka naturalnego po wizję komputerową.