Google DeepMind rozpoczyna pilotaż pierwszych na świecie podwójnie zaślepych ocen sztucznej inteligencji, wprowadzając metodologię znaną z badań medycznych do świata ewaluacji AI. W tym podejściu zarówno ewaluatorzy, którzy testują modele, jak i ich twórcy nie mają dostępu do pełnych informacji o procesie oceniania, co ma zapobiec świadomym lub nieświadomym uprzedzeniom.
Podwójnie zaślepe ewaluacje stanowią znaczący postęp w metodzie badań naukowych. Tradycyjnie oceny systemów AI mogły być narażone na rozbieżności wynikające z wiedzy stron o konkretnych parametrach testów czy tożsamości ocenianych modeli. Ta metodologia eliminuje takie potencjalne źródła błędów, podobnie jak to działa w farmakologii czy psychologii. Pilotaż DeepMind ma pokazać, czy ten podход może stać się standardem w branży.
Inicijatywa ma kluczowe znaczenie dla przejrzystości i wiarygodności całego ekosystemu AI. W miarę jak systemy stają się coraz bardziej zaawansowane, a ich porównania bardziej skomplikowane, potrzeba niezawodnych, niezależnych ocen rośnie. Jeśli model podwójnie zaślepych ewaluacji okaże się efektywny, może znormalizować praktyki badawcze w całej branży i zmniejszyć ryzyko błędnych wniosków na temat wydajności poszczególnych rozwiązań.