Capsule Lens to nowy framework do interpretacji jak koncepty są enkodowane w reprezentacjach modeli głębokich. Zamiast tradycyjnego mapowania reprezentacji na bardziej czytelne przestrzenie, metoda bezpośrednio charakteryzuje, jak koncepty zajmują przestrzeń reprezentacyjną, przypisując każdemu geometryczną formę kapsułę zdefiniowaną kilkoma interpretowalnymi parametrami.
Framework działa w dwóch głównych trybach. W trybie statycznym pozwala zlokalizować geometrię konceptów w różnych modelach i analizować krzywe span i norm, które ujawniają ważne charakterystyki geometryczne. W trybie dynamicznym naukowcy śledzą jak reprezentacje się zmieniają podczas różnych faz treningu - obserwując dryft reprezentacyjny w CLIP, reinforcement learningu dla visual question answering i RL dla matematycznego rozumowania.
To badanie ma duże znaczenie dla mechanistic interpretability, czyli nauki o tym jak działają modele od wewnątrz. Pozwala lepiej zrozumieć, w jaki sposób koncepty są przechowywane i transformowane, co jest kluczowe dla wdrażania zaawansowanych systemów AI w sposób godny zaufania. Dotychczasowe podejścia Often brakowało rygoru i formalnych walidacji - Capsule Lens oferuje zamknięte rozwiązanie matematyczne z testowaniem na nieznanych danych.