Naukowcy z arXiv przedstawili ramę teoretyczną traktującą przestrzeń jako niezmiennik interwencyjny - strukturę relacyjną preservującą predykcyjne własności systemu pod wpływem działań. Problem, który rozwiązują, dotyczy połączenia różnych modalności danych (obrazów, tekstu, pomiarów fizycznych) pochodzących z różnych dziedzin bez wspólnej metryki w jeden spójny obraz przestrzenny.

Klucz do rozwiązania stanowi cross-modalna geometria predykcyjna, która integruje lokalne przestrzenie stanów, mapy obserwacji specyficzne dla każdej modalności, grupę działań i kanoniczną strukturę stanów predykcyjnych. Model wprowadza warunki kauzalne pozwalające identyfikować rzeczywistą strukturę interwencyjną, a nie jedynie korelacje obserwacyjne. Wyniki teoretyczne pokazują, że przy spełnieniu warunku separacji punktów, ekwiwariantności i wierności interwencyjnej, latentna przestrzeń jest identyfikowalna aż do centralizatora grupy interwencji.

Ramę rozszerzono na stratyfikowane systemy miejskie za pomocą reprezentacji sheafowych, pozwalając warstwom geometrycznym, fizycznym, mobilnościowym, społecznym i ekonomicznym współistnieć niezależnie. To ma znaczenie dla modelowania złożonych systemów urbanistycznych i dla rozwoju sztucznej inteligencji zdolnej do rozumienia rzeczywistości wielowymiarowej.