Zespół badawczy udowodnił, że wysokie korelacje rankingów architektur między różnymi urządzeniami nie stanowią wystarczającej gwarancji dla przenoszenia decyzji o wyborze modeli na urządzenie docelowe. Problem dotyczy kluczowego założenia w optymalizacji modelów: jeśli architektura A zajmuje lepszą pozycję od B na urządzeniu proxy, powinna być lepsza również na urządzeniu docelowym. Badania na NAS-Bench-201 wykazały jednak, że mimo umiarkowanych korelacji rankingów, zbior modeli uznanych za wykonalne jednocześnie na urządzeniu proxy i docelowym pozostaje niekompletny.

Głębsza analiza ujawniła, że problem nie wynika jedynie ze słabej adaptacji. Nawet zaawansowana metoda diagnostyczna AdaProxy, która istotnie poprawiała rankingowanie latencji, nie rozwiązywała w pełni problemu граничych przypadków. Formalna analiza split-conformal wykazała tzw. bottleneck dowodowy: aby uzyskać jednostronny próg ufności 90 procent, potrzeba co najmniej dziewięciu obserwacji kalibracyjnych. Zjawisko zostało następnie zreplikowane na większej skali - testach 10 tysięcy architektur GPT na 13 urządzeniach z bazy HW-GPT-Bench, w tym RTX3080.

Wyniki odsłaniają fundamentalną rozróżnienie między trzema pojęciami: przenośnością rankingów, przenośnością wykonalności i wsparciem decyzyjnym specyficznym dla celu. Względem serwera proxy RTX3080 korelacja rang latencji (SRCC) wahała się od 0.951 do 0.996, ale ryzyko naruszenia wspólnych ograniczeń sięgało 33-100 procent na poszczególnych urządzeniach docelowych. Badacze postulują, że przyszłe oceny cross-device powinny jawnie raportować, w jakich konkretnych środowiskach docelowych dany punkt operacyjny modelu jest rzeczywiście wykonalny.