Naukowcy z arXiv opublikowali PerfReasoning - nowy benchmark testujący zdolność LLM-ów do rozumowania na temat wydajności sprzętu. Benchmark ocenia modele w dwóch scenariuszach: jako bezpośrednich analizatorów wydajności odpowiadających na pytania o porównanie mapowań, przepustowość off-chip i wymagania bufora, oraz jako generatory kodu zawierającego analytyczne modele wydajności. Zadania oparte są na specyfikacjach workloadu, architektury i mapowania.

Wyniki pokazują wyraźny podział między rozumowaniem a praktyczną implementacją. Najbardziej zaawansowane modele zamknięte takie jak GPT-5.6 Sol osiągnęły ponad 90 procent dokładności w pytaniach wymagających rozumowania, a najlepszy model open-weight uzyskał 82,4 procenta. Jednak gdy chodzi o generowanie działającego kodu modelu wydajności, wyniki dramatycznie spadły. GPT-5.6 Sol utrzymał ponadto 80 procent współczynnika przejścia, ale wszystkie inne konfiguracje modeli średnio osiągnęły poniżej 15 procent z dużymi wariancjami między przebiegami. Trenowanie wzmacniające specjalistyczne dla zadania podniosło dokładność rozumowania mapowania modelu 4B o 15,7 punktu procentowego, natomiast iteracyjna samokorekta bez zwrotną informację nie wykazała niezawodnej skuteczności.

Badanie podkreśla fundamentalną różnicę między zdolnością LLM-ów do racjonalnego dyskutowania o wydajności sprzętu a ich praktyczną umiejętnością konstruowania precyzyjnych, działających modeli wydajności. Benchmark ma zostać upubliczniony, aby wspierać powtarzalne oceny i śledzić postęp przyszłych prac nad wydajnością modeli ukierunkowaną na rzeczywiste zastosowania.