Naukowcy z arXiv zaproponowali Calibration-Preserving Pruning - nową metodę kompresji modeli neuronowych, która gwarantuje niezawodność przewidywań nawet po radykalnym zmniejszeniu liczby parametrów. Kluczową ideą jest połączenie tradycyjnych technik przycinania z konformalną predykcją - podejściem statystycznym, które daje gwarancje dotyczące dokładności przedziałów ufności.

Metoda CPP wykorzystuje niekonformity-gradient saliency do wskazania, które neurony są najważniejsze, a następnie przycinana ją w sposób, który minimalizuje zaburzenia w geometrii wyników modelu. Badania na modelu Qwen2.5-1.5B wykazały, że przy 50% redukcji parametrów CPP z użyciem SparseGPT zmniejszyła średni rozmiar zestawów predykcji z 10.1 do 8.6 na zbiorze DBpedia-14, jednocześnie poprawiając dokładność z 0.347 do 0.366. Wariant z Wandą osiągnął zmniejszenie z 11.2 do 9.0, choć z nieznacznym spadkiem dokładności.

To badanie jest ważne dla praktycznego wdrażania dużych modeli językowych, szczególnie na urządzeniach o ograniczonych zasobach. CPP pokazuje, że można osiągnąć znaczną kompresję bez poświęcania gwarancji statystycznych dotyczących niezawodności modelu - właściwość kluczowa dla aplikacji krytycznych dla bezpieczeństwa, gdzie ślepy zaufanie do wyników modelu może być niebezpieczne.