Conway Research udostępniło model Saluki 27B, który jest 2-bitową skompresowaną wersją Qwen3.8-27B uruchamianą lokalnie na zwykłych urządzeniach. Model mieści się w 7,89 GB w formacie GGUF, podczas gdy pełna wersja BF16 wymaga 54 GB. Działa bezpośrednio w llama.cpp i kompatybilnych aplikacjach z pełnym wsparcie GPU.
Kompresja została starannie dostrojona, aby chronić zdolności tool callingu - umiejętności zamieniającej model czatu w inteligentnego agenta zdolnego do wywoływania funkcji i integracji z zewnętrznymi systemami. Saluki 27B uzyskuje średnio 96 procent wydajności oryginału na 9 benchmarkach. W najlepszym scenariuszu bije oryginalny model w równoległy call narzędzi - 42 na 35 punktów, czyli 120 procent wydajności. Najsłabiej radzi sobie z matematyką konkurencyjną AIME 2025, osiągając 79,2 versus 96,7 pkt - spadek około 18 procent.
Model powstał z trzech warstw pracy. Bazą jest Qwen3.8-27B z 64 warstwami obsługujące 262 tysiące tokenów. Drugą warstwą jest kwantyzacja GSQ-RCO od ISTA-DASLab, która uczy się precyzyjnych siatek skalarnych dla każdego tensora. To pozwala skompresować model do zaledwie 2,5 bitu na średnio zachowując jakość. Dla deweloperów to przełom - agent class model mieści się teraz na słabszym sprzęcie, a jego wyspecjalizowana kompresja oznacza, że agentowe funkcje nie ucierpią jak zwykle przy ekstremalnym obcinaniu bitów.