Naukowcy opracowali nową metodę o nazwie GQLA, która ma uczynić dekodowanie dużych modeli językowych znacznie wydajniejszym i tańszym obliczeniowo. Propozycja zakłada adaptacyjny mechanizm attention - czyli sposób, w jaki model zwraca uwagę na poszczególne części tekstu - który dostosowuje się do możliwości sprzętu, na którym pracuje. Dzięki temu rozwiązaniu udaje się zmniejszyć zużycie pamięci i przyspieszać przetwarzanie bez widocznego pogorszenia się jakości generowanych odpowiedzi.

To rozwiązanie ma konkretne znaczenie praktyczne dla firm i organizacji, które chcą wdrożyć potężne modele AI na urządzeniach ze słabszymi zasobami - od serwerów z ograniczoną mocą obliczeniową po smartfony czy urządzenia IoT. Zamiast płacić za drogi sprzęt lub polegać całkowicie na chmurze, można teraz wykorzystać GQLA do optymalizacji istniejących systemów. To szczególnie ważne dla wdrażania AI na urządzeniach brzegowych, gdzie transfer danych do chmury byłby zbyt powolny lub kosztowny.

GQLA otwiera drzwi do demokratyzacji dostępu do sztucznej inteligencji - mniejsze firmy i startupy będą mogły korzystać z zaawansowanych modeli bez inwestowania astronomicznych sum w infrastrukturę. Jednocześnie to pokazuje, że współczesne badania nad AI coraz częściej skupiają się nie na budowaniu coraz większych modeli, ale na ich inteligentnej optymalizacji dla rzeczywistych warunków pracy w produkcji.