Badacze z arXiv zapresentowali Kernel Forge, otwarte narzędzie do automatycznej optymalizacji kerneli GPU, które wykorzystuje agenty oparte na dużych modelach języka. Tradycyjnie optymalizacja kerneli CUDA wymagała od inżynierów ręcznego pisania skomplikowanego kodu niskiego poziomu - to zadanie było czasochłonne i wymagało eksperckiej wiedzy. Kernel Forge zmienia to podejście, umożliwiając systemowi AI generowanie i optymalizowanie kerneli z minimalnym udziałem człowieka.
System wyróżnia się kilkoma istotnymi cechami. Zamiast liniowego łańcucha udoskonaleń, wykorzystuje Monte Carlo Tree Search do eksploracji wielu alternatywnych ścieżek optymalizacji. Może pracować bezpośrednio z niezmienionymi modelami PyTorch - obsługuje workloady z zakresu computer vision, diffusion models i dużych modeli języka. Interfejs graficzny pozwala deweloperom monitorować postęp optymalizacji, przeglądać kandydujące kernele i debugować błędy w warunkach rzeczywistych, co stanowi znaczną poprawę w stosunku do wcześniejszych narzędzi generujących samodzielny kod CUDA wymagający ręcznej integracji.
W testach na GPU NVIDIA DGX Spark system wykazał praktyczną wartość - zoptymalizował 14 kerneli do wydajności przewyższającej PyTorch eager mode, osiągając przyspieszenie 1,52x przy zaledwie 50 iteracjach optymalizacji na kernel. To sugeruje, że agentic systems mogą znacząco zmniejszyć latencję i koszt obliczeniowy ML-owych aplikacji produkcyjnych, demokratyzując dostęp do zaawansowanej optymalizacji GPU, która wcześniej była domeną specjalistów.