ByteDance Seed i Tsinghua AIR zaprezentowały CUDA Agent - system agentic reinforcement learning'u, który uczy model języka pisać jądra CUDA szybsze niż kompilatory. Problem, który rozwiązuje, jest precyzyjny: nowoczesne modele już potrafią generować poprawny kod CUDA, lecz zwykle jest on wolniejszy niż to, co wytwarzają optymalizatory kompilatora. Bazowy model Seed1.6 przechodzi 74 proc. testów na benchmarku KernelBench, ale przebija torch.compile w zaledwie 27 proc. przypadków, z średnim przyspieszeniem 0.69x - co oznacza, że jego jądra są wolniejsze od tego, co generuje kompilator.

CUDA Agent zamyka tę przepaść umieszczając model wewnątrz rzeczywistego środowiska CUDA wyposażonego w profilowanie, sprawdzanie poprawności i izolowaną piaskownicę. System trenuje model algorytmem PPO przez 150 kroków na kontekście 131 072 tokenów. Rezultaty są imponujące: po treningu model osiąga 98.8 proc. wskaźnik powodzenia i generuje jądra szybsze niż torch.compile w 96.8 proc. przypadków, z geometryczną średnią 2.11x przyspieszenia na benchmarku 250 zadań. To daje około 40 punktów przewagi nad Claude Opus 4.5 i Gemini 3 Pro na najtrudniejszych testach Level-3.

Wyniki budzą zainteresowanie, ale reprodukcja jest trudna. Trenowany agent nie został udostępniony, a system zbudowany na proprietary modelu Seed1.6 z 23 miliardami aktywnych parametrów z całkowitą liczbą 230 miliardów parametrów - żaden z nich nie zostanie opublikowany jako wagi. Zespoły mogą jednak korzystać z otwartego zestawu danych CUDA-Agent-Ops-6K, specyfikacji i przepisów nagradzania. Infrastrukturalne bariery są znaczące: sama piaskownica profilowania wymagała 128 procesorów NVIDIA H20, co ogranicza pełną replikację do dużych laboratoriów i firm z masywną mocą obliczeniową.