Zespół badaczy opublikował KernelArc - nowy framework do automatycznej optymalizacji kerneli GPU pracujący na zasadzie wieloagentowego systemu koordynacyjnego.System został przetestowany na kartach NVIDIA H100 i B200 przy użyciu benchmarku SOL-ExecBench, a jego implementacje zajęły pierwsze miejsca w czterech reprezentatywnych kategoriach zadań optymalizacyjnych.

Framework działa poprzez równoległy transport wyspecjalizowanych agentów, które współpracują za pośrednictwem determinystycznego strażnika benchmarków i wspólnej pamięci zawierającej tylko wnioski z analiz. Każdy agent specjalizuje się w innym aspekcie optymalizacji kerneli - system zdołał automatycznie wygenerować custom implementacje dla BF16 GEMM, staticznych konfiguracji cuBLASLt, wskoczonej optymalizacji mixture-of-experts, fusion dekodera oraz attention mechanisms w formacie NVFP4. Kluczową cechą jest mechanizm przerwania - gdy któryś agent przestaje osiągać poprawę wydajności, system automatycznie przełącza zasoby na inne podejścia.

Znaczenie tego wyniku polega na wykazaniu, że współpraca wielu specjalistycznych agentów AI może bardziej efektywnie eksplorować przestrzeń możliwości optymalizacyjnych niż tradycyjne podejścia. Zamiast jednego systemu próbującego wszystkiego, różne agenty mogą równolegle badać różne strategie i dzielić się odkryciami. To ma praktyczne znaczenie dla tworzenia wydajnych kerneli GPU, co jest kluczowe dla szybkości trenowania i uruchamiania dużych modeli AI - nawet małe przyspieszenia w kernelach mogą przełożyć się na znaczne oszczędności czasowe i energetyczne dla gigantycznych operacji obliczeniowych.