mKernel to nowa biblioteka kerneli GPU, która łączy operacje sieciowe bezpośrednio z obliczeniami - bez tradycyjnych opóźnień wynikających z rozdzielenia transportu danych od przetwarzania. Rozwiązanie integruje komunikację między procesorami graficznymi na tym samym węźle i między różnymi węzłami klastra, eliminując czekanie na zakończenie transferu danych przed rozpoczęciem obliczeń. To podejście pozwala na pipeline'owanie operacji komunikacyjnych z numerami, co daje znaczące przyspieszenia w praktyce. Biblioteka jest szczególnie istotna dla trenowania ogromnych modeli AI, gdzie komunikacja GPU stanowi wąskie gardło - przy miliardach parametrów transfer danych między procesorami graficznymi zajmuje współmiernie więcej czasu niż same obliczenia.
Optymalizacja komunikacji GPU to jeden z najistotniejszych kierunków badań nad skalowaniem treningu dużych modeli językowych i sieci neuronowych. Właśnie dlatego tak ważne są rozwiązania takie jak mKernel - w dobie modeli takich jak GPT-4, Llama czy PaLM każdy procent poprawy wydajności komunikacji sieciowej bezpośrednio przełoża się na czas treningu i koszty obliczeniowe. Tradycyjne podejście, gdzie dane najpierw transfer z GPU na sieć, potem wracają do GPU, to zbyt wolne dla współczesnych wymagań. Eliminując te przeskoków, mKernel zmniejsza liczbę dostępów do pamięci i skraca czas całej operacji.
Wpływ mKernel może być widoczny zarówno dla badaczy trenujących wielkie modele na klastrach superkomputerowych, jak i dla firm oferujących usługi AI w chmurze. Każde procentowe przyspieszenie oznacza mniej wykorzystanej energii, szybsze iteracje eksperymentów i niższe rachunki za czas obliczeniowy. Biblioteka wpisuje się w szerszą tendencję optymalizacji na poziomie sprzętu i oprogramowania - bo przyspieszanie komunikacji domaga się współpracy między projektantami algorytmów, bibliotekami jak NCCL i samymi producentami GPU.