Sakana AI i NVIDIA opracowały TwELL - technologię, którą mogą wykorzystać firmy chcące szybciej trenować i uruchamiać duże modele języka. Nowe rozwiązanie przyspieszył inferencję o 20,5 procent, a trening o 21,9 procent, co wcale nie jest błahym wskaźnikiem w świecie, gdzie każda procent szybkości przetłumacza się na realne oszczędności finansowe. TwELL opiera się na niestandardowych CUDA kernels, czyli zoptymalizowanych dla GPU-ów NVIDIA pakietach instrukcji obliczeniowych, które lepiej wykorzystują dostępny paralelizm i bardziej inteligentnie zarządzają pamięcią na urządzeniach.
W praktyce chodzi o to, że współczesne modele językowe to giganci wymagające ogromnej mocy obliczeniowej. Im szybciej da się je uruchomić i nauczyć, tym niższe koszty operacyjne ponoszą firmy, a jednocześnie mogą obsługiwać więcej użytkowników na tym samym sprzęcie. Dla sektora AI, gdzie koszt compute'a często stanowi znaczną część budżetu, nawet kilkudziesięciu procentowe przyspieszenie ma przełożenie na konkretne pieniądze.
Współpraca Sakany AI z NVIDIA pokazuje kierunek, w którym zmierza branża - zamiast czekać na kolejne generacje chipów, firmy optymalizują istniejące narzędzia i infrastrukturę. To oznacza, że droższe modele mogą stać się bardziej dostępne dla mniejszych przedsiębiorstw, a duże korporacje będą mogły uruchamiać bardziej zaawansowane systemy bez masowych inwestycji w nowy sprzęt.