OpenAI opracowało chipy Jalapeño specjalizujące się w szybkiej inferencji na dużą skalę, które przebijają obecne benchmarki wydajności. W testach przeprowadzonych na benchmarku InferenceX firmy SemiAnalysis Jalapeño wykazał zarówno wyższą liczbę tokenów na użytkownika, jak i lepszą przepustowość na kilowat zużytej energii w porównaniu do aktualnie dostępnych rozwiązań state-of-the-art.
Inference to faza, w której model AI już wytrenowany przetwarza pytania użytkowników i generuje odpowiedzi. Jest to kluczowy element infrastruktury dla firm oferujących usługi oparte na modelach AI, bo odpowiada za rzeczywisty cost operacyjny działania systemów. Jeśli OpenAI potrafi zmniejszyć zarówno czas odpowiedzi, jak i zużycie energii na operację inference, oznacza to potencjał do znacznego obniżenia kosztów skalowania swoich usług AI.
Zwłaszcza że efektywność energetyczna staje się coraz bardziej krytyczna dla branży AI. Masowe wdrażanie modeli LLM wymaga ogromnych mocy obliczeniowych, a to przekłada się na wysoki rachunek za prąd. Chipy Jalapeño mogą dać OpenAI konkurencyjną przewagę w oferowaniu tańszych i szybszych odpowiedzi, zarówno dla własnych produktów, jak i dla klientów API.