Andrej Karpathy, jedna z kluczowych postaci w świecie sztucznej inteligencji, opuszcza OpenAI i dołącza do Anthropic na stanowisku senior szkoleniowca ds. modeli. To transfer, który może znacząco wpłynąć na tempa rozwoju Claude'a - flagowego modelu tekstowego konkurencyjnego wobec GPT-4. Karpathy będzie odpowiadać za optymalizację procesu pre-trainingu, czyli etapu, w którym model uczy się podstawowych wzorców języka na ogromnych zbiorach danych tekstowych. To właśnie ta faza decyduje o fundamentalnych możliwościach sieci neuronowej, zanim trafi do fazy fine-tuningu kierowanego przez ludzi.
Karpathy to niemal legenda branży - współzałożył OpenAI w 2015 roku, a następnie pracował w Tesli jako szef zespołu zajmującego się sztuczną inteligencją. Jego doświadczenie w trenowaniu dużych modeli jest praktycznie nie do podważenia, a jego odejście z OpenAI już w połowie tego roku zaskoczyło wielu obserwatorów rynku. Teraz pytanie brzmi: dlaczego zdecydował się wybrać Anthropic zamiast pozostać wśród założycieli OpenAI lub szukać nowych wyzwań gdzie indziej? Dla Anthropic to transfer kaliber mistrza - mającej zaledwie kilka lat firma walczy z OpenAI i Googliem o pozycję lidera w race o superinteligencję.
Praktycznie rzecz biorąc, Karpathy wnosi do Anthropic wiedzę na temat tego, jak efektywnie uczyć modele, jak skalować procesy treningowe i jak wyciągać maksimum wydajności z dostępnych zasobów obliczeniowych. W erze, gdy różnica między dobrym modelem AI a genialnym może się sprowadzać do detali w strategii pre-trainingu, ta postać może być dla Anthropic nieoceniona. To pokazuje, że konkurencja w AI nie śpi - i że nawet ludzie ze szczytu piramidy są gotowi zmieniać pracodawcę, jeśli poczują, że mogą zrobić coś znaczącego w innym miejscu.