Startup Poolside AI zaprezentował dwa nowe modele zdolne do samodzielnego rozwiązywania zadań programistycznych - Laguna XS.2 i M.1, które osiągają wyniki odpowiednio 68,2% i 72,5% w benchmarku SWE-bench Verified. To oznacza znaczący skok w możliwościach automatyzacji pracy deweloperów i sprowadza sztuczną inteligencję coraz bliżej samodzielnego radzenia sobie ze złożonymi wyzwaniami kodowymi.

SWE-bench to benchmark oceniający zdolność modeli AI do samodzielnego naprawiania błędów w prawdziwych projektach open source. Wyniki Laguna są imponujące, zwłaszcza że zaledwie rok temu tego typu benchmarki zdominowały modele z wynikami na poziomie 30-40 procent. Oznacza to, że nowe generacja modeli agentic - zdolne do planowania wielokrokowych działań i iteracyjnego rozwiązywania problemów - coraz bardziej zbliża się do praktycznego zastosowania w codziennej pracy inżynierów. Model M.1 przekracza próg 72 procent, co jest rezultatem, który jeszcze niedawno wydawał się poza zasięgiem.

Te osiągnięcia odzwierciedlają rosnący trend inwestycji w specjalistyczne modele AI dla konkretnych branż i zadań. Zamiast polegać wyłącznie na ogólnych modelach jak GPT-4 czy Claude, coraz więcej firm rozwija zdedykowane rozwiązania optymalizowane pod kątem inżynierii oprogramowania. Dla branży technologicznej oznacza to potencjał rzeczywistej transformacji procesu programowania, ale także znamienna wiadomość o tempie, w jakim AI przejmuje umiejętności uważane dotychczas za domenę ludzi.