Badacze dokumentują dramatyczne postępy w rozwoju modeli językowo-kodowych przez osiem lat, od prostego BERT-a w 2018 roku do współczesnych agentów zdolnych do autonomicznego rozwiązywania skomplikowanych problemów inżynieryjnych. Wzrost wydajności jest szczególnie widoczny od końca 2024 roku, kiedy umiejętność radzenia sobie z rzeczywistymi zadaniami kodowania poprawiała się o prawie 600 procent rocznie.
Nowością jest drastyczny spadek kosztów operacyjnych przy rosnących możliwościach. Model GPT 5.6 Luna od OpenAI oferuje wydajność porównywalną z flagowymi wersjami za jedynie 1-6 dolarów na milion tokenów, co stanowi kamień milowy w demokratyzacji dostępu do zaawansowanych narzędzi AI. Jednocześnie zamiast jednego uniwersalnego modelu obserwujemy fragmentację rynku na rozwiązania specjalizowane: Claude Opus 5 jest najlepszy dla frontendu, Claude Fable 5 dominuje pracę z całymi repozytoriami, a GPT 5.6 Sol przewodzi w zadaniach CLI. Ten trend sugeruje przejście od paradygmatu jednego giganta do ekosystemu wyspecjalizowanych narzędzi.
Wybrane benchmarki pokazują konkretny postęp: model Qwen 2.5 rozwiązuje 58 procent podstawowych testów matematycznych z gramatyki szkolnej metodami elementarnymi, ale zaawansowane techniki samplingowe podnoszą wynik do 79 procent. Dodatkowo narzędzie rankingujące pewność odpowiedzi poprawnie identyfikowało 47 z top 50 wyników, co sugeruje możliwość niezawodnego sortowania zadań. Badacze udostępnili wszystkie materiały badawcze publicznie, ułatwiając weryfikację i dalsze badania w społeczności.