Cognition, firma za projektem agenta kodującego Devin, wydała SWE-2 - swój dotychczas najbardziej zaawansowany model dedykowany pisaniu kodu. Model osiąga wynik 50,0% na benchmarku FrontierCode 1.1 Main, zaledwie punkt poniżej Fable 5.1, przy jednoczesnym zmniejszeniu kosztów o 64 procent. Ulepszenia kolejne wynikają z post-trainingu z reinforcement learning na bazie Kimi K3 firmy Moonshot AI, którą cechuje mniej więcej 3 razy większa liczba parametrów niż jego poprzednik.
SWE-2 wprowadza znaczącą zmianę architektoniczną - po raz pierwszy model Cognition oferuje wybieralne poziomy wysiłku obliczeniowego, wszystkie wytrenowane w jednym przebiegu algorytmu RL. Każdy poziom powiązany jest z własną karą kosztową, co pozwala całej granicy kosztowo-wydajnościowej przesunąć się równomiernie. Cognition twierdzi, że ich RL odkrył istotne możliwości do poprawy na bazie K3, dodając 5 do 6 punktów na wielu benchmarkach.
Ale jest haczyk - SWE-2 nie będzie dostępny dla użytkowników chcących wdrażać go na własnej infrastrukturze. Model nie ma otwartych wag i nie posiada niezależnego API. Działa wyłącznie wewnątrz agenta Devin, teraz dostępny w wersjach Desktop i CLI, z planowanymi wydaniami Devin Web i Fusion. To stanowi wyraźny kontrast z podejściem do otwartych modeli i ogranicza dostępność do użytkowników już osadzonych w ekosystemie Cognition.