Mistral AI wprowadza nową funkcjonalność Remote Agents, która umożliwia autonomicznym agentom AI pracowanie nad złożonymi zadaniami inżynierii oprogramowania bez stałego nadzoru człowieka. Funkcja dostępna jest już w platformie Vibe, gdzie użytkownicy mogą delegować prace programistyczne zautomatyzowanym systemom. Jednocześnie francuska firma zaprezentowała ulepszony model Mistral Medium 3.5, który w benchmarku SWE-Bench Verified osiągnął wynik 77.6% - jest to jeden z bardziej zaawansowanych wyników w polu automatycznego rozwiązywania zadań związanych z kodowaniem.

Benchmark SWE-Bench Verified to test zaproponowany przez komunię badaczy, który ocenia rzeczywiste umiejętności modeli w radzeniu sobie z problemami z autentycznego świata oprogramowania. W praktyce polega na próbie rozwiązania prawdziwych issues z baz kodu, co jest znacznie bardziej wymagające niż typowe pytania testowe. Wynik 77.6% oznacza, że Mistral Medium 3.5 potrafi samodzielnie radzić sobie w niemal trzech czwartych takich rzeczywistych przypadków - to duży krok naprzód w kierunku AI zdolnego do zamiany pracy kodowników na rutynowych zadaniach.

Dla branży to sygnał, że agenty AI stają się coraz bardziej niezawodne i mogą faktycznie przejąć część obowiązków programistów, szczególnie przy obejściach błędów czy refaktoryzacji kodu. Mistral AI, konkurent ChatGPT czy Claudy, utwierdza swoją pozycję jako jeden z poważnych graczy na rynku modeli AI, oferując narzędzia nie tylko do konsultacji, ale do faktycznego wykonywania pracy. To jednak nie oznacza, że programiści mogą przejść na emeryturę - agenty nadal potrzebują dobrego promptu i weryfikacji człowieka, choć przyspieszenie pracy nad projektami może być znaczące.