Epoch i METR wydały benchmark MirrorCode, który testuje zdolność systemów AI do wykonania zaawansowanych zadań programistycznych bez dostępu do kodu źródłowego oryginalnych aplikacji. Modele muszą w pełni re-implementować programy bazując tylko na interfejsie CLI - co znaczy, że muszą wymyślić całą architekturę, nie tylko tłumaczyć kod linia po linii. Opus 4.7 справился z jednym zadaniem w 14 godzin i za 251 dolarów, podczas gdy METR i Epoch szacują, że człowiekowi zajęłoby to od 2 do 17 tygodni.

Benchmark testuje re-implementację rzeczywistych programów o różnym stopniu złożoności: pkl to konfiguracyjny język programistyczny opracowany przez Apple'a liczący 61 tysięcy linii kodu, gotree służy do analizy i manipulacji drzewami filogenetycznymi (16 tysięcy linii) i inne podobne projekty. To nie są sztuczne problemiki akademickie - to rzeczywiste, użyteczne narzędzia.

Dane pokazują dramatyczne przyśpieszenie postępu. Modele z roku temu osiągały około 30% sukcesu i były ograniczone do prostszych programów, takich jak narzędzia do obsługi kalendarzy. Teraz najlepsze modele radzą sobie z zadaniami, które do niedawna uważano za wymagające głębokich umiejętności inżynieryjnych. To ilustruje lekcję znaną w robotyce jako bitter lesson - że surowa moc obliczeniowa i skalowanie modelów często pokonuje bardziej wyrafinowane podejścia. Dla branży oprogramowania to potencjalnie przełomowe - jeśli trend będzie się utrzymywać, wiele zadań programistycznych mogłoby być szybko automatyzowanych.