Badanie naukowców z Uniwersytetu Harvarda Fiony Chen i Jamesa Strattona na podstawie danych z platformy Jellyfish wykazało, że narzędzia AI do kodowania generują znacznie więcej kodu, ale ta wydajność nie przekłada się na rzeczywisty wzrost produkcji oprogramowania. Analiza obejmowała 300 milionów indywidualnych zdarzeń (commity i pull requesty) oraz dane z systemów zarządzania projektami pochodzące z ponad 700 tysięcy pracowników w ponad 700 firmach zajmujących się rozwojem oprogramowania w okresie od 2021 roku do marca 2026 roku.
Hotspot problemu okazuje się być procesem przeglądu kodu. Podczas gdy asystenci AI przyśpieszają fazę samego pisania, wszystkie zyski efektywności zostają absorbnięte przez downstream bottleneck - kod generowany przez AI wymaga znacznie bardziej wnikliwej kontroli. Pull requesty są częściej odsyłane do poprawek, recenzenci zostawiają więcej komentarzy, a cały proces review'u znacznie się wydłuża. To oznacza, że programiści polegający na narzędziach AI muszą spędzać więcej czasu na weryfikacji i naprawianiu wygenerowanego kodu.
Wniosek z badania jest trzeźwy dla entuzjastów automatyzacji: narzędzia AI nie redukują liczby zatrudnionych programistów ani znacząco nie zwiększają finalnego output oprogramowania. Pokazuje to, że przed skalowaniem AI w rozwoju oprogramowania najpierw trzeba zaadresować problemy z jakością i wiarygodnością generowanego kodu, a także opracować lepsze procesy automatycznego testowania i walidacji.