Badanie przeprowadzone na platformie arXiv wykazało, że szczegółowe instrukcje zawodowe dla agentów AI nie dają spodziewanych korzyści przy rozwiązywaniu zadań naukowych. Naukowcy testowali Gemini 3.8 Flash na zbiorze 4531 pytań z dziewięciu benchmarków naukowych, porównując specjalistyczne profile agentów ze standardową instrukcją "Jesteś pomocnym asystentem". Wyniki były zaskakujące - średnia różnica dokładności między profilem a linią bazową wyniosła zaledwie -0,6 punktu procentowego, a żaden benchmark nie wykazał statystycznie jasnej poprawy.

Koszty operacyjne szczegółowych instrukcji były znacznie wyższe. Professionalne prompty generowały 1,5-2,3 razy więcej tokenów wyjściowych i kosztowały 2,2-4,5 razy więcej za każde pomyślne wywołanie API. Najgorsza sytuacja miała miejsce w teście BioMysteryBench, gdzie 60 zadań bioinformatycznych wymagających użycia narzędzi wykazało minus 10 punktów procentowych dokładności przy użyciu profili zawodowych wobec linii bazowej - skutek częstszych przekroczeń limitów tokenów i czasu.

Badanie sugeruje, że inżynieria promptów dla agentów naukowych powinna być bardziej oszczędna. Zamiast rozbudowanych instrukcji zawodowych warte rozważenia są minimalnie bardziej szczegółowe wersje, które mogłyby balansować precyzję z efektywnością kosztową. Jedyną przewagę długich promptów zauważono w testach SuperGPQA, gdzie krótka linia bazowa cierpiała z powodu częstszych błędów API, ale to niewystarczająco zdyskwalifikować ogólny wniosek badania.