Naukowcy z uniwersytetów opracowali TAPR, system który automatycznie przepisuje polecenia użytkowników w lepsze, zoptymalizowane prompty dla dużych modeli językowych. Zamiast wymagać od użytkowników znajomości sztuki tworzenia dobrych promptów, nowy model robi to za nich, tworząc wersje zawierające wyraźniejsze i bardziej pouczające sformułowania.
TATP trenowano przy pomocy reinforcement learning i techniki GRPO, gdzie system uczy się poprzez feedback derivowany z ocen generowanych przez sam LLM. Model podczas treningu analizuje zarówno przepisane prompty, jak i odpowiedzi modelu na zadane pytania. Fine-tuning modelu Phi-4-mini-instruct jako podstawy TAPR pozwolił uzyskać konsekwentne polepszenia wydajności na rzeczywistych zadaniach - od pytań otwartych po złożone problemy matematyczne ze zbioru GSM8K.
To rozwiązanie ma praktyczne znaczenie dla zwykłych użytkowników, którzy nie są ekspertami w prompt engineeringu. Automatyczne przepisywanie promptów może być osadzane w aplikacjach LLM, eliminując potrzebę ręcznego dostrajania instrukcji. Kod projektu jest dostępny publicznie, co pozwala innym badaczom na replikację wyników i dalsze ulepszenia.