Zespół badaczy zidentyfikował problem nadkorekcji w zerowych i małych zbiorach treningowych dla zadania minimalnych edycji w korekcji błędów gramatycznych przy użyciu dużych modeli językowych. Systemy LLM tradycyjnie przeedytują tekst, uszkadzając dobrze sformułowane fragmenty i obniżając metrykę F0.5, podczas gdy skuteczne fine-tuning wymaga znaczących zasobów infrastrukturalnych.

Rozwiązanie opiera się na trzech kluczowych innowacjach. Po pierwsze, wprowadzili instrukcje oparte na taksonomii - kompleksową listę reguł błędów gramatycznych, która ogranicza zakres dopuszczalnych edycji i wyrównuje LLM z rzeczywistymi potrzebami. Po drugie, descobryli, że batching - umieszczanie kilku nie skorygiowanych zdań w jednym kontekście - działa jak regularyzator zmniejszający overcorrection. Fenomen ten wyjaśniają efektem rozcieńczenia uwagi, który wynika z ograniczonej pojemności self-attention scores. Trzecie, zastosowali LLM-assisted Prompt Optimization, wykorzystując Gemini 3.1-Pro do iteracyjnego doskonalenia instrukcji.

Wyniki są imponujące - osiągnięty wynik F0.5=78.32 na zbiorze testowym BEA-2019 stanowi nowy rekord dla metod opartych wyłącznie na promptach. Szczególnie istotne jest zmniejszenie luki do modeli fine-tuned do zaledwie 0.38 punktu, co sugeruje, że prompt engineering może być równie skuteczny co zasobochłonne fine-tuning przy zachowaniu prostoty wdrażania.