Nauczane planowanie kontekstu to technika mająca wybrać istotne fragmenty tekstu przed wysłaniem ich do modelu do odpowiadania na pytania. Badacze przetestowali, czy taki zdecydentnie system rzeczywiście poprawia wyniki w porównaniu z prostszymi metodami jak wyszukiwanie hybrydowe czy BM25. Na zbiorze 503 pytań z LongBench-v2 o postawie wielowariantowej z modelem Qwen2.5-7B-Instruct okazało się, że metoda hybrydowa uzyskuje 36,18 procent dokładności, podczas gdy planowanie trafia tylko na 34,19 procent przy budżecie 18 tys. znaków. Na nietkniętym zbiorze testowym liczącym 152 pytania różnica jest jeszcze wyraźniejsza - 42,11 procent dla wyszukiwania hybrydowego wobec 36,84 procent dla planowania.

Badanie ujawniło fundamentalne ograniczenia nauczanego planowania w praktyce. Nawet zaawansowane routery nie potrafiły wykorzystać potencjału, jaki teoretycznie wskakiwała analiza oracle. Przy silnych ograniczeniach budżetu pamięci, najbliżej kontroli udało się planowaniu w zadaniu 6 tys. znaków, ale tylko o 0,40 punkcie procentowego. Poza tym przekonania planowania przegrywają - przy 9 tys. znaków kontrolne metody wciągają je bez problemu.

Wyniki sugerują zmianę perspektywy na rolę planowania w systemach długokontkstowych. Zamiast zastąpienia tradycyjnego wyszukiwania, nauczane planowanie funkcjonuje jedynie jako słaby dodatkowy sygnał trafności. Analiza kolejności pakowania danych i rozkładu wyników nie ujawniła stabilnego mechanizmu, który wyjaśniałby, kiedy planowanie mogłoby rzeczywiście przodować. Dla praktycystów oznacza to, że inwestycje w techniczne ulepszenia wyszukiwania mogą przynieść większe korzyści niż skomplikowane systemy planowania.