Naukowcy NVIDIA we współpracy z Princeton i University of Maryland opracowali PivotOPD - metodę treningu dla agentów AI działających w wieloetapowych zadaniach, która uczy modele nie tylko unikać największych błędów, ale przede wszystkim jak się z nich odtworzyć. Kluczowym pojęciem jest tzw. pivotal mistake - działanie, które wydłuża pozostałą ścieżkę do ukończenia zadania lub czyni je niemożliwym do wykonania.
Metoda została przetestowana na modelach Qwen3-1.7B, Qwen3-8B i Nemotron-3.5-SFT na trzech głównych benchmarkach: ALFWorld, WebShop oraz Search-based QA. W każdym przypadku PivotOPD pokonała 13 innych podejść treningowych, osiągając pierwsze miejsce we wszystkich 8 miarach wydajności. Najimpresjonującej - agent trenowany tą metodą zdołał odtworzyć się z 72,7% replayed pivotal mistakes, podczas gdy standardowa metoda on-policy distillation radziła sobie zaledwie w 20,3% przypadków.
Ważne jest, że PivotOPD nie wymaga dodatkowych kosztów obliczeniowych podczas inferecji - agenci trenowani tą metodą działają z taką samą wydajnością co ich modele bazowe. Metoda wymaga jednak dostępu do środowisk, które mogą powtórzyć błędy, oraz nauczyciela, którego decyzje pokrywają się z optymalnym rozwiązaniem w 77,8% przypadków. To pokazuje, że umiejętność odtwarzania się z błędów jest rzeczywiście nauczalna - coś, czego standardowe podejścia RL bazujące tylko na wynikach końcowych nie osiągają.