Perplexity Research zaprezentowała nowe podejście do treningu swoich agentów komputerowych, które uczy się zarówno ze szcześciwych jak i nieudanych rzeczywistych sesji użytkowników. Zamiast tradycyjnego podejścia, które po prostu naśladuje udane sesje, zespół opracował metodę łączącą rejection sampling fine-tuning z hint-guided self-distillation. W testach A/B odsetek błędów w wywołaniach narzędzi spadł z 2,24% do 1,77%, co Perplexity raportuje jako statystycznie znaczący spadek o 21,2%.
Klucz do tego podejścia leży w zmianie perspektywy na to, co warto się uczyć. Tradycyjne metody rejection sampling judges oceniają całą sesję jako udaną lub nieudaną, a następnie naśladują tylko udane. Problem polega na tym, że agent może popełnić błąd, ale go naprawić i dostarczyć poprawny wynik - w takim wypadku naśladowanie pełnej trajektorii wzmacnia błąd. Zespół Perplexity rozdzielił to na dwie niezależne decyzje: które sesje zawierają zachowanie warte naśladowania i które poszczególne kroki zawierają błędy do korekcji. Każdy turn asystenta otrzymuje jedno z trzech podejść: Imitate dla poprawnych turów w udanych sesjach, Correct dla turów z błędami i zwalidowaną wskazówką, lub Keep as context dla pozostałych kroków.
Pomimo obiecujących wyników, metoda nie jest bezpośrednio dostępna. Perplexity nie udostępniła wag post-trenowanych ani kodu treningu - model działa wyłącznie jako opcja wewnątrz platformy Perplexity Computer. Model bazowy GLM 5.2 jest dostępny na Hugging Face, ale trenowana wersja pozostaje własnością firmy.