Iris-mini i Iris-pro to agenci wyszukiwania trenowani w skalach odpowiednio 35 miliardów i 397 miliardów parametrów, stanowiący skok w kierunku systemów zdolnych do złożonego rozumowania wieloetapowego. Zespół opracował nowatorski pipeline tworzenia danych, gdzie zadania konstruuje się wstecz z hiperlinków web corpusu - budując łańcuchy multi-hop po grafie encji, przepisując każdą non-odpowiedź na referencję deskryptywną, tak aby żaden wymóg nie mógł być rozwiązany prostym matchingiem stringów.

Klucz do sukcesu tkwi w procedurze SFT-RL climbing, która iteracyjnie zmienia etapy treningu. Najpierw supervised fine-tuning uczy agenta wzorów rozumowania, następnie reinforcement learning optymalizuje politykę przeciwko żywemu wyszukiwarkom z nagrodami ocenianymi wewnątrz klastra treningowego. Długie rolloutsy mogą być przerwane na poziomie requestu i wznowione z poprzednio zapisanego prefiksu. Najtrudniej rozwiązane i najbardziej efektywne trajektorie z każdej rundy RL wracają do następnego etapu SFT, tworząc virtuous cycle.

To podejście stawiło przy tego, że zarządzanie kontekstem w inference'ie ma większą wartość na benchmarkach niż większość raportowanych różnic między systemami - stąd autorzy ewaluują każdy benchmark zarówno z zarządzaniem kontekstem, jak i bez niego. Wszystkie wyniki pochodzą z jednolitego agenta ReAct bez sub-agentów, co pokazuje siłę samej optymalizacji polityki.