Badacze zaprezentowali rodzinę modeli Pistis, będącą postępem w dziedzinie multimodalnych dużych modeli językowych. Rodzina obejmuje dwie wersje - większy wariant z 27 miliardami parametrów oparty na Qwen3.6 oraz mniejszy model 9B bazujący na Qwen3.5, oba trenowane z wykorzystaniem innowacyjnego frameworku post-treningowego.
Kluczową nowością jest metoda IDRL - Interleaved Distillation and Reinforcement Learning, która na odmianę tradycyjnych podejść łączy w jedną pętlę treningową destylację wiedzy i uczenie ze wzmacnianiem. Zamiast optymalizować te cele niezależnie lub łączyć je w statyczną funkcję straty, IDRL alternuje między nimi, co prowadzi do lepszego transferu wiedzy, większej stabilności optymalizacji i bardziej precyzyjnego przypisania odpowiedzialności dla długoterminowych sekwencji działań agentowych. Framework opiera się na mocnym fundamencie budowanym przez dużą skalę multimodalnego supervised fine-tuning.
Modele występują w dwóch wyspecjalizowanych wariantach - Pistis-Thinking wzmacniający głębokie rozumowanie multimodalne oraz Pistis-Agentic dodatkowo włączający dane trajektorii agentowych do wspierania długoterminowego planowania, iteracyjnego rozumowania i wykorzystania narzędzi. Pistis-Agentic wykazuje szczególną siłę w wyszukiwaniu multimodalnym. Zespół opracował również Pistis-Auto-Harnessing, systemową metodę automowania pewnych aspektów optymalizacji. Oba warianty obu skal modeli osiągają lepsze wyniki niż odpowiadające im modele bazowe, demonstrując efektywność całego podejścia.