Naukowcy z arXiv opublikowali TaskSense, framework do modelowania świata oparty na zadaniach sterowanych, który radykalnie zmienia podejście do reprezentacji wizualnych w problemach kontroli. Tradycyjne modele świata trenują się poprzez rekonstrukcję pełnych obserwacji, co prowadzi do tego, że sieć neuronowa marnuje zdolność reprezentacyjną na modelowanie nieistotnych elementów wizualnych, a jednocześnie gubi się w szumie wizualnym.
TaskSense rozwiązuje ten problem poprzez wprowadzenie stochastycznego mechanizmu uwagi przestrzennej, który automatycznie identyfikuje regiony obrazu istotne dla danego zadania kontroli. Zamiast rekonstruować całą scenę, model rekonstruuje tylko obserwowane przez uwagę części, co zmusza reprezentację do zachowywania wyłącznie informacji krytycznych dla sterowania. Mechanizm uwagi jest warunkowany poprzednim stanem ukrytym, co pozwala sieciom uczenia się naturalnie śledzić dynamicznie zmieniające się istotne regiony. Dodatkowy cel inverse-dynamics dodatkowo kieruje uwagę w stronę kontrolnie relewantnych regionów.
To podejście wykazało znaczną odporność na wizualne rozpraszacze i zaciemnienia, przy jednoczesnym utrzymaniu konkurencyjnej wydajności względem DreamerV3 na DeepMind Control Suite. Kluczową zaletą jest efektywność reprezentacyjna - model uczy się lepiej, gdy mniej informacji jest bezużytecznym dla konkretnego zadania, co ma implikacje dla optymalizacji modeli wizualnych w robotyce i systemach autonomicznych.