Agenty nawigacji lotniczej, które łączą widzenie komputerowe z przetwarzaniem języka naturalnego, napotykają fundamentalny problem: podczas trenowania nauczane są na bardzo szczegółowych, krok-po-kroku instrukcjach wyrównanych z trajektoriami, ale rzeczywiści użytkownicy wydają krótkie, celowe polecenia. Na zamrożonym nawigatorze OpenFly ta różnica sprawia, że współczynnik sukcesu pada z 31% aż do 11%.
Badam tego problemu zespół zaproponował nowatorskie rozwiązanie - zamiast retrainować duże modele, stworzyli translator pracujący jako warstwa pośrednia. Trajectory-Grounded Instruction Translator uczy się na podstawie rzeczywistych rezultatów trajektorii agenta, tłumacząc naturalne, proste instrukcje użytkownika na precyzyjne komendy zrozumiałe dla systemu. Podejście testowali najpierw na słabszych wersjach instrukcji - osiągnęły one 37,93% sukcesu. Następnie przetestowali zero-shot transfer na autentycznych instrukcjach człowieka - współczynnik sukcesu skoczył z oryginalnych 11,33% do 32,51%.
To podejście ma praktyczne znaczenie, ponieważ pozwala na wdrożenie nawigacji lotniczej bez konieczności ponownego trenowania już istniejących, zafiksowanych modeli. Metoda pokazuje również transfer do innych zbiorów danych i scenariuszy, co sugeruje potencjał dla szerszego zastosowania w Vision-Language Navigation. Badania zostały opublikowane na arXiv jako artykuł naukowy z rejestracją 2610.10635.