Naukowcy z wykorzystaniem modelu DINOv3 Vision Transformer opracowali framework do automatycznego rozpoznawania celów na podwodnych sonarach syntetyczną aperturą. Głównym wyzwaniem była adaptacja modelu wytrenowanego na obrazach naturalnych do pracy z danymi z podwodnej propagacji akustycznej, gdzie brakuje dużych zbiorów treningowych, a szum tła trudno odróżnić od faktycznych celów.

Rozwiązanie podzielono na trzy etapy: w pierwszym zastosowano Low-Rank Adaptation - technikę pozwalającą na efektywne dostrojenie modelu przez zmianę zaledwie 0,26 procenta parametrów przy zamrożonym reste sieci. To podejście zwiększyło pole pod krzywą precision-recall z 0.300 do 0.679, demonstrując znaczną poprawę w rozpoznawaniu podwodnych celów. Drugi etap wykorzystywał hard-negative mining do wzmocnienia granicy decyzyjnej między celami a obiektami mogącymi je naśladować - takimi jak skały czy formacje osadów. Trzeci etap zaś stosował Supervised Contrastive Learning do lepszego separowania reprezentacji celów od szumu tła.

Ciekawie, że kolejne etapy nie przyniosły znaczących dodatkowych ulepszeń - hard-negative mining i SupCon nie wpłynęły istotnie na wyniki w porównaniu z kontrolnymi grupami. Badanie przeprowadzono na rzeczywistych danych sonarowych zebranych podczas misji morskich, używając geograficznego podziału między zbiorem treningowym a testowym, co czyni wyniki praktycznie wartościowymi dla zastosowań militarnych i morskich.