Zespół badawczy opracował kompleksowy framework do augmentacji multimodalnych danych i benchmark do testowania odporności modeli AI przy użyciu biblioteki AugLy. Narzędzie obsługuje transformacje obrazów, tekstu i audio, integrując się bezpośrednio z PyTorch DataLoaders, co czyni go gotowym do praktycznego zastosowania w rzeczywistych projektach.

Framework oferuje zarówno API funkcyjne, jak i klasowe, umożliwiając precyzyjne śledzenie intensywności transformacji, probabilistyczne komponowanie augmentacji i obsługę bounding boxów. Kluczową cechą jest generowanie deterministycznych syntetycznych zbiorów danych, dzięki czemu eksperymenty pozostają w pełni odtwarzalne. Badacze skontruowali praktyczne eksperymenty obejmujące benchmark detekcji kopii opartej na hash-ach perceptualnych pod wpływem zniekształceń obrazu oraz ewaluację klasyfikatorów tekstu wobec perturbacji adversarialnych, obfuskacji Unicode i treningów adversarialnych.

Innowayjne ujęcie AugLy łączy dwie tradycyjnie rozdzielane funkcjonalności - augmentacja jako mechanizm generowania danych treningowych i jednocześnie jako mierzalne narzędzie do oceny odporności modeli. System tworzy również queryable metadata warehouse, który umożliwia śledzenie wszystkich transformacji i ich wpływu na wydajność modelu. Ta holistyczna perspektywa może znacząco przyczynić się do budowy bardziej niezawodnych i bezpiecznych systemów AI.