Biblioteka Sentence Transformers zyska nowe możliwości pracy z wieloma typami danych jednocześnie. Hugging Face wprowadza wsparcie dla multimodalnych modeli embedingowych i rerankerów, które potrafią przetwarzać zarówno tekst, jak i obrazy w jednym procesie. To oznacza, że zespoły pracujące z wyszukiwaniem, rekomendacją czy systemami RAG będą mogły teraz łączyć informacje wizualne i tekstowe w sposób znacznie bardziej naturalny i efektywny niż do tej pory.
Dotychczas Sentence Transformers były zdominowane przez podejścia czystotekstowe, co ograniczało możliwości w scenariuszach wymagających analizy obrazów. Nowe multimodalne modele embedingowe pozwalają na obliczenie reprezentacji wektorowych dla tekstu i zdjęć w jednej, wspólnej przestrzeni. Oznacza to, że możemy szukać zdjęć za pomocą opisów tekstowych lub znaleźć tekst pasujący do konkretnego obrazu. Rerankerzy multimodalne natomiast umożliwią dokładne przerangowanie wyników - model będzie oceniać, jak dobrze obraz pasuje do zapytania tekstowego lub vice versa.
To rozszerzenie ma potencjał zmienić sposób, w jaki aplikacje obsługują wyszukiwanie hybrydowe. E-commerce'owe wyszukiwarki mogą oferować search by image z dokładniejszym rankingiem wyników. Systemy pytania-odpowiedź będą mogły analizować dokumenty zawierające zarówno tekst, jak i ilustracje. Biblioteka Sentence Transformers, już popularna w ekosystemie open source, staje się tym samym bardziej uniwersalnym narzędziem dla każdego, kto pracuje z AI na produkcji.