Google DeepMind przedstawił EmbeddingGemma 2, otwarty model osadzania łączący możliwości przetwarzania tekstu i obrazów w jedną, kompaktową strukturę. Model stanowi rozwinięcie wcześniejszej linii Gemma, oferując ultraniskie wymagania pamięciowe bez poświęcania praktycznej użyteczności.
Znaczenie tego rozwoju leży w demokratyzacji zaawansowanych możliwości multimodalnych. Dotychczas modele zdolne do jednoczesnego przetwarzania tekstu i obrazów wymagały znacznych zasobów GPU i były głównie dostępne poprzez proprietarne API. EmbeddingGemma 2, jako rozwiązanie open source, pozwala naukowcom i deweloperom na wdrażanie takich systemów lokalnie na urządzeniach z ograniczonymi zasobami, co otwiera nowe możliwości dla startupów i badaczy bez dostępu do kosztownej infrastruktury.
Model znajduje zastosowanie w wyszukiwaniu semantycznym, systemach rekomendacyjnych opartych na obrazach, moderacji treści czy tworzeniu systemów RAG-owych łączących tekst i wizualizację. Lekka architektura EmbeddingGemma 2 czyni go szczególnie atrakcyjnym dla deployment-u na brzegu sieci, telefonów i urządzeń IoT, gdzie modele tradycyjnie wymagały zbyt wiele zasobów.