Google DeepMind wydał EmbeddingGemma 2, otwarty model osadzający tekst, kod, obrazy, wideo i audio w jedną wspólną przestrzeń 768-wymiarową. Model zawiera 740 milionów parametrów, obsługuje okno kontekstu 8K tokenów i jest dostępny na licencji Apache 2.0. Wagi modelu są już żywe na platformach Hugging Face i Kaggle, a kompilacje dla Ollamy, llama.cpp GGUF i LiteRT są dostępne teraz.
Model działa poprzez konwersję zawartości na wektory liczb, które reprezentują znaczenie - podobne elementy lądują blisko siebie w przestrzeni wektorowej, ułatwiając wyszukiwanie i porównywanie. EmbeddingGemma 2 zbudowany na architekturze Gemma 4 ma modularny design z trzema komponentami: backbone dla tekstu i kodu (270M parametrów), koder widzenia (170M, opcjonalny) i koder audio (300M, opcjonalny). Deweloperzy mogą ładować tylko potrzebne komponenty - od 270M dla samego tekstu do 740M dla pełnej multimodalności.
To rozwiązanie jest szczególnie ważne dla systemów RAG działających lokalnie na urządzeniach, gdzie dane pozostają prywatne, zmniejsza się opóźnienia i system może pracować offline. Możliwość osadzenia zapytania tekstowego do wyszukiwania foto, czy memo głosowego do wyszukiwania wideo, otwiera nowe przypadki użycia dla wyszukiwania inteligentnego i klasyfikacji zawartości mieszanej.