Meta wydała Muse Glimmer, 30-miliardowy model multimodalny oparty na destylacji z Muse Spark, który zmienia podejście do wdrażania agentów AI na urządzeniach konsumenckich. Normalna wersja modelu 30B wymaga ponad 55 GB pamięci, ale Meta skompresowała go do około 4 bitów i dodała block-level speculative decoding, co umożliwia uruchomienie go na jednym GPU z 24 GB VRAM lub Macu z czipem M4/M5 Max bez żadnych połączeń sieciowych.
Model jest dostępny pod licencją Apache 2.0 z pełnymi wagami w formatach BF16, GGUF k-quants, ExecuTorch builds i DFlash drafter na Hugging Face. Dla solo developerów i startupów oznacza to możliwość samodzielnego hostowania agentów na swoim sprzęcie, podczas gdy zespoły mid-market zyskują on-prem inference bez kosztów per-token. Szczególnie ważne jest to dla przedsiębiorstw regulowanych, których dane nie mogą opuszczać sieci wewnętrznej - Muse Glimmer może działać w trybie air-gapped.
Model znajduje zastosowanie w healthcare, prawnictwie, usługach finansowych, obronie, sektorze publicznym i produkcji, czyli tam gdzie residencja danych, praca offline lub opóźnienia sieciowe dyskwalifikują rozwiązania chmurowe. Obsługuje aplikacje takie jak desktop agenty czytające zrzuty ekranu, agenty kodujące, функции schema-based calling, rozumienie dokumentów i wykresów, generowanie danych syntetycznych oraz ewaluację LLM-as-a-judge.