Perplexity udostępniła open-source Lily - silnik wnioskowania wykorzystywany w technologii Hybrid Compute na urządzeniach z Apple Silicon. Jest to jednoprocessowy runtime, w którym warstwa Rust ładuje model i steruje pętlą generacji, ręcznie napisane kernele Metal wykonują operacje neuronowe, a API kompatybilne z OpenAI streamuje tokeny. Cały stos operacyjny nie zawiera PyTorch ani MLX - wszystko dzieje się bezpośrednio w wyspecjalizowanym kodzie.
Lily celowo ogranicza się do jednego modelu, Qwen3.6-35B-A3B, na jednej rodzinie sprzętu. Ta świadoma specjalizacja jest kluczowa dla uzyskanej wydajności. Model zawiera 35 miliardów parametrów, ale aktywuje jedynie około 3 miliardów na token dzięki routerowi wybierającemu osiem z 256 ekspertów. Checkpoint o rozmiarze 19,4 GB wymaga Mac'a z minimum 32 GB ujednoliconej pamięci, choć Perplexity rekomenduje przynajmniej tę konfigurację dla optymalnych rezultatów. Demo jest publicznie dostępne w repozytorium pplx-garden.
Wyznacznikiem podejścia Lily jest rezygnacja z uniwersalności na rzecz wydajności. Standardowy stos macOS to MLX plus MLX-LM, który obsługuje wiele modeli i musi pozostać przenośny między architekturami. Lily odmówił sobie tej elastyczności - struktura modelu, plany wykonania i wybór kerneli żyją w jednym runtime'ie. To pokazuje, że czasem specjalizacja może być bardziej efektywna niż generyczność, zwłaszcza gdy chodzi o wnioskowanie na urządzeniach mobilnych i desktopowych.