Nowe badanie pokazuje, że wirtualne maszyny macOS wykorzystujące Apple Silicon mogą wykonywać wnioskowanie dużych modeli języków nawet 16 razy szybciej niż dotychczasowe rozwiązania. Testy przeprowadzono z użyciem Llama.cpp, popularnej biblioteki optymalizacyjnej dla modelów open source.

Wynik wynika z możliwości przekazywania dostępu do GPU bezpośrednio do maszyny wirtualnej, co pozwala na pełne wykorzystanie architektoniki Apple Silicon. Dotychczasowe VM na macOS były zmuszone pracować z ograniczeniami sprzętowymi, co drastycznie obniżało wydajność inference'u dla aplikacji AI. Przyspieszenie 11-16 razy to kwadratowy skok w praktyczności uruchamiania modelów na lokalnych maszynach.

Dla ekosystemu macOS oznacza to nowe możliwości - deweloperzy mogą teraz uruchamiać zaawansowane modele AI bez wysyłania danych do chmury, co ma znaczenie zarówno dla bezpieczeństwa, jak i dla szybkości aplikacji. Wyniki będą szczególnie ważne dla firm działających w sektorze AI, które rozwijają narzędzia natywne dla platform Apple.