Cactus wydała drugą wersję modelu Needle - ultra-lekkiego LLM opartego na architekturze Simple Attention Networks, zajmującego zaledwie 14MB na dysku. Model zawiera 45 miliardów parametrów skompresowanych do 2 bitów i pełna sesja korzysta z 28MB RAM-u, co czyni go praktyką wykonalnym nawet na najtańszych urządzeniach.
Wydajność Needle 2 jest zadziwiająca biorąc pod uwagę wielkość. Na Raspberry Pi 5 osiąga 500 tokenów na sekundę, na urządzeniach VR takich jak Meta Quest 3S czy Apple Vision Pro siedzi w przedziale 400-1500 tokenów na sekundę, a na budżetowych telefonach Samsung A-Series poniżej 200 dolarów utrzymuje się na poziomie 300-700 tokenów. Konkurencyjnie wypada względem modelów takich jak LFM2.5 230M czy Apple Foundation Model - Needle 2 oferuje porównawną wydajność w zadaniach tool call i device use, pozostając 5 do 70 razy mniejszy.
To istotne, ponieważ dotychczasowe podejście do edge AI koncentrowało się na Macach i PCs - zaledwie 1,5 miliarda urządzeń. Świat ma dziś ponad 21 miliardów podłączonych urządzeń IoT, a w rynkach wschodzących większość smartfonów kosztuje poniżej 200 dolarów i pozbawiona jest dedykowanych akceleratorów AI. Needle 2 zmienia grę dla tej populacji - tandetnych telefonów, Raspberry Pis, mikrokontrolerów, urządzeń noszonych i małych robotów.