PrismML wydał Ternary Bonsai 2 27B - zdyskwantyzowaną wersję modelu Qwen3.8 27B o rozmiarze zaledwie 5,93 GB zamiast 53,80 GB w standardowym formacie FP16. Model zachowuje imponujące 98,2% wydajności pierwotnego modelu na średniej z 20 benchmarków, co stanowi znaczną poprawę w stosunku do pierwszego Bonsai 27B sprzed dwóch miesięcy, który osiągał około 95%. Nowy model wspiera zarówno dane tekstowe jak i obrazowe, obsługuje kontekst 262K tokenów i został zademonstrowany jako sterownik dla agentów kodowania Cline oraz systemów computer use na karcie RTX 5090.
Technologia ternary weights, wykorzystana w tym modelu, funkcjonuje na zasadzie sprowadzenia każdej wagi do jednej z trzech wartości: -1, 0 lub +1. Każda grupa 128 wag udostępnia skalę FP16, co daje efektywnie około 1,71 bita na wagę zamiast standardowych 16 bitów. Architektura Qwen3.8 27B pozostała niezmieniona z 27,36 miliardami parametrów podzielonymi na 24,35 miliardów w backbone'u języka, 2,54 miliardów w warstwach embeddings i LM head, oraz 0,47 miliardów w wieży wizyjnej. Tylko 26,2 miliona parametrów (0,0976%) pozostaje w wyższej precyzji - dotyczą to ścieżek stanu rekurencyjnego i wag normalizacji.
Model jest w pełni deployable dzięki licencji Apache 2.0 i wymaga jedynie PrismML fork'u llama.cpp lub runtime'u MLX. To sprawiło, że zaawansowany model multimodalny stał się dostępny dla działania na sprzęcie konsumenckim, co stanowi znaczący krok w demokratyzacji dostępu do potężnych modeli AI. Praktyczne zastosowanie demonstracyjne na RTX 5090 pokazuje, że ternary quantization nie jest już tylko koncepcją teoretyczną, ale realnym sposobem na redukcję wymagań infrastrukturalnych przy zachowaniu praktycznie całej wydajności.