BottleCap AI wydał ThinkingCap-Qwen3.8-27B, drugą iterację serii modeli skoncentrowaną na redukcji zbędnych thinking tokenów. Główna obserwacja zespołu - modele do rozumowania generują znacznie więcej tokenów do przemyślenia niż naprawdę potrzebują, bez istotnego wpływu na końcowy rezultat. Zamiast dodawać nową wiedzę czy zmieniać styl odpowiedzi, zespół czysto skupił się na eliminowaniu marnotrawstwa obliczeniowego.

Wyniki pokazują cięcia zużycia tokenów na poziomie 10,7% do 65,5% w zależności od zadania. MMLU-Pro spadł z 1,656 do 571 tokenów - redukcja o 57,3%. GPQA-Diamond wymagało 7,267 tokenów zamiast 12,772, czyli spadek 43,1%. Naturalnie, dokładność maleje na poziomie 0,86 punktu procentowego - to wymierny kompromis. Benchmarki dotyczące wiedzy i zadań wielojęzycznych wymagają największych cięć, podczas gdy zdolności logiczne i zachowanie bezpieczeństwa pozostają zasadniczo niezmienione.

Model jest gotowy do praktycznego użytku - bezpośrednio zastępuje Qwen3.8-27B w vLLM i SGLang. Dostępny w czterech formatach (FP8, NVFP4, GGUF, MLX) na Github'owym repozytorium. Licencjonowanie ma model gated - osoby poza małymi biznesami potrzebują umowy z BottleCap AI. To podejście adresuje realne wyzwanie, gdy szybkość i koszt działania modelu stają się równie ważne co dokładność.