Simon Willison przeprowadził eksperyment z modelem Qwen3.8-27B-Q4_K_M.gguf, testując jego zdolność do dodawania liczb i zwracania wyniku słowami zamiast cyfr. Zainspirował się wcześniejszym badaniem Colina Frasiera, który dwa lata temu testował GPT-4o w podobny sposób, badając jak modele radzą sobie z rosnącymi liczbami.
Wyniki były zaskakująco dobre. W trybie bez reasoning - gdzie model rozwiązywał zadania bez pokazywania swoich kroków - średnia dokładność spadała wraz ze wzrostem liczb, co jest naturalnym zachowaniem dla tego typu zadań. Jednak gdy włączono reasoning, model osiągnął imponujący rezultat: 167 prawidłowych odpowiedzi na 169 prób. W reasoning model pokazywał swoje prace - wyrównywał cyfry w kolumnach i dodawał je od prawej do lewej, czasami poprawiając się, gdy zauważył błąd.
Eksperymenty były uruchamiane na sprzęcie DGX Spark jako pełna kontrola, co uniemożliwia modelowi "oszukiwanie" za pomocą kalkulatora. Wyniki pokazują, że nawet 27-miliardowy model open-source może być niezawodny przy złożonych operacjach arytmetycznych, zwłaszcza gdy ma możliwość zastosowania procesu rozumowania. To ma znaczenie dla praktycznego wdrażania mniejszych modeli w aplikacjach wymagających precyzyjnych obliczeń.