OpenAI zaprezentowało nowe wyniki testów GPT-5.5, które zaskakują wysokim wynikiem 93 na 100 punktów w dziesięcioproundowej evaluacji. Model stracił zaledwie siedem punktów, a przyczyna okazała się zupełnie niespodziewana - penalizacja za nadgorliwość w odpowiadaniu na pytania. To zaskakujące odkrycie sugeruje, że architektura modelu działa niemal bez zarzutu w testowanych scenariuszach, a jedyne mankamenty dotyczą stylu komunikacji niż merytorycznych błędów.
Testy obejmowały szeroki zakres zadań, od rozumienia kontekstu, przez logiczne rozumowanie, aż po generowanie treści. W każdej z dziesięciu rund GPT-5.5 wykazywał konsekwentnie wysoką wydajność, która plasuje go wśród najlepszych modeli językowych dostępnych na rynku. Wynik 93/100 jest szczególnie imponujący, biorąc pod uwagę, że większość poprzednich generacji modeli tracała znacznie więcej punktów za faktyczne błędy merytoryczne lub niezrozumienie zadań.
Penalizacja za nadmierne entuzjazm ujawnia interesującą cechę nowego modelu - GPT-5.5 wykazuje tendencję do szczególnie aktywnego angażowania się w rozmowę i zapewniania zdecydowanie za dużo dodatkowych informacji, gdy wystarczałaby krótka, precyzyjna odpowiedź. Dla użytkowników może to oznaczać zarówno pozytywny aspekt w postaci szczegółowego wsparcia, jak i potencjalnie irytujące nadmiarowości. Wynik sugeruje, że OpenAI będzie musiało w kolejnych iteracjach pracy nad kalibrracją tonacji modelu, aby osiągnąć idealną równowagę między pomocnością a zwięzłością.