OpenAI ogłosiła, że GPT 5.6 dzięki własnym technikom optymalizacji zmniejszyła koszty serwowania modelu o 20-80% bez utraty jakości. Model aktywnie analizował dane produkcyjne i autonomicznie przepisywał jądra produkcyjne w językach Triton i Gluon, co samo w sobie zmniejszyło koszty end-to-end o 20 procent.

Optymalizacje obejmowały także usprawnianie własnego draft modelu poprzez setki eksperymentów - GPT 5.6 sama projektowała i testowała zmiany w architekturze, rozmiarze i funkcjach, zwiększając efektywność generowania tokenów o ponad 15 procent. Ponadto model poprawił batching, sharding i zarządzanie KV cache dla różnych workloadów, co przyczyniło się do dalszej redukcji kosztów operacyjnych.

To zjawisko potwierdza obserwację z ubiegłego roku, że inteligencja na poziomie GPT-4 staniała 1000-krotnie w ciągu 18 miesięcy. Nowe dane sugerują, że trend ten nie wygasa pomimo wyczerpania łatwych optymalizacji - koszty utrzymania stałego poziomu inteligencji nadal spadają dramatycznie. Recursive self-optimization okazuje się być strategią znacznie bardziej efektywną niż tradycyjne engineering, co ma ogromne implikacje dla dostępności i ekonomiki modeli AI.