OpenAI uruchomiła GPT-6 Astra Ultrafast na GPU NVIDIA Blackwell, osiągając do 8x szybszą generację tokenów w porównaniu z trybem Standard. Model jest już dostępny w API OpenAI oraz dla uprawnionych użytkowników ChatGPT Work i Codex. Przyspieszenie wynika z optymalizacji wnioskowania, które wykorzystują specjalne możliwości architektury NVIDIA Blackwell.
Znaczenie tego rozwinięcia leży przede wszystkim w praktycznych zastosowaniach dla deweloperów pracujących z agentami kodowymi. Szybsza generacja tekstu bezpośrednio skraca cykle "edit-test-debug", zmniejsza czas oczekiwania między wywołaniami narzędzi i sprawia, że aplikacje interaktywne wydają się bardziej responsywne. Dla agentów pracujących w pętlach, gdzie model pisze kod, uruchamia narzędzie, sprawdza wynik i decyduje o następnym kroku, każdy dodatkowy segundo ma znaczenie.
Philippe Tillet, vedący zespół inference'u w OpenAI, podkreśla, że głębokie inwestycje NVIDIA w dokumentację i narzędzia umożliwiły zespołowi OpenAI stworzenie wyjątkowo wydajnych kerneli dla architektury Blackwell. Sama nazwa "Ultrafast" sugeruje, że to zaledwie początek optymalizacji - OpenAI aktywnie używa własnych modeli do dalszego doskonalenia oprogramowania inferencji nawet po wdrożeniu.