Simon Willison otrzymał dostęp do GPT-6 Astra i postanowił przetestować jego możliwości generowania obrazów, tworząc sieć pelekanów na rowerach na pięciu poziomach reasoning: low, medium, high, xhigh i max. Porównał wyniki z trzema wersjami GPT-5.6 - Sol, Terra i Luna - wizualizując wszystko w siatce do bezpośredniego porównania. Wyniki były zdecydowanie przychylne dla nowego modelu.

Astra prezentuje się imponująco już na najniższych ustawieniach. Nawet najlepszy pelekan generowany przez GPT-5.6 Sol (poziom xhigh) to zbiór abstrakcyjnych kształtów, podczas gdy każdy z pelekanów Astra - od low do xhigh - wygląda znacznie lepiej. Wersja max Astra jest naprawdę wysoka jakością. Warte uwagi jest, że Astra na poziomie low (9,55 centów) generuje lepsze wyniki niż jakiekolwiek inne modele Sol na dowolnym poziomie. To czyni go niezwykle efektywnym pod względem ceny za jakość.

Uniwersalne wskaźniki kosztowe pokazują, że Astra jest wprawdzie około dwa razy droższy od Sol (10 dolarów na milion tokenów input, 50 dolarów na milion output, wobec 5 i 30 dla Sol), ale wykorzystuje znacznie mniej tokenów na każdym poziomie rozumowania, co zbliża koszty różnych poziomów do siebie. Ciekawe też odkrycie: zarówno Astra jak i Luna zużyły 16 tokenów wejściowych, podczas gdy Sol i Terra zużyły 26. Ta zgodność sugeruje, że Astra i Luna mogą być bardziej powiązane niż oficjalnie zadeklarowano.