Dylan Castillo przeprowadził szczegółowe badanie mające na celu sprawdzenie, czy laboratoria AI celowo trenują modele do rysowania pelikanov na rowerach, czyli czy zajmują się "pelicanmaxxingiem". Inspiracją była popularna nieoficjalna benchmark rozpowszechniana przez Simona Willesona, który losowo testował modele na tym konkretnym scenariuszu.

Metodologia była niezwykle dokładna: Castillo przygotował 48 promptów kombinujących 8 różnych zwierząt z 6 typami pojazdów, a następnie testował je trzy razy na siedmiu modelach - GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 i DeepSeek V4 Pro. Do oceny wyników wykorzystał dodatkowo GPT-5.6 Luna i Gemini 3.1 Flash-Lite. Stworzył też interaktywny filtr do przeglądania wszystkich rezultatów.

Wynalazki są jasne: nie znaleziono żadnych dowodów na pelicanmaxxing. Laboratoria nie są lepsze w rysowaniu pelikanov niż innych zwierząt, nie rysują lepszych rowerów niż innych pojazdów, a kombynacja pelikan-rower nie wygląda lepiej niż sugerowałyby to kombinowane zdolności. Sceny z pelikaniem na rowerze nie wyglądają na zapamiętane wzory. Najciekawiej wypadł model GLM-5.2, który wykazał największy wzrost wydajności na kombinacji pelikan-rower, ale efekt ten był marginalny i nieznaczący statystycznie.