Trzej inżynierowie testowali zdolności trzech czołowych modeli AI - GPT, Claude i Grok - oddając im pełną kontrolę nad rzeczywistym samochodem Toyota Corolla. Zadaniem było dotarcie do najbliższej restauracji sieci In-N-Out, co wymaga skoordynowania wielu umiejętności: wizualnego postrzegania otoczenia, interpretacji sygnalizacji, podejmowania decyzji kierunkowych i bezpiecznej jazdy w rzeczywistym ruchu drogowym. Zderzenie teoretycznych możliwości AI z wyzwaniami praktyczną autonomią ujawniło drastyczne różnice między modelami.
Eksperyment stanowi interesujący test real-world benchmark dla współczesnych systemów AI. Podczas gdy modele wykazują imponujące zdolności w zadaniach tekstowych i analitycznych, jazda samochodem wymaga integracji wielu zmysłów, szybkiego reagowania na nieprzewidziane sytuacje oraz odpowiedzialności za bezpieczeństwo. To, że tylko jeden model zaradził tej próbie, wskazuje na istotne ograniczenia w transferowaniu umiejętności AI z wirtualnych środowisk do fizycznego świata.
Rezultaty mają znaczenie dla dyskusji nad autonomiczną jazdą i wdrażaniem systemów AI w krytycznych aplikacjach. Pokazują, że sama zdolność do przetwarzania tekstu i generowania instrukcji nie przystępuje do radzenia sobie w dynamicznych, rzeczywistych scenariuszach. Badanie zwraca uwagę na lukę między marketingowymi obietnicami AI a jego faktycznym działaniem w praktyce.