The Unwritten Benchmark to nowy test opublikowany na arXiv, który stawia przed multimodalnymi modelami AI zadanie odczytania słów z samych dźwięków pisania piórem i wideo ruchów ręki. Słowa pochodzą z trzech różnych stylów pisma, ale bez żadnego widocznego śladu atramentu. To wymaga od modeli abstrakcyjnego rozumowania percepcyjnego - jednego z najmniej zbadanych obszarów sztucznej inteligencji.
Wyniki pokazują dramatyczną przepaść między ludzimi a maszynami. Uczestnicy ludzie osiągają dokładność rozpoznawania liter na poziomie powyżej 80 procent, natomiast GPT-4o i Gemini 2.5-Pro - czołowe modele na rynku - nie przekraczają 10 procent. Jeszcze bardziej zaskakujące jest odkrycie tzw. efektu fuzji paradoksalnej: gdy badacze dostarczyli modelom zarówno dźwięk jak i wideo, ich wydajność faktycznie się pogorszyła zamiast ulepszyć. To sugeruje fundamentalną wadę w sposobie, w jaki te systemy integrują informacje z wielu źródeł.
Znalezisko sygnalizuje poważne luki w zdolności współczesnych modeli do rozumowania przyczynowego między modalności i zrozumienia mikrokinetyki - precyzyjnych ruchów niezbędnych do takiego zadania. Benchmark stanowi wyzwanie nie tylko dla bieżącego pokolenia modeli, ale też wskazuje kierunek dla przyszłych badań nad lepszym łączeniem percepcji z abstrakcyjnym myśleniem.