OpenAI wygenerowało znaczną liczbę dowodów matematycznych, które odbiegają od standardów ustalonych przez grupę badaczy matematycznych konsultujących dla laboratorium. Problem ujawnił się w pracach nad poprawą zdolności modeli do rozwiązywania złożonych zagadnień matematycznych - systemy generowały wprawdzie rozwiązania, ale w formie niestosownej do ogólnie przyjętych w nauce konwencji i wytycznych.
To odkrycie wskazuje na fundamentalną lukę między tym, co modele AI potrafią wytworzyć, a tym, co matematyczna społeczność naukowa uważa za akceptowalne. Badacze z OpenAI oczywiście pracują nad tym, aby ich systemy nie tylko dostarczały poprawne odpowiedzi, ale także przestrzegały rygorystycznych standardów formalnych obowiązujących w matematyce. Problem nie leży w poprawności logicznej, lecz w sposobie prezentacji i struktury dowodów.
Kwestia ta ma znaczenie dla szerszego ekosystemu AI, szczególnie dla potencjalnego wykorzystania zaawansowanych modeli w badaniach naukowych. Jeśli systemy takie jak o1 czy przyszłe wersje nie będą mogły spełniać standardów matematycznych, ich zastosowanie w realnych projektach badawczych pozostanie ograniczone. Rynek czeka bowiem na narzędzia AI, które mogą autentycznie wspierać pracę naukowców, a nie tylko generować przybliżone rozwiązania.