Naukowcy opublikowali pracę pokazującą, jak mogą ukraść ukryte łańcuchy rozumowania (chain-of-thought) z proprietary LLM APIs OpenAI, Anthropic i Google. Powodem jest fakt, że te dostawcy zwracają klientom zaszyfrowane bloki zawierające rozumowanie modelu - mogą być one odtwarzane across sessions, użytkowników i modeli.
Trik działał w następujący sposób: naukowcy brali ślad (trace) wytworzony przez zaawansowany model, wczytywali go do słabszego modelu z tej samej rodziny, a następnie używali go jako część jailbreak'u. W praktyce okazało się, że każdy model w tej samej rodzinie (np. GPT-4, GPT-3.5 itp.) używał tego samego klucza szyfrowania - co umożliwiało im odzyskanie niezaszyfrowanego rozumowania mocniejszego modelu. Zagrożenie było realne: przykładowo mogło być możliwe wyciągnięcie pełnego procesu myślowego ChatGPT-4 poprzez atakowanie tanszego modelu.
Naukowcy utworzyli nawet stronę z nazwą domeny stolen-thoughts.com, aby zilustrować problem. Na szczęście wszyscy dostawcy - OpenAI, Anthropic i Google - potwierdzili otrzymanie raportu i już wdrożyli poprawki bezpieczeństwa. Odkrycie to jednak pokazuje, że nawet systemy zaprojektowane przez największe firmy mogą mieć poważne luki w bezpieczeństwie, zwłaszcza gdy chodzi o ochronę proprietary reasoning trace'ów.