Naukowcy odkryli metodę pozwalającą na kradzież sekretnych procesów rozumowania z API zamkniętych modeli LLM, takich jak te udostępniane przez OpenAI czy Anthropic. Poprzez analizę wzorców odpowiedzi i sposobu, w jaki modele rozwiązują problemy, można rekonstruować ich wewnętrzne mechanizmy, nawet jeśli dostawcy starannie chronią szczegóły architektury.

To odkrycie ma znaczące implikacje dla branży. Firmy inwestują ogromne zasoby w trenowanie modeli i optymalizowanie ich procesów decyzyjnych. Ujawnienie tych procesów mogłoby pozwolić konkurentom na szybkie skopiowanie lub odtworzenie podobnych zdolności bez ponoszenia odpowiadających kosztów badań i rozwoju. Ponadto procesy rozumowania mogą zawierać własnościowe techniki fine-tuningu lub instrukcji systemowych, które stanowią kluczową przewagę konkurencyjną.

Problem ten pokazuje napięcie między dostępnością potężnych narzędzi AI poprzez API a ochroną własności intelektualnej twórców modeli. W przyszłości mogą być wymagane nowe mechanizmy bezpieczeństwa i audytu, aby uniemożliwić tego typu ekstrakcje, lub zmiana modelu biznesowego w kierunku bardziej zamkniętych rozwiązań on-premise.