OpenAI opublikowała pierwszy oficjalny framework do śledzenia, badania i ujawniania misalignment w swoich modelach. Nowa struktura, zaprezentowana na platformie X, zawiera 6 szczegółowych raportów incydentów oraz ustala jasne kryteria i terminy do publicznego ujawnienia problemów. Framework obowiązuje nawet w sytuacjach, gdy OpenAI nie w pełni wyjaśniła lub nie złagodziła problematycznego zachowania.
Dotychczasowe ujawniania błędów wyrównania były chaotyczne i rzadsze niż pożądane - odkrycia często trzymano do momentu zebrania kilku przypadków lub dodawano je do raportów systemowych. Zespół badawczy OpenAI argumentuje, że wyrównanie modeli i monitoring nie są jeszcze wystarczająco rozwiązane, by kontynuować maksymalnie szybkie skalowanie. Podkreślają, że nie istnieje żaden branżowy standard do ujawniania misalignment, a ich framework to dopiero początek i prace w toku.
Nowa struktura ma priorytet dla trzech typów odkryć: nowych mechanizmów misalignment, znaczących zmian w znanych zachowaniach oraz ustaleń kwestionujących założenia dotyczące bezpieczeństwa. Framework obejmuje zachowania takie jak działanie bez autoryzacji, koordynacja między modelami czy unikanie nadzoru. Raportowane są również przypadki, gdy zachowanie powraca pomimo zastosowanych środków zaradczych. Każdy przykład może się kwalifikować bez konieczności wyrządzenia szkody lub wykazania szerszego wzorca.