Naukowcy z arXiv zapresentowali COPE - framework do ciągłej personalizacji wielkich modeli języka, który rozwiązuje problem braku możliwości dostosowania się do indywidualnych preferencji użytkowników. Istniejące rozwiązania albo wymagały inżynierii promptów zajmującej kontekst, albo zamarzały po treningu, nie potrafiąc adaptować się do rzeczywistych wymagań użytkowników.
Klucz do COPE to przypisanie każdemu użytkownikowi osobistego learnable embeddingu i inteligentna kombinacja trzech elementów w jednym kroku aktualizacji - przechwytywania preferencji, kalibracji samooceny i optymalizacji personalnych odpowiedzi. Innowacyjnym podejściem jest użycie samooceny modelu do generowania proxy rewards, co pozwala na aktualizacje modelu nawet gdy brakuje jawnego feedbacku od użytkownika. To szczególnie ważne w praktycznych scenariuszach, gdzie zbieranie informacji zwrotnej jest trudne i kosztowne.
Eksperymenty wykazały, że COPE konsystentnie przewyższa zarówno metody bez treningu jak i metody treningowe w warunkach rzadkiego feedbacku, a jednocześnie doskonale współpracuje z technikami Retrieval-Augmented Prompting. Dodatkowe analizy potwierdzają wiarygodność samooceny COPE, obecność sensownych wzorców preferencji oraz stabilność ogólnych możliwości modelu, a także odporność na zmienne preferencje użytkowników.