Naukowcy zbadali fundamentalny problem wspólny dla wielu aplikacji wykorzystujących duże modele języka - czy odpowiedzi pozostają semantycznie podobne, gdy zamienimy jeden model na inny. Do eksperymentu wykorzystali rzeczywiste wiadomości z rozmów zespołowych i porównali jakość odpowiedzi generowanych przez różne LLM-y zarówno z wcześniejszą historią rozmowy, jak i bez niej.

Wyniki badania ujawniły, że zarówno wybór konkretnego modelu, jak i dostępny kontekst rozmowy znacząco wpływają na to, jak podobne będą wygenerowane odpowiedzi i jak dobrze będą one dopasowane do tego, co by odpisali ludzie. To oznacza, że obecne praktyki - takie jak dokładne dopracowanie promptu czy uwzględnienie kontekstu czatu - okazują się niewystarczające do zapewnienia spójności odpowiedzi między różnymi modelami.

Wniosek z badania ma praktyczne znaczenie dla całej branży: rozwijający się ekosystem LLM-ów zmienia się tak szybko, że infrastruktura i strategie projektowania systemów rozmownych muszą być dużo bardziej zaawansowane. Zespoły pracujące nad systemami oceny konwersacji, chatbotami czy asystentami AI potrzebują nowych podejść, które będą w stanie utrzymać stabilne i porównywalne wyniki niezależnie od tego, jaki model będzie używany w danym momencie.