Naukowcy z arXiv CS.AI wykazali, że duże modele językowe mogą korzystać z deliberacji grupowej, podobnie jak ludzie. Zamiast po prostu uśredniać niezależne odpowiedzi, zespoły LLM z różnych rodzin dyskutowały o problemach, a wynikające z tego konsensusowe oszacowania były znacznie dokładniejsze niż zarówno zwykła agregacja, jak i pojedyncze osądy.
Badania obejmowały cztery coraz bardziej realistyczne scenariusze: szacowanie liczb na obrazach, recenzowanie artykułów naukowych z machine learningu, wykrywanie ukrytego złośliwego zachowania agentów AI oraz prognozy sportowe wobec rzeczywistych rynków predykcyjnych. We wszystkich domenach deliberacja zmniejszała błędy zbiorowe, a poszczególne modele zachowywały te zyski nawet po zakończeniu dyskusji.
Najistotniejszym odkryciem jest wymóg różnorodności - grupy złożone z klonów tego samego modelu nie zyskiwały na deliberacji. To wskazuje, że heterogeniczność jest kluczowym czynnikiem zbiorowego rozumowania AI. Wyniki sugerują, że deliberacja może stać się uniwersalnym mechanizmem agregacyjnym dla systemów AI, oferując potencjał do tworzenia bardziej niezawodnych i dokładnych zbiorowych predykcji.