Naukowcy zaproponowali nowy framework do wyboru optymalnych zespołów modeli LLM, który opiera się na mierzalnych metrykach heterogeniczności zamiast na heurystycznych podejściach. Kluczowa obserwacja: wydajność zespołu LLM zależy nie tylko od indywidualnych możliwości każdego modelu, ale także od tego, jak dobrze się one uzupełniają - a dokładniej, jak bardzo różnią się ich błędy i strategie decyzyjne.

Framework wykonuje offline profilowanie każdego kandydackiego modelu, a następnie mierzy dwa krytyczne sygnały komplementarności. Pierwszy - dekorrelacja błędów - identyfikuje przypadki, w których modele się mylą niezależnie od siebie, zmniejszając ryzyko wspólnych porażek całego zespołu. Drugi - dywergencja predyktywna - mierzy, jak różne podejścia stosują modele, co zwiększa szanse na złapanie różnych aspektów problemu. Zespół jest następnie wybierany poprzez greedy search, optymalizując kombinację jakości i komplementarności.

Experymenty przeprowadzone na wielu benchmarkach wykazały, że to podejście konsekwentnie przetwarza baseline'e oparte tylko na jakości, nawet gdy pula kandydatów i rozmiar zespołu są ograniczone. To ustanawia powtarzalne zasady selekcji dla systemów multi-LLM i potencjalnie może zmienić sposób, w jaki zespoły AI są konstruowane w praktyce - zamiast intuicyjnie łączyć modele, można teraz opierać się na precyzyjnych metrykach ich uzupełniania się.