Naukowcy z arXiv opracowali nową teoretyczną ramę do optymalnego decydowania, które modele języka aktywować podczas wnioskowania, aby minimalizować koszty obliczeniowe. Problem pojawia się, gdy organizacje dysponują kilkoma eksperckimi LLMami o różnych kosztach i możliwościach - muszą zdecydować, które modele użyć dla każdego zapytania, aby osiągnąć równowagę między wydatkami a jakością odpowiedzi.
Badacze wprowadzili koncepcję sieci inferencyjnych - reprezentacji graficznej, gdzie węzły to różne LLMy, a krawędzie określają warunkowe aktywacje modeli. Dla przypadku serii modeli eksperckich o malejącej cenie i rosnącej specjalizacji, sformułowali problem wyszukiwania optymalnej polityki aktywacji. Dowiedli matematycznie, że optymalna strategia ma elegancką strukturę progową: zawsze zacznij od najtańszego modelu, a droższe modele aktywuj tylko wtedy, gdy pewność (confidence) modelu spadnie poniżej określonego progu.
To odkrycie ma znaczenie dla praktyki, gdzie systemy AI coraz częściej używają wielu modeli w ensemble'u lub kaskadowo. Zamiast arbitralnych reguł, firmy mogą teraz opierać się na teoretycznie uzasadnionym podejściu do routowania zapytań między modelami. Takie optymalne strategie mogą znacząco obniżyć koszty wnioskowania bez utraty wydajności, co ma szczególne znaczenie dla dużych systemów obsługujących miliony zapytań.