NVIDIA wydała PAIR - wirtualny router inferencji, który automatycznie odkrywa dostępne maszyny w sieci domowej i rozdzieluje niezależne żądania obliczeń między nie. Problem, który rozwiązuje, jest konkretny: multi-agentowe przepływy pracy generują dziesiątki równoczesnych zapytań modelowych. Gdy wszystkie trafiają do jednego silnika na jednej maszynie, powstaje wąskie gardło - kolejki rosną, podczas gdy inne komputery w sieci pozostają bezczynne.
PAIR nie zastępuje istniejących silników inferencji jak Ollama czy LM Studio, lecz działa jako wirtualna warstwa dystrybucji. Kluczowa decyzja projektowa: narzędzie nie wprowadza nowego API ani nie wymaga zmian w kodzie agentów. Zamiast tego proxy-uje kompatybilne interfejsy Ollama i LM Studio, przejmując domyślne porty, którymi już agenty się komunikują. Agenty mogą też mówić z PAIR poprzez endpoints kompatybilne z OpenAI API. Oznacza to, że istniejące oprawy agentów działają bez żadnych modyfikacji - agent decyduje jakie obliczenia potrzebuje, a PAIR decyduje gdzie się wykonają.
Wersja beta 0.1.1 PAIR jest już dostępna do pobrania. Projekt jest open source na licencji Apache 2.0 z podpisanymi instalatorami dla Windows, macOS i Linux. Całość działa wyłącznie w sieci lokalnej, internet potrzebny jest jedynie do pobrania modeli. To praktyczne rozwiązanie dla każdego, kto ma kilka GPU czy komputerów podłączonych do sieci domowej i chce wykorzystać je efektywniej w lokalnych przepływach AI.