Together AI zaprezentowała ThunderAgent, program-aware scheduler dedykowany do inferencji agentu, który osiąga ponad dwukrotne przyspieszenie przetwarzania na poziomie pojedynczego węzła. Kluczowa innowacja polega na traktowaniu każdego przepływu pracy agenta jako schedulo walnego programu, co pozwala na eliminację KV cache thrashing - problemu powodującego nieefektywne wykorzystanie pamięci podręcznej.
ThunderAgent wprowadza inteligentne zarządzanie zasobami poprzez optymalizację sposobu, w jaki przepływy pracy agenta są wykonywane na sprzęcie. Rozwiązanie zapewnia niemal liniowe skalowanie na architekturach wielowęzłowych, co oznacza, że dodanie kolejnych węzłów przynosi proporcjonalny wzrost wydajności. Dla organizacji pracujących nad generowaniem syntetycznych danych na dużą skalę - takich jak laboratorium AI szkolące własne modele lub platformy budujące datasety - oznacza to znaczne zmniejszenie czasu przetwarzania i kosztów infrastruktury.
Rozwiązanie ma szczególne znaczenie w kontekście rosnącego zapotrzebowania na dane syntetyczne wysokiej jakości. W miarę jak więcej firm eksperymentuje z modelami agentu do automatyzacji złożonych zadań, bottleneckami stają się wydajność inferencji i koszt infrastruktury. ThunderAgent bezpośrednio atakuje oba problemy poprzez optymalizację wykorzystania zasobów, potencjalnie otwierając nowe możliwości dla bardziej zaawansowanych i bardziej skalowanych systemów agentu.