AnovaX to lokalny asystent głosowy działający wyłącznie na komputerze użytkownika bez wymagania połączenia z chmurą. Projekt łączy bramę do rozpoznawania komend głosowych, potok przetwarzania mowy, planner oparty na modelu Gemini, który generuje plany akcji w formacie JSON, oraz warstwę bezpieczeństwa z białą i czarną listą dostępu.

Architektura opiera się na multi-agent orchestratorze, który tłumaczy każdy plan na specjalistyczne agenty działające na ograniczonej puli wątków. System zawiera dziewięć klas agentów - AppAgent do otwierania aplikacji, TypingAgent do wpisywania tekstu, BrowserAgent do nawigacji i sześć innych specjalistycznych modułów. Każdy agent ma własny timeout, politykę ponawiania i zabezpieczenia dostępu do zasobów. Dodatkowo, rekursywny MetaAgent pozwala plannerowi delegować pod-cele z powrotem do siebie, z limitem na dwa poziomy zagnieżdżenia.

Robustwo systemu zapewnia adaptacyjna pętla odzyskiwania, która przejmuje kontrolę w razie awarii kluczowych kroków, używając kompaktowego promptu w stylu ReAct. Aby zmniejszyć opóźnienia wprowadzane przez Gemini, system spekulacyjnie wykonuje narzędzia tylko do odczytu. Projekt zawiera też Flask server udostępniający interfejs przyjazny dla telefonu przez lokalne WiFi, który w czasie rzeczywistym przesyła zdarzenia cyklu życia agentów i stream ekranu laptopa w MJPEG - użytkownik obserwuje wykonywanie komend zdalnie.