Problem stanowi nierozwiązywalny do tej pory błąd w mobilnym wnioskaniu LLM: flagowe urządzenia Snapdragon mogą generować tekst lokalnie za darmo i bez opóźnień, lecz przy ciągłym użytkowaniu ulegają przegrzaniu. Granica nie jest tylko spowolnieniem - GPU runtime po prostu się wyłącza lub zaklina po kilku kolejnych zapytaniach. Badacze odkryli, że awaria tkwi w łańcuchu narzędziowym (kompilacja jąder OpenCL i długie operacje prefill na mobilnym GPU) i powtarza się nawet na chłodnym urządzeniu.

HybridInfer rozwiązuje to poprzez routing trzystopniowy, używając uczenia się ze wzmacnianiem trenowanego offline. System obserwuje temperaturę termiczną telefonu i szacuje złożoność zapytania, a następnie decyduje, czy wysłać je na przetwarzanie lokalnie (Llama 3.2 3B), na edge (Llama 3.1 8B z wyszukiwaniem), czy do chmury (GPT-4o). Kluczowym odkryciem jest to, że model nagradzający musi preferować wykonanie lokalne, aby router w ogóle chciał wykorzystywać urządzenie - bez takich bodźców Q-learning zawsze wybierałby chmurę.

W testach na 210 rzeczywistych promptach na Androidzie HybridInfer osiąga znacznie wyższą jakość niż routery nieświadome temperatury. Podejście otwiera możliwość praktycznego wdrożenia hybrydowych systemów AI na mobilnych urządzeniach, gdzie urządzenie pozostaje preferowanym kanałem, ale bez ryzyka awarii sprzętu.