Liquid AI opublikowała Pipette, platformę benchmarkingową, której celem jest zmierzyć rzeczywistą wydajność modeli AI działających na urządzeniach mobilnych i brzegowych. Problem jest prosty - karty modeli pokazują jakość pod warunkami serwera pełnej precyzji, ale liczby te rzadko przewidują jak ten sam model będzie się zachowywać na smartfonie. Pipette zmienia to podejście traktując wydajność na urządzeniu jako własność całego wdrożonego systemu, a nie izolowanego modelu.

Jadrowy pomysł Pipette to jednostka pomiaru obejmująca pełną konfigurację - model plus kwantyzacja plus runtime plus urządzenie. Wstępny zbiór danych zawiera pięć metryk wydajności na urządzeniu dla ponad 1000 kombinacji obejmujących 30+ modeli, budynków llama.cpp dla macOS, iOS, Windows i Android oraz długości kontekstu od 256 do 8192 tokenów. Testy prowadzono na MacBooku Pro M5 Max, iPhone'ie 17 Pro i Galaxy S26 Ultra. Konkretny przykład pokazujący znaczenie tego podejścia - dwa modele 350M przy tej samej kwantyzacji na tym samym telefonie zachowują 78,4% i 33,8% przepustowości dekodowania przy 4096 tokenach. To drastyczna różnica mimo identycznych warunków.

Platforma jest w pełni dostępna - udostępniona jako licencja Apache 2.0 z infrastrukturą (pipette-mgmt, pipette-clients, pipette-scores), publiczny zbiór wyników, hostowany dashboard oraz natywne aplikacje benchmarkowe dla iOS i Android. Nie ma list oczekujących. Narzędzie kierowane jest do firm wdrażających modele na hardware'ze, który nie jest ich własnością - od solo developerów i startupów na etapie seed mogących korzystać z dashboardu, aż po większe zespoły.