Architect Financial Technologies, znana z prowadzenia giełdy terminów AX, właśnie uruchomiła Liquid Inference - system routowania zapytań do modeli LLM oparty na aukcjach w czasie rzeczywistym. Zamiast wybierać jednego dostawcę infrastruktury, każde zapytanie trafia do aukcji, gdzie konkurują wszyscy dostawcy oferujący dany model. Zwycięża najniższa oferta spełniająca kryteria klienta - limity kosztów, czas do pierwszego tokena czy wymagane regiony.

Platforma została zbudowana przez zespół finansistów, a nie badaczy AI. Doświadczenie Architect w tworzeniu dwustronnych rynków finansowych przeniosło się na sektor inferencji. Dla deweloperów integracja jest trywialna - wystarczy zmienić adres URL w kodzie, reszta działa jak zwykły endpoint. W tle system negocjuje najlepszą cenę między potencjalnymi dostawcami GPU, automatycznie blokując maksymalną cenę przed generowaniem odpowiedzi.

To podejście znacząco zmienia ekonomikę LLM w produkcji. Zamiast długoterminowych kontraktów z jednym dostawcą, firmy mogą płacić konkurencyjne ceny, a dostawcy zyskują możliwość szybkiego zysku z wolnych zasobów. Aukcje wprowadzają również transparentność cen na rynku, który dotąd działał na zasadzie sztywnych tabel cennikowych. To szczególnie ważne w momencie, gdy koszty inferencji stają się kluczowym czynnikiem dla startupów AI.