Redis udostępnił Redis LangCache, usługę cache'owania semantycznego, która redukuje koszty operacyjne LLM nawet o 90 procent i przyspiesza zwracanie wyników cache'u do 15 razy w stosunku do ponownego odpytania modelu. Usługa znajduje się między aplikacją a modelem, porównując nowe prompty z wcześniej udzielonymi odpowiedziami na podstawie znaczenia, a nie dosłownego tekstu, i zwraca przechowywane odpowiedzi gdy istnieje wystarczająco bliskie dopasowanie.
Problem rozwiązywany przez LangCache jest prosty lecz kosztowny w praktyce - gdy asystenci wsparcia odbierają to samo pytanie sformułowane na różne sposoby, każda wersja tradycyjnie trafia do modelu jako pełne, rozliczane zapytanie. Trzy pytania typu "Czy mogę otrzymać zwrot po zakupie planu miesięcznego?", "Czy abonament miesięczny podlega zwrotowi?" i "Czy mogę anulować plan i odzyskać pieniądze?" dotyczą tego samego problemu, lecz bez cache'owania semantycznego każde z nich generuje kompletne przetworzenie tokenów wejściowych i dekodowanie tokenów wyjściowych. Prefix caching niweluje tylko część tych kosztów, bo ostatecznie zapytanie wciąż trafia do LLM.
LangCache dostępny jest teraz w publicznej wersji zapoznawczej na Redis Cloud, z dostępem przez REST API i SDK dla Pythona oraz JavaScriptu. Redis zastrzega, że funkcje i zachowanie mogą się zmienić w trakcie wersji zapoznawczej. Dla aplikacji support'owych, pipeline'ów RAG i innych systemów przetwarzających tysiące dziennie zapytań z powtarzalnymi intencjami, może to oznaczać drastyczne zmniejszenie wydatków na API modeli.