Simon Willeson wydał llm-chat-completions-server 0.1a0, wtyczkę do narzędzia LLM, która pozwala na obsługę OpenAI Chat Completions API dla lokalnych modeli. Serwer można uruchomić komendą llm chat-completions-server -p 9001, co uruchamia endpoint na porcie 9001 obsługujący wszystkie zainstalowane modele LLM, na przykład qwen3.5-4b.
Klucz do rozwiązania leży w nowej architekturze zawartościowo-adresowanych logów wprowadzonej w LLM 0.32rc1. Gdy klient wysyła kolejne requesty w konwersacji, każda wiadomość rozszerza poprzednią - system może się stać nieefektywny ze względu na rosnący rozmiar payloadu. Nowy schemat deduplikuje te wiadomości za pomocą hashów poszczególnych części, co zmniejsza redundancję i poprawia wydajność.
Wtyczkę napisał model GPT-5.6 Sol, który doskonale zna specyfikację OpenAI Chat Completions API. Narzędzie jest idealne dla deweloperów, którzy chcą testować modele open-source z aplikacjami zaprojektowanymi dla OpenAI, bez zmian w kodzie klienckim - wystarczy zmienić endpoint URL.