Społeczności deweloperów udało się opublikować w pełni lokalnie działający model 1B o nazwie MiniCPM5-1B-Claude-Opus-Fable5-Thinking. Deweloper GnLOLot udostępnił GGUF-owe buildy kompatybilne z llama.cpp, eliminując potrzebę klucza API i jakichkolwiek zapytań do chmury. Model zajmuje zaledwie 657MB.
Podstawą jest dokumentowany release OpenBMB o nazwie MiniCPM5-1B - gęsty model z 1,08 miliarda parametrów oparty na architekturze LlamaForCausalLM. Posiada 24 warstwy, mechanizm grouped-query attention i obsługuje kontekst do 131 tysięcy tokenów. Co istotne, bazowy model zawiera natywny template do reasoning, który może być kontrolowany parametrem enable_thinking, oferując zarówno tryb myślący, jak i bezpośredniej odpowiedzi.
Zawarte na modelu ulepszenia pochodzą z procesu fine-tuningu na danych Fable 5, co miało na celu poprawę umiejętności kodowania i podążania za instrukcjami. Metoda nie jest klasyczną destylacją - zamiast zmniejszania oryginalnego modelu, deweloper wygenerował rozmowy z modelem nauczycielem (Claude), przechwytując jego odpowiedzi i ślady rozumowania jako tekst, a następnie przeprowadził supervised fine-tuning mniejszej bazy na tych śladach. Takie podejście jest kluczowe dla precyzji, choć nie stanowi dostępu do samych wag lub logitów oryginalnego modelu.