DeepSeek AI wydał DeepSeek-V4.1-Flash, zoptymalizowany model zdolny przetwarzać konteksty do 1 miliona tokenów, specjalnie konstruowany by rozwiązać problem zużycia pamięci w systemach AI działających na długich kontekstach. Model architekturze Mixture-of-Experts zawiera 552 miliarde parametrów w backbone'ie, dodatkowo 196 miliardów Engram parametrów, aktywując 8 miliardów parametrów na token podczas prefill i 16 miliardów podczas decode. Kluczowy wskaźnik to globalny KV cache footprint wynoszący zaledwie 890 bajtów per token - to czterokrotnie mniej niż u DeepSeek-V4-Flash i aż 437 razy mniej niż u DeepSeek-V1.
Zasadniczym innowacją jest zastosowanie architektury Causal Encoder-Decoder, gdzie 40-warstwowy backbone dzieli się na 20-warstwowy encoder i 20-warstwowy decoder. Decoder nie oblicza własnego globalnego KV cache'u, lecz derivuje go z końcowych stanów ukrytych encodera poprzez per-layer projection weights. To rozwiązanie prawie o połowę zmniejsza obliczenia podczas prefill. Dodatkowo model wykorzystuje sliding-window attention z oknem 128 tokenów, a stany decodera rekonstruuje poprzez replay ostatnich 128 tokenów prompt'u w procesie nazywanym Decoder SWA Bounded Replay. Model wdrażalny jest od razu - otwarte wagi dostępne na licencji MIT z pełną integracją w popularnych frameworkach vLLM, SGLang oraz Hugging Face Transformers, a zespół DeepSeek oferuje również publiczne API z różnymi poziomami reasoning.
Ta wersja ma znaczenie dla całego ekosystemu, ponieważ obsługa długich kontekstów była istotnym ograniczeniem w deploymencie zaawansowanych agentów AI. Zmniejszenie zapotrzebowania na pamięć HBM i przepustowość pozwala na bardziej efektywne wykorzystanie sprzętu i niższe koszty operacyjne, co otwiera drzwi dla szerszego zastosowania długotrwałych systemów AI w produkcji. Architektura Causal Encoder-Decoder może również inspirować dalsze projekty optymalizacyjne w branży.