DeepSeek wypublikował ulepszony model DeepSeek-V4-Flash-0731 wraz z publiczną betą API, licencjonując go MIT bez ograniczeń dostępu. Aktualizacja z 31 lipca 2026 roku skupia się na polepszeniu możliwości agentycznych i kodowania poprzez re-post-training, bez zmian w samej architekturze modelu. Checkpoint zawiera moduł speculative decoding DSpark, co daje łącznie 304B parametrów w repozytorium, przy czym bazowy model to 284B parametrów.

Model okazuje się dostępny w dwóch wariantach wdrażania. Przez API DeepSeek koszty wynoszą 0,14 USD za milion tokenów input przy cachemisie, 0,0028 USD z cache'em i 0,28 USD za milion tokenów output - to około trzecia ceny V4-Pro. Ograniczenie to pozwala startupom, niezależnym deweloperom i platformom wewnętrznym uruchamiać pętle agentów bez wydatków na sprzęt GPU. Z drugiej strony self-hosting wymaga znacznie więcej zasobów - model trzeba utrzymywać całkowicie w pamięci GPU mimo że aktywuje się tylko 13B parametrów na token. DeepSeek pokazuje wdrażanie na pojedynczym węźle 4xGB300, a wersje skwantyzowane przez Unsloth wymagają 162 GB dla 8-bitowego builda.

Nowy moduł natively wspiera format Responses API i jest zoptymalizowany dla Codexa, co otwiera nowe możliwości dla aplikacji wymagających efektywnego kodowania i wdrażania agentów. Ceną i dostępnością model pozycjonuje się jako praktyczna alternatywa dla zespołów szukających taniego wdrożenia mocnych modeli do produkcji.