Moonshot AI i zespół kvcache-ai otworzyli kod platformy AgentENV, rozproszonego systemu zaprojektowanego do treningu agentów reinforcement learning w masowej skali. Platform została wypuszczona na licencji MIT i zasilała rozwój Kimi K3, modelu Mixture-of-Experts z 2,8 biliona parametrów od Moonshot.

Hlavna bolączka w treningu agentic RL polega na tym, że modele nie mogą się uczyć tylko na tekście - muszą faktycznie działać wewnątrz rzeczywistych systemów komputerowych. Każdy przebieg treningowy wymaga izolowanego środowiska Linux z pełnym systemem plików, stos sieciowy i uruchomionymi procesami. Tu pojawia się trudny wybór: kontenery startują szybko, ale dzielą kernel hosta, co osłabia izolację przy uruchamianiu kodu wygenerowanego przez model, natomiast pełne maszyny wirtualne zapewniają dobrą izolację, ale startują wolno i zajmują dużo pamięci w stanie bezczynności.

AgentENV rozwiązuje ten problem poprzez użycie mikroVM Firecrackera - każda piaskownica to osobna maszyna wirtualna z własnym jądrem Linux, systemem plików i namespace'em sieciowym. Żądania trafiają do API HTTP Axum, które kieruje je do orkiestratora zarządzającego cyklem życia piaskownic. Kluczowym elementem jest przechowywanie: rootfs jest serwowany przez urządzenie blokowe ublk w space użytkownika wspierane warstwowymi obrazami overlaybd. Warstwy bazowe tylko do odczytu są wspólne dla wszystkich piaskownic, a każda piaskownica pisze do własnej górnej warstwy. To podejście sprawia, że idle, restart i rozgałęzienia są na tyle tanie, że można je uruchamiać w skali treningowej.