Microsoft udostępnił TauGrid - open-sourcową platformę do uruchamiania obciążeń AI na Kubernetes, która łączy pięć narzędzi zwykle instalowanych osobno przez zespoły platformy. Do tej pory tim musiał ręcznie integrować system queueing, rozproszoną runtime, kontrole zdrowotności GPU, dashboardy i skrypty submisji. TauGrid zwalnia z tego brendu - wszystko pochodzi z jednej instalacji Helm.

Architektura platformy wyraźnie dzieli odpowiedzialność między zespołami. Platform teams zarządzają workspace'ami, kolejkami zadań, profilem compute, storage, identity i obserwowalnością. Naukowcy pracują z repozytorium i CLI, mogąc submitować workloady bez bezpośredniego konfigurowania Kubernetes. Wewnętrznie TauGrid kombinuje CLI tau, queueing przez Kueue, orchestrację Ray poprzez KubeRay, health checks GPU na poziomie węzła i obserwowalność klastra. Codebase pisany jest głównie w Go.

TauGrid jest dostępny na licencji MIT z obrazami kontenerów i chartami Helma publikowanymi jako publiczne artefakty OCI na Microsoft Container Registry. Wymagania to klaster Kubernetes 1.30+, GPU nodes, kubectl i Helm 3.0 lub nowszy. To rozwiązanie może znacząco uprościć deployment obciążeń AI dla zespołów, które dotąd samodzielnie budowały takie stosy lub korzystały z rozproszonych narzędzi.