Zespół AWS opisuje produkcyjny system do trenowania modeli ML w warunkach manufacturing, który przez trzy lata obsługiwał ponad 40 tysięcy zadań treningowych. Architektura łączy Amazon ECS z GPU capacity providerami na EC2, komunikację opartą na SQS z dead-letter queueami oraz Lambda dispatcher z kontrolą dostępu, który egzekwuje limity współbieżności klastra. Orkiestrator Conductor na ECS Fargate inicjuje łańcuchy retrainingu uwzględniające zależności na bazie harmonogramu tygodniowego.

Klucz do sukcesu leży w event-driven podejściu - zamiast stałego trenowania modele uaktualniane są na żądanie, kiedy dane produkcyjne tego wymagają. System trenuje pary modeli: sieć predykującą zachowanie fizyczne i policy do sterowania procesami. Cała infrastruktura kodyfikowana jest modularnie w Terraformie z rozdzieleniem na wiele kont AWS, co ułatwia zarządzanie i skalowanie.

Rezultaty są imponujące: osiem lat GPU zawsze włączonego zastąpiono bieżącym systemem z redukcją kosztów o 72-78 procent, czyli zdecydowanie bardziej efektywnym niż tradycyjny model. Symulacja dyskretnych zdarzeń wykazała, że naiwna dystrybucja zadań traciłaby 65 procent jobów bez admission control, a wdrożony system dorównywa latencji AWS Step Functions eliminując jednocześnie overhead startowy per-job. Zespół udostępnił symulator i szablony Terraform jako open source.