NVIDIA Cosmos3-DROID to obszerny zbiór danych robotycznych liczący 707 GB, który dotychczas wymagał całkowitego pobrania na dysk twardy. Nowe podejście zmienia tę realność poprzez streaming - system odczytuje dane selektywnie z chmury za pomocą HTTP byte-range requests i biblioteki PyArrow, pobierając tylko konkretne fragmenty Parquet potrzebne do treningu.
Architektura pipeline'u wykorzystuje strukturę LeRobotDataset v3.0, gdzie najpierw analizuje metadane z info.json oraz tabelach epizodów, a następnie konwertuje je na trajektorie stan-akcja. System dekoduje wideo używając PyAV/FFmpeg z seek-based access, co oznacza, że odtwarza tylko wybrane klatki zamiast całych plików. Obserwacje i akcje są normalizowane przy użyciu statystyk zbioru danych, a następnie konstruowany jest chunked PyTorch dataset zgodny ze stylem architekury ACT (Action Chunking Transformers) z opcjonalnym visual conditioning.
Wykorzystanie tego podejścia pozwala trenerom na natychmiastowe pracę z danymi Cosmos3-DROID bez czekania na wielogodzinne pobierania czy rezerwowania dużych zasobów dyskowych. Trening zachodzi w trybie multimodalnego behavior cloning, gdzie model uczy się kopiować działania robotów z wideo. Ewaluacja odbywa się poprzez open-loop rollout z temporalnie ensemblowanymi action chunks, a metryki obejmują mean squared error per-joint i współczynnik R2. To znacznie demokratyzuje dostęp do zaawansowanego szkolenia robotów dla zespołów bez gigantycznej infrastruktury.