NVIDIA opublikowała NeMo Data Designer (NDD), otwartoźródłowy framework do wielomodalnego syntetycznego generowania danych, który ma uprościć iteracyjny proces tworzenia zbiorów treningowych. Framework wykorzystuje intuicyjny, deklaratywny format konfiguracji, gdzie użytkownicy mogą definiować kolumny datasetów, określając ich typy - od tekstu i kodu po obrazy, embeddingi i próbkowniki statystyczne sterujące różnorodnością generowanych danych.

Klucową cechą NDD jest wbudowana pętla preview-and-revision, która zmienia tworzenie danych syntetycznych z jednorazowego procesu na iteracyjny workflow. Użytkownicy mogą wygenerować małą próbkę rekordów, przeanalizować jakość, ulepszyć specyfikację i ponownie uruchomić generację na pełną skalę. Architektura frameworka automatycznie obsługuje zależności między kolumnami, planuje żądania do modeli i obsługuje ponawianie nieudanych połączeń. Konfiguracja jest przejrzystym artefaktem wspierającym udostępnianie workflowów i odtwarzalność badań.

Framework rozszerza się za pomocą elastycznego systemu wtyczek, umożliwiającego dodawanie nowych typów kolumn i funkcjonalności. NDD znalazł już zastosowanie w rozwoju modelu Nemotron firmy NVIDIA oraz w produkcyjnych wdrożeniach dla dużych przedsiębiorstw, co wskazuje na praktyczną wartość narzędzia w rzeczywistych scenariuszach generowania danych dla zaawansowanych modeli AI.