Adaption Labs oficjalnie uruchomiła Invent a Dataset - funkcję zdolną do tworzenia strukturalnych, gotowych do trenowania zbiorów danych wyłącznie na podstawie opisu zachowania, które model ma się nauczyć. W przeciwieństwie do tradycyjnych podejść, nie wymaga ona ani istniejącego zbioru danych do pracy, ani predefiniowanego schematu, ani przewodnika do etykietowania.
Narzędzie jest już dostępne w aplikacji Adaption oraz poprzez Python SDK i REST API. Wygenerowane dane można pobierać w formatach JSONL, JSON, CSV lub Parquet - stanowiąc przenośne pliki, którymi możesz dysponować i których możesz użyć do trenowania wszędzie. Sama generacja działa na hostowanej platformie Adaption i wymaga wydatkowania kredytów, bez dostępnej ścieżki self-hostingu.
Tradycyjne przepływy pracy dataset'owe zazwyczaj zaczynają się od danych, które już istnieją. Zespoły poświęcają wtedy tygodnie na etykietowanie, filtrowanie i przeorganizowanie danych, aby przybliżyć je do pożądanego zadania. Problem w tym, że jakość modelu nigdy nie może być wyższa niż dopasowanie dostępnych danych do intencjonowanego zachowania. Dla specjalistycznych i proprietarnych zadań, sygnały o wartości zazwyczaj czyhają w systemach wewnętrznych, niestrukturalizowanym tekście czy logach workflow'ów - i rzadko konwertują się gładko w skoncentrowany zbiór treningowy. Invent a Dataset atakuje ten problem na wcześniejszym etapie - bezpośrednio na poziomie opisanego zachowania, zanim jeszcze pojawia się pytanie o schemat czy rozkład danych.