Naukowcy z arXiv zaprezentowali Synthesis Through Simulation, podejście do generowania syntetycznych danych dla systemów korporacyjnych, które rozwiązuje kluczowy problem w rozwoju agentów AI do obsługi skomplikowanych zadań biznesowych. Problem polega na tym, że trenowanie i ewaluacja takich agentów wymaga dostępu do rzeczywistych baz danych, schematów i systemów, co jest niemożliwe ze względu na ograniczenia bezpieczeństwa, prywatności i przepisy prawne obowiązujące w przedsiębiorstwach. Poprzednie podejścia - synteza tabelaryczna lub procedury domenowe - miały fatalne słabości: pierwsze nie mogły zagwarantować strukturalnej ważności danych, drugie natomiast nie reprodukowały rozkładów danych zbliżonych do rzeczywistych bez ręcznego dostosowania do każdej domeny.
STS zmienia tę dynamikę poprzez wykorzystanie agentów LLM, które generują dane wykonując operacje w symulowanych środowiskach korporacyjnych z wbudowanymi politykami walidacji. Ponieważ data jest tworzona poprzez to samo środowisko, które definiuje co jest ważne, system automatycznie gwarantuje strukturalną poprawność danych bez konieczności dostępu do rzeczywistych schematów. Generalist Populator, agent domenowo-agnostyczny, pokazał imponujące wyniki: 0,88 średniej wierności rozkładu marginalnego i 100 procent spełnienia ograniczeń na wszystkich dziesięciu środowiskach testowych. Dla porównania, tradycyjne syntezatory statystyczne nie mogą działać w siedmiu z tych środowisk z braku wymaganych danych startowych, a agenci z dostępem do schematów zawodzą w 82 procentach prób na środowisku linii lotniczych.
To podejście ma potencjał do dramatycznego przyspieszenia rozwoju korporacyjnych narzędzi AI poprzez umożliwienie trenerów i ewaluatorów pracowania na realistycznych, ale całkowicie syntetycznych danych, bez ryzyka naruszenia bezpieczeństwa lub prywatności. Metoda jest szczególnie wartościowa dla przedsiębiorstw, które nie mogą dzielić swoimi prawdziwymi systemami z badaczami ani dostawcami oprogramowania.