Naukowcy z obszaru AI opracowali GxP-Agent - system oparty na agentach LLM, który rozwiązuje krytyczny problem w programowaniu badań klinicznych, a mianowicie transformację protokołów badań w zestawy danych gotowe do analizy zgodnie ze standardami CDISC. Problem jest ogromny: wszystkie próby używające pięciu czołowych modeli w pojedynczych próbach nie powiodły się, żaden nie wygenerował poprawnie zestawu danych.
Klucz do sukcesu GxP-Agent leży w strukturze zaproponowanej przez zespół - zamiast powierzać całe zadanie jednemu agentowi, system koduje regularną procedurę procesową jako skierowany graf acykliczny (DAG) z 15 specjalistycznymi węzłami. Każdy węzeł wykonuje konkretne zadanie w odpowiedniej kolejności, ma dostęp do kontekstu domeny (pharmaverse), zawiera walidację i może automatycznie ponawiać próby w razie potrzeby. Na nowym benchmarku CDISC-Bench zbudowanym z prawdziwego przesyłania FDA (254 pacjentów, 49 zmiennych), Claude Sonnet 4.6 osiągnął 100% poprawności strukturalnej na trzech niezależnych przebiegach, podczas gdy najlepszy baseline oparty na retrieval-augmentation osiągnął zaledwie 59.2%, a wszystkie podejścia jednowarstwowe 0%.
Szczególnie istotne jest to, że topologia DAG umożliwia działanie słabszym modelom - GPT-4.1 uzyskał 59.2% poprawności w ramach tego architekturального systemu, gdzie w każdej innej konfiguracji otrzymywał 0%. Podejście uogólnia się również na inne zadania, na przykład obsługę zdarzeń niepożądanych (ADAE) z 9-węzłowym grafem i 1191 rekordami, osiągając 100% już przy pierwszej próbie. Wyniki wskazują, że kodowanie wiedzy procesowej jako struktury grafu okazuje się być znacznie bardziej efektywne niż poleganie wyłącznie na zdolnościach generowania kodu przez LLM-y.