Ewaluacja wykazała potencjał praktyczny: na 2600 pojedynczych żądań system wybrał prawidłową funkcję w 98,79% przypadków, na 200 scenariuszach syntetycznych obejmujących wszystkie cztery fazy ukończył 96,50% workflow'ów, a na 120 rzeczywistych instancejach z 60 anonimowych pacjentów osiągnął 96,67% powodzenia. Testowanie pokazało, że zachowanie longitudinalnego stanu (historii) jest krytyczne - jego usunięcie spadło efektywność z 96,50% do 84,00%, podczas gdy wyłączenie walidacji schematu zwiększyło błędy routingu na backend z 0% do 95,28%. To sugeruje, że przyszłe agentic frameworki w medycynie muszą mieć solidne systemy do śledzenia kontekstu i weryfikacji integralności danych.