Agent produkcyjny musi szybko odkryć i wybrać najbardziej odpowiednią umiejętność z rosnącej biblioteki dostępnych narzędzi i workflow'ów. Zespół badawczy przeanalizował, jak multimodalny agent wideo Tinycloud reprezentuje swoje umiejętności w systemowym prompcie dla planera LLM. Harness operuje dwoma typami umiejętności: tool-skills opakowujące pojedyncze zewnętrzne API i workflow-skills aranżujące sekwencje tool-skills z szablonami renderującymi gotowe rezultaty. Eksponuje je poprzez dwa kanały w prompcie - pełne instrukcje dla autoładowanych umiejętności oraz jednolinijkowe listy dla umiejętności na żądanie.
Ablacyjny eksperyment obejmujący sześć zadań w trzech wariantach exponowania (wszystkie włączone, domyślnie, wszystkie wyłączone) ujawnił znaczące różnice w wydajności. Wariant z pełnym autoładowaniem umiejętności wybierał prawidłowe narzędzie w każdym zadaniu, konfiguracja wszystkie-wyłączone spowalniała wykonanie i prowadziła do całkowitych awarii odkrywania, zaś domyślna konfiguracja produkcyjna błędnie kierowała jedno zadanie. Błąd wynikał z kolizji sygnałów leksykalnych - autoładowana tool-skill odciągała uwagę planera od workflow-skill'u na liście.
Głównym wnioskiem badania jest to, że sposób exponowania umiejętności bezpośrednio w prompcie ma krytyczne znaczenie dla precyzji routingu, zwłaszcza na małą skalę gdzie LLM wybiera bez jawnego embedingu-based retrieval. Wyniki sugerują, że organizacja informacji w prompcie może być lepszym czynnikiem niż zaawansowane techniki wyszukiwania, gdy biblioteka umiejętności mieści się w oknie kontekstowym modelu.