Google i partnerskie uniwersytety opracowały ToolGrad, metodę, która zmienia podejście do generowania danych treningowych dla modeli obsługujących zewnętrzne narzędzia i API. Zamiast tradycyjnego procesu - najpierw napisz pytanie użytkownika, potem szukaj łańcucha operacji, który je spełni - ToolGrad odwraca tę kolejność i buduje najpierw pewny, działający łańcuch poprzez rzeczywiste wykonanie API, a dopiero później generuje do niego pasujące zapytanie.
Tradycyjne podejścia takie jak ToolBench i ToolACE cierpiały na wiele problemów. System próbował wymyślić realistyczne instrukcje użytkownika, a następnie szukał tool-use path za pomocą agent exploration. Taki proces częsty kończyć się fiaskiem - agent wpadał w ślepą uliczkę, a zasoby obliczeniowe zużyte na poszukiwania były zmarnowane. ToolGrad eliminuje ten problem od podstaw: najpierw wykonuje rzeczywiste API w sprawdzonym porządku, a następnie annotuje tę pracującą sekwencję odpowiadającą jej naturalnym pytaniem.
Wyniki są imponujące. Modele Gemma-3 (w wersjach 1B, 4B i 12B) fine-tunowane na zaledwie 500 próbkach z danych wygenerowanych przez ToolGrad osiągają wyniki na Berkeley Function Calling Leaderboard porównywalne z własnościowymi modelami granicy technologicznej. Żadna z metod nie wymaga ręcznego dodawania danych. Cała solucja jest dostępna: kod na licencji Apache-2.0, dataset ToolGrad-500 i modele na platformie Hugging Face, plus pakiet na PyPI, co czyni to rozwiązanie praktycznie wdrażalnym.