Badacze opracowali TomasuLLM, nowy runtime dla agentów opartych na modelach językowych, który rozwiązuje problem pracy narzędzi zajmujących wiele sekund lub minut. Zamiast czekać, aż agent bezczynnie obserwuje kompilowanie kodu, testy czy długotrwałe operacje na repozytorium, system przewiduje przyszłe działania i uruchamia je spekulacyjnie w izolowanych środowiskach.

Podejście bierze inspirację z procesorów z wykonaniem poza kolejnością - tych, które w CPU mogą pracować nad instrukcjami z przyszłości, gdy obecne są blokowane. TomasuLLM drafty przyszłe akcje agenta, uruchamia je w copy-on-write sandbox-ach (oddzielnych kopiach systemu), śledzi ich zależności i efekty, a następnie zatwierdza wyniki w oryginalnej kolejności dopiero po walidacji wobec popierw zatwierdzonych zmian. Dzięki temu unika błędów wynikających ze spekulacji, która okazała się niedokładna.

Wyniki na trzech benchmarkach pokazują solidne przyspieszenie: 1.31x na 100 zadaniach SWE-bench Verified, 1.35x na 28 zadaniach Terminal-Bench 2.0 oraz 1.27x na 18 sesjach SWE-Marathon. Najważniejsze - w przeanalizowanych 4010 rekordach walidacji zatwierdzenia system nie zaakceptował żadnych fałszywych wyników. To sugeruje, że spekulacja działa niezawodnie i stanowi praktyczne rozwiązanie dla rzeczywistych agentów kodujących, gdzie oczekiwanie na narzędzia było istotnym wąskim gardłem wydajności.