PayPal znalazł sposób na znaczne przyspieszenie działania swoich agentów sztucznej inteligencji obsługujących transakcje handlowe. Badanie pokazuje, że technika speculative decoding w połączeniu z modelem EAGLE3 oraz dostrojonym modelem Nemotron pozwala wyraźnie przyspieszyć generowanie odpowiedzi, nie pogarszając ich jakości.
Speculative decoding to stosunkowo nowa metoda optymalizacji, która działa na zasadzie równoległego przetwarzania - mniejszy, szybszy model tworzy przewidywane tokeny, a większy model główny weryfikuje ich poprawność. Zamiast czekać aż model pełny wygeneruje każdy token jeden po drugim, system może przeskakiwać fragmenty tekstu i znacznie skrócić czas odpowiedzi. PayPal zastosował to podejście do swojego agenta handlowego, integrując je z dostrojonym modelem Nemotron, który specjalizuje się w obsłudze złożonych pytań biznesowych związanych z płatnościami i transakcjami e-commerce.
Rozwiązanie ma praktyczne znaczenie - szybsze agenty AI mogą obsługać więcej klientów jednocześnie, redukując opóźnienia w komunikacji i poprawiając doświadczenie użytkownika. W sektorze płatności elektronicznych, gdzie każda sekunda liczy się dla zadowolenia kupujących i sprzedawców, tego typu optymalizacje mogą bezpośrednio wpłynąć na konkurencyjność platformy. Badanie PayPalu demonstruje, że nowoczesne techniki inference'u nie są ograniczone do laboratorium - znajdują praktyczne zastosowanie w systemach obsługujących codziennie miliony transakcji.