PACE to nowy system oparty na agentach, który automatycznie uczy się konfiguracji ekstrakcji treści dostosowanych do konkretnych wydawców internetowych. Zamiast wybierać między nieskutecznym podejściem ogólnym a drogim korzystaniem z LLM za każdym razem, PACE najpierw analizuje reprezentatywne strony za pomocą modelu, aby zidentyfikować i zapamiętać wzorce ekstrakcji. Następnie te zdobyte wzorce zamienia w szablony deterministyczne, które podczas normalnego użycia działają błyskawicznie i bez dodatkowych kosztów.

Problemy, które rozwiązuje PACE, są rzeczywiste i frustrujące dla zespołów pracujących z danymi dla modeli AI. Generyczne ekstrakcje treści z sieci działają wszechstronnie, ale upadają na twórczych layoutach poszczególnych serwisów. Bezpośrednia ekstrakcja przez LLM daje elastyczność, ale wymaga kosztownych wywołań dla każdej strony. Ręcznie pisane parsery dla konkretnych wydawców osiągają wysoką dokładność, jednak wymagają czasochłonnego inżynierii i konserwacji.

Wyniki eksperymentów pokazują, że PACE radzi sobie lepiej niż skalowalne metody ogólne i osiąga jakość zbliżoną do ręcznie inżynierowanych parserów. System nie tylko wyciąga tekst artykułów, ale także metadane, obrazy i tabele - co ma znaczenie dla pipelineów przygotowujących dane dla LLM. To stanowi przełom w automatyzacji zadań, które dotychczas wymagały manualnego inżyniering dla każdego wydawcy.