Badacze zaprezentowali TeachMateGPT - wieloagentowy system wspomagający nauczycieli w tworzeniu zadań egzaminacyjnych z materiałów naukowych. Dotychczasowe systemy RAG-owe miały istotne ograniczenia: opierały się na płaskim pobieraniu informacji, generowały tylko pojedyncze pytania i nie miały mechanizmów ochrony przed słabymi źródłami dowodów.
TeachMateGPT wprowadza cztery kluczowe ulepszenia. Po pierwsze, komponencie COPE zastępuje tradycyjne chunking tekstów hierarchiczną bazą wiedzy opartą na strukturze programu nauczania, łącząc materiały na trzech poziomach szczegółowości za pośrednictwem grafu połączeń. Po drugie, wieloetapowy pipeline agentów zastępuje proste podejście retrieve-then-generate - system najpierw kieruje zapytanie, następnie łączy gęste i leksykalne dowody pod kontrolą bramy pokrycia, która wstrzymuje generowanie w przypadku niewystarczających źródeł. Specjaliści agenci tworzą zadania wielokrotnego wyboru i otwarte.
Trzecim elementem jest SAVER - protokół weryfikacji, który sprawdza wierność, trafność i ryzyko halucynacji dla każdej części pytania, wykorzystując ścisłą kontrolę ugruntowania w źródłach. Ostatecznie badacze stworzyli NCTB-SciGen8 - dataset 198 zadań testowych (143 pytania wielokrotnego wyboru i 55 otwartych) jako benchmark dla systemu. Podejście bezpośrednio angażuje nauczycieli w ewaluację wyników zamiast polegać na automatycznych filtrach, co jest ważne dla zapewnienia jakości w edukacji.