Naukowcy udostępnili SCAFFOLD, obszerny dataset informatycznych diagramów z pytaniami i odpowiedziami w formacie Chain-of-Thought. Zbiór danych zawiera 157,387 par pytań i odpowiedzi rozprowadzonych na 29,887 figur z 3,058 prac arXiv, wraz z napisami, kontekstem, pytaniami i step-by-step uzasadnieniami. Powstał z wykorzystaniem automatycznego wykrywania layoutu, parsowania PDF oraz generowania pytań wspieranego przez AI.
Problem, który rozwiązuje SCAFFOLD, jest fundamentalny: prace informatyczne rely'ują na diagramach - architekturach, schemach systemów i pipeline'ach - które zawierają więcej informacji niż tekstowe otoczenie. Dotychczas nie istniał publiczny dataset specjalnie przygotowany do trenowania modeli vision-language na rozumieniu tego typu figur. SCAFFOLD wypełnia tę lukę, oferując structured tuples łączące obraz, tekst, pytania i Chain-of-Thought reasoning traces.
Dataset dostępny jest w trzech wersjach: SCAFFOLD-157K (pełna wersja), SCAFFOLD-37K (średnia) i SCAFFOLD-12K (mała), którą badacze użyli do testów baseline na modelu Qwen2.5-VL-3B-Instruct. To może znacząco zmienić zdolność AI do analizy wizualizacji technicznych, od architektur systemów po flowcharty, co ma potencjał dla automatyzacji rozumienia papers i dokumentacji inżynierskiej.