Naukowcy opracowali HSS-Synth, pierwszy pipeline specjalizujący się w syntezie danych dla nauk humanistycznych i społecznych, będący odpowiedzią na długoistniący brak wysokiej jakości danych treningowych dla LLM-ów w tych dziedzinach. Nowe podejście definiuje system 14 głównych dziedzin HSS i przechodzi od poprzednich fragmentarycznych prób ku holistycznemu, zorientowanemu na domenę podejściu.
System działa w trzech fazach. Najpierw konstruuje dokumenty bazowe z korpusów internetowych za pomocą wieloetapowego filtrowania i czyszczenia tekstu weryfikowanego przez судзę. Następnie wykorzystuje "requirements + persona" do backtranslacji tych dokumentów w zróżnicowane, lecz wiernie odtwarzające instrukcje, z ścisłą kontrolą wyrównania pytań i odpowiedzi. Kluczową innowacją jest teacher-forced answering, który podsuwa modelowi dokumenty źródłowe podczas generowania odpowiedzi, co zakotwicza semantykę, zmniejsza halucynacje i zachowuje ton oraz integralność treści.
Uzysk to 237 tys. wysokiej jakości próbek do instruction-tuningu, które przewyższają 14 wiodących rozwiązań bazowych na 16 benchmarkach. Model Qwen3-8B-Base fine-tuned na tych danych ustawia nowy stan wiedzy (SOTA) i zbliża się do wydanej oficjalnie wersji Qwen3-8B, jednocześnie poprawiając zarówno preferencje człowieka jak i umiejętności wiedzy bez typowych spadków wydajności. Autorzy udostępnili kod na GitHubie, co otwiera drogę do zastosowania metody w innych domenach.