Przepisy są przechowywane głównie w formie wolnych tekstów, które łatwo czytać dla człowieka, ale trudno analizować komputerowo. Zespół naukowców z IIIT Delhi postanowił to zmienić, tworząc RecipeDB2 - jeden z największych strukturalnych zbiorów przepisów na świecie. Baza zawiera 128 942 przepisów pochodzących z 32 regionów i 99 krajów, z ponad 35 tysiącami unikalnymi składnikami.

Strukturyzacja przepisów odbyła się na kilku poziomach. Najpierw model transformerowy oparty na architekturze do ekstrakcji bytów nazwanych rozłożył każdy przepis na siedem culinarnych atrybutów składników. Następnie algorytm BERT embedding powiązał składniki z bazą żywieniową USDA, osiągając imponujące 87,90 proc. F1 score na ręcznie zweryfikowanym zbiorze 200 najczęstszych składników. Każdy zmapowany składnik ma teraz dostęp do 148 parametrów żywieniowych. Klasyfikator Random Forest rozpropagował 34 kategorie składników na całą bazę, a konserwatywny zestaw reguł przypisał każdemu przepisowi styl diety.

RecipeDB2 otwiera nowe możliwości dla badaczy zajmujących się zdrowiem, antropologią kulinarną i sztuczną inteligencją. Baza umożliwia analitykę na skalę globalną - od porównywania nutritywnych profili regionów i krajów, poprzez odkrywanie uniwersalnych kombinacji składników, aż po personalizowane rekomendacje dań. Projekt demonstruje, jak NLP i machine learning mogą transformować nieustrukturyzowane dane tekstowe w wysoko organizowane zasoby naukowe, przydatne zarówno w aplikacjach konsumenckich, jak i badaniach akademickich.