Badacze zaprezentowali PERCEPT - pierwszy duży, publicznie dostępny korpus Persian-English code-mixingu z pełną annotacją Universal Dependencies POS tagów. Zbiór zawiera 6800 postów zbieranych z mediów społecznościowych, gdzie użytkownicy naturalnie mieszają oba języki w jednej wypowiedzi.
Dotychczasowe zasoby dla perszczyzny nie posiadały szczegółowych annotacji dla słów w mieszanym kontekście, co hamowało zarówno analizę lingwistyczną jak i rozwój modeli NLP świadomych składni. PERCEPT rozwiązuje ten problem za sprawą innowacyjnego frameworka wspomaganego LLM-ami, który automatycznie przypisuje tagi części mowy i tematy na poziomie dokumentu. Ludzka ewaluacja potwierdziła wysoką zgodność między automatycznymi i złotymi annotacjami, potwierdzając niezawodność danych.
Analizy na PERCEPT ujawniły, że rzeczowniki stanowią dominującą kategorię dla słów mieszanych, natomiast rozkład innych części mowy różni się między platformami. Ciekawym odkryciem jest, że dystrybucja pozycyjna słów code-mixed'owanych pozostaje niezwykle spójna między platformami, co sugeruje systematyczne wzorce w sposobie, w jaki użytkownicy mieszają języki. To pierwsze kompleksowe badanie Persian-English code-mixingu na wielu platformach społecznościowych otwiera nowe perspektywy dla badaczy zajmujących się wielojęzycznym przetwarzaniem naturalnego języka.