TutlAit v1 to pierwszy kompleksowy, otwarty zbiór danych mowy dla marokańskiego tamazyghu z transkrypcjami w arabskim i informacjami o regionalnych odmianach akcentu. Projekt wykorzystał specjalnie zaprojektowaną aplikację webową (React 18, Django 5 z Django REST Framework, PostgreSQL) do zebrania materiałów od natywnych użytkowników language. Volontariusze zarejestrowali się poprzez kampanie na LinkedInie i Instagramie, zdeklarowali swoją odmianę regionalną i dane demograficzne, a następnie wnieśli wkład przez dwa scenariusze: Text-to-Audio, gdzie osoba nagrywała marokańskie wysłowienie arabskiego zdania, oraz Audio-to-Text, gdzie transkrybowała arabski odpowiednik fragmentu tamazyghu.
Zbiór danych został uzupełniony materiałem z publicznie dostępnych mediów audiowizualnych tamazyghu, podzielonych na segmenty i opatrzonych adnotacjami za pomocą narzędzia ELAN. Każde nagranie poddawane jest konwersji serwera na 16kHz mono WAV, haszowaniu SHA-256 w celu eliminacji duplikatów i zatwierdzeniu przez administratora. To ważne dlatego, że tamazyghu, pomimo statusu języka oficjalnego Maroka, pozostał drastycznie niedofinansowany w technologiach mowy - dostępne publicznie oznaczone nagrania były rzadkie, brakowało informacji o odmianach regionalnych, a jakość transkrypcji była nierówna. Zbiór danych otwiera możliwości dla badań nad rozpoznawaniem mowy, синтезą mowy i innymi zadaniami NLP dla tego zaniedbanych języka.