Crida als parlants d’aranès per a ensenyar la llengua a la intel·ligència artificial

El Consell General d’Aran ha fet una crida als parlants d’aranès perquè enregistrin la seva veu i contribueixin a desenvolupar eines d’intel·ligència artificial capaces d’entendre i parlar la llengua. La iniciativa forma part del projecte LINGUATEC-IA i té per objectiu crear un sistema de reconeixement automàtic de la parla i, posteriorment, un sintetitzador de veu en aranès.
Per desenvolupar un primer model calen, pel cap baix, 175 hores d’àudio transcrit amb una gran diversitat de parlants. Ara com ara, solament se’n disposa de vuit, enregistrades durant la marató de veus en aranès organitzada l’any 2022. Per tant, encara en falten 167.
El govern aranès cerca persones amb maneres de parlar diverses i remarca que no cal que l’aranès sigui la seva llengua materna. L’objectiu és que el sistema pugui reconèixer tanta varietat lingüística com sigui possible.
Diversitat d’edats, gèneres i territoris
Per evitar que el model depengui excessivament d’un nombre reduït de veus, cap participant no podrà aportar més d’un 2% o un 3% del total dels enregistraments, és a dir, aproximadament una hora i mitja per persona.
El Consell General també vol aconseguir un equilibri de gènere i d’edats i garantir la presència de parlants dels tres terçons de la Vall d’Aran: Naut Aran, Mijaran i Baish Aran. També es procurarà que hi hagi diversitat de textos i registres. El Departament de Llengua serà l’encarregat de seleccionar els textos que haurà de llegir cada participant.
Els enregistraments es faran en un estudi professional posat a disposició pel Consell General i s’organitzaran en sessions d’una hora, segons la disponibilitat dels participants. l Govern d’Aran desenvolupa el projecte conjuntament amb Lo Congrès permanent dera Lengua occitana, amb la voluntat d’ampliar la presència de l’aranès en les tecnologies digitals i facilitar que les eines basades en intel·ligència artificial puguin incorporar-lo.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.