Razvoj jezikovnih modelov v vseh jezikih EU
Ali Levlog/Pexels
Datum objave:
Univerza v Ljubljani sodeluje v evropskem projektu LLMs4EU (Large Language Models for the European Union), katerega cilj je razviti velike jezikovne modele za vse uradne jezike Evropske unije, tudi za jezike z manj digitalnimi viri, kot je slovenščina.
Projekt združuje 69 partnerjev iz 20 evropskih držav pod koordinacijo Zavezništva za jezikovne tehnologije (Alliance for Language Technologies – ALT-EDIC). Njegov namen je okrepiti evropski ekosistem umetne inteligence z razvojem odprtih, zanesljivih in evropskim potrebam prilagojenih jezikovnih modelov.
Poseben poudarek je namenjen razvoju rešitev za pet področij: znanost, javne storitve, turizem, telekomunikacije in energetika. Cilj je omogočiti uporabo generativne umetne inteligence tudi organizacijam, ki nimajo zmogljivosti za razvoj lastnih modelov, zlasti malim in srednje velikim podjetjem ter javnim ustanovam.
Na Univerzi v Ljubljani v projektu sodeluje Laboratorij za podatkovne tehnologije Fakultete za računalništvo in informatiko pod vodstvom izr. prof. dr. Slavka Žitnika. Skupina vodi razvoj iskalnika po katalogu jezikovnotehnoloških orodij in modelov, ki bo uporabnikom omogočal iskanje najprimernejših rešitev glede na jezik, področje uporabe, naloge, licence in druge značilnosti.
Raziskovalci Univerze v Ljubljani sodelujejo tudi pri razvoju kataloga, ki bo omogočal dodajanje novih modelov in njihove dokumentacije, ter pri vzpostavitvi evropske mreže centrov za vrednotenje jezikovnih modelov. V njej bodo modele preverjali z vidika zmogljivosti, robustnosti, varnosti, kibernetske varnosti in skladnosti z evropsko zakonodajo ter človeškimi vrednotami.
Projekt hkrati razvija infrastrukturo za zbiranje in izmenjavo jezikovnih podatkov ter pripravlja smernice za skladnost z Aktom o umetni inteligenci (AI Act), Splošno uredbo o varstvu podatkov (GDPR) in pravili intelektualne lastnine. S tem želi zagotoviti dolgoročno in zaupanja vredno uporabo evropskih jezikovnih modelov.
V projektu sodeluje šest slovenskih partnerjev: Univerza v Ljubljani, Institut »Jožef Stefan«, Arctur, Event Registry, Telekom Slovenije in XLAB. Sodelovanje potrjuje močno vpetost slovenskega raziskovalnega in tehnološkega prostora v razvoj evropskih jezikovnih tehnologij.
Za slovenščino projekt pomeni pomemben korak k razvoju kakovostnejših jezikovnih modelov in boljši podpori umetne inteligence v slovenskem jeziku.
Več informacij o projektu je na voljo na spletni strani projekta.