Sztuczna inteligencja od OPI w 9 językach
Rosnąca popularność systemów opartych na generatywnej sztucznej inteligencji, które wykorzystują dane dziedzinowe, powoduje wzrost znaczenia technologii wyszukiwania informacji. Jakość odpowiedzi generowanych przez modele językowe coraz częściej zależy od skuteczności mechanizmów odnajdywania właściwych dokumentów i źródeł wiedzy. Właśnie dlatego AI Lab OPI rozwija zaawansowane modele typu dense retriever, które umożliwiają wyszukiwanie treści na podstawie ich znaczenia, a nie jedynie dopasowania słów kluczowych.
– Nowy model EuroDense, który powstał w naszym instytucie, wspiera dziewięć języków europejskich, są to: polski, angielski, niemiecki, francuski, hiszpański, włoski, portugalski, niderlandzki oraz rosyjski. Model liczy 435 mln parametrów i obsługuje kontekst o długości do 8192 tokenów, co pozwala skutecznie analizować także dłuższe dokumenty – mówi dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji. –W kategorii modeli wielojęzycznych posiadających mniej niż 1 miliard parametrów EuroDense osiągnął najlepsze rezultaty w siedmiu z dziewięciu języków oraz uzyskał najwyższy średni wynik NDCG@10 zarówno w ujęciu językowym, jak i zadaniowym – dodaje szef AI Lab w OPI.
Choć na rynku dostępnych jest wiele zaawansowanych modeli dla języka angielskiego, znacznie mniej rozwiązań oferuje równie wysoką jakość dla pozostałych języków europejskich. EuroDense powstał właśnie po to, aby wypełnić tę lukę. To jednocześnie pierwszy model językowy opracowany w AI Lab, który wykracza poza domenę języka polskiego.
Trening na 200 milionach tekstów
EuroDense został wytrenowany w trzystopniowym procesie obejmującym dwa etapy destylacji wiedzy oraz etap dostrajania modelu.
– Na potrzeby treningu przygotowano wielojęzyczny korpus obejmujący około 200 milionów tekstów. Szczególny nacisk położono na zachowanie wysokiej jakości reprezentacji semantycznych we wszystkich obsługiwanych językach, co pozwala modelowi skutecznie realizować zadania wyszukiwania informacji i wspierać aplikacje wykorzystujące architekturę RAG – mówi dr inż. Sławomir Dadas, zastępca kierownika AI Lab w Ośrodku Przetwarzania Informacji.
EuroDense dostępny dla każdego
Model EuroDense został udostępniony jako rozwiązanie open source na platformie Hugging Face. Dzięki temu może być wykorzystywany przez instytucje naukowe, administrację publiczną oraz przedsiębiorstwa do budowy wielojęzycznych systemów wyszukiwania informacji, inteligentnych baz wiedzy i nowoczesnych aplikacji AI. Udostępnienie EuroDense stanowi kolejny krok OPI w rozwijaniu europejskich technologii sztucznej inteligencji oraz budowaniu kompetencji w obszarze zaawansowanego przetwarzania języka naturalnego. Model rozszerza doświadczenia zdobyte przy tworzeniu rodziny PolDense na środowisko wielojęzyczne, odpowiadając na potrzeby użytkowników w całej Europie.
Projekt LLMs4EU
Model EuroDense opracowany został w ramach projektu Large Language Models for the European Union (LLMs4EU) realizowanego przez konsorcjum Alliance for Language Technologies – ALT-EDIC. Celem projektu jest rozwój i udostępnianie modeli, narzędzi oraz usług opartych na sztucznej inteligencji dla pięciu kluczowych sektorów: nauki, usług publicznych, turystyki, telekomunikacji oraz energetyki. Projekt ma zachęcać do wykorzystywania europejskich technologii AI przez instytucje publiczne oraz małe i średnie przedsiębiorstwa. LLMs4EU jest współfinansowany ze środków UE w ramach programu Digital Europe Programme oraz Ministerstwa Cyfryzacji.
Model EuroDense dostępny jest za darmo na platformie Hugging Face.