W ostatnich miesiącach badacze z AI LAB opublikowali m.in. retrievery PolDense i EuroDense oraz narzędzie PUMA. Tym razem udostępniają rodzinę modeli reprezentacyjnych nowej generacji, opracowaną w ramach projektu Gaia AI Factory.
Polish ModernBERT to rodzina modeli typu encoder-only, stworzona z myślą o zadaniach związanych z przetwarzaniem języka naturalnego, klasyfikacji tekstów, wykrywania nazw własnych, regresji czy pośrednio służą do budowy enkoderów np. do wyszukiwania informacji. Modele obsługują kontekst o długości do 8192 tokenów, co pozwala na przetwarzanie znacznie dłuższych treści niż w przypadku wielu dotychczasowych rozwiązań dla języka polskiego.
Prace nad modelem obejmowały cały proces jego tworzenia, od przygotowania i oczyszczenia danych treningowych po opracowanie nowatorskiej procedury pretreningu. Zespół wykorzystał specjalnie przygotowany polski korpus liczący 44,5 mld tokenów.
Udostępniono cztery warianty modeli: Base i Large, dostępne zarówno w wersji obsługującej kontekst 512 tokenów, jak i 8 tys. tokenów. Ich jakość oceniono w ramach 30 polskich zadań z zakresu przetwarzania języka naturalnego. Badacze przygotowali również LongContext, nowy benchmark służący do badania zdolności analizy długich dokumentów w języku polskim.
Najwyższy wynik osiągnął model Large-8K, który uzyskał rezultat 85,11 punktu i okazał się najlepszym spośród ocenianych polskich modeli encoderowych. Z kolei Base-8K był najwyżej ocenionym modelem 8K w swojej klasie wielkości, oferując porównywalną skuteczność przy znacznie mniejszej liczbie parametrów.
W testach przeprowadzonych na karcie NVIDIA H100 modele Polish ModernBERT wykazały również większą efektywność obliczeniową niż porównywane modele RoBERTa. Warianty Base mogą działać na procesorach CPU, co ułatwia ich wykorzystanie w administracji publicznej, nauce i biznesie.
Polish ModernBERT powstał w projekcie Gaia AI Factory, współfinansowanym przez Wspólne Przedsięwzięcie EuroHPC ze środków programu Unii Europejskiej „Cyfrowa Europa”, a także przez państwo uczestniczące – Polskę. Obliczenia wykonano z wykorzystaniem infrastruktury PLGrid w Akademickim Centrum Komputerowym Cyfronet AGH.
Modele dostępne są bezpłatnie na platformie Hugging Face: https://huggingface.co/collections/OPI-PIB/pl-modernbert
Publikacja naukowa zespołu AI Lab: https://arxiv.org/abs/2609.01379