AI LAB OPI udostępnia Polish ModernBERT – nową rodzinę modeli językowych w ramach projektu Gaia AI Factory

Aktualności
Zespół AI LAB w OPI udostępnił Polish ModernBERT, rodzinę modeli językowych przeznaczonych do analizy zarówno krótkich tekstów, jak i obszernych dokumentów w języku polskim. Modele są dostępne publicznie na platformie Hugging Face, a szczegóły ich architektury, procesu treningu i wyników ewaluacji opisano w towarzyszącej publikacji naukowej.

W ostatnich miesiącach badacze z AI LAB opublikowali m.in. retrievery PolDenseEuroDense oraz narzędzie PUMA. Tym razem udostępniają rodzinę modeli reprezentacyjnych nowej generacji, opracowaną w ramach projektu Gaia AI Factory.

Polish ModernBERT to rodzina modeli typu encoder-only, stworzona z myślą o zadaniach związanych z przetwarzaniem języka naturalnego, klasyfikacji tekstów, wykrywania nazw własnych, regresji czy pośrednio służą do budowy enkoderów np. do wyszukiwania informacji. Modele obsługują kontekst o długości do 8192 tokenów, co pozwala na przetwarzanie znacznie dłuższych treści niż w przypadku wielu dotychczasowych rozwiązań dla języka polskiego.

Prace nad modelem obejmowały cały proces jego tworzenia, od przygotowania i oczyszczenia danych treningowych po opracowanie nowatorskiej procedury pretreningu. Zespół wykorzystał specjalnie przygotowany polski korpus liczący 44,5 mld tokenów.

Udostępniono cztery warianty modeli: Base i Large, dostępne zarówno w wersji obsługującej kontekst 512 tokenów, jak i 8 tys. tokenów. Ich jakość oceniono w ramach 30 polskich zadań z zakresu przetwarzania języka naturalnego. Badacze przygotowali również LongContext, nowy benchmark służący do badania zdolności analizy długich dokumentów w języku polskim.

Najwyższy wynik osiągnął model Large-8K, który uzyskał rezultat 85,11 punktu i okazał się najlepszym spośród ocenianych polskich modeli encoderowych. Z kolei Base-8K był najwyżej ocenionym modelem 8K w swojej klasie wielkości, oferując porównywalną skuteczność przy znacznie mniejszej liczbie parametrów.

W testach przeprowadzonych na karcie NVIDIA H100 modele Polish ModernBERT wykazały również większą efektywność obliczeniową niż porównywane modele RoBERTa. Warianty Base mogą działać na procesorach CPU, co ułatwia ich wykorzystanie w administracji publicznej, nauce i biznesie.

Polish ModernBERT powstał w projekcie Gaia AI Factory, współfinansowanym przez Wspólne Przedsięwzięcie EuroHPC ze środków programu Unii Europejskiej „Cyfrowa Europa”, a także przez państwo uczestniczące – Polskę. Obliczenia wykonano z wykorzystaniem infrastruktury PLGrid w Akademickim Centrum Komputerowym Cyfronet AGH.

Modele dostępne są bezpłatnie na platformie Hugging Face: https://huggingface.co/collections/OPI-PIB/pl-modernbert

Publikacja naukowa zespołu AI Lab: https://arxiv.org/abs/2609.01379