{"id":22466,"date":"2020-05-12T17:31:09","date_gmt":"2020-05-12T15:31:09","guid":{"rendered":"https:\/\/opi.org.pl\/laboratories\/natural-language-processing-laboratory\/u-nas-slowo-staje-sie-liczba\/"},"modified":"2025-07-24T09:20:06","modified_gmt":"2025-07-24T07:20:06","slug":"we-turn-words-into-numbers","status":"publish","type":"page","link":"https:\/\/opi.org.pl\/en\/laboratories\/natural-language-processing-laboratory\/we-turn-words-into-numbers\/","title":{"rendered":"We turn words into numbers"},"content":{"rendered":"\n<div class=\"wp-block-group alignwide opi-promo\"><div class=\"wp-block-group__inner-container is-layout-flow wp-block-group-is-layout-flow\">\n<div class=\"wp-block-columns alignwide is-layout-flex wp-container-core-columns-is-layout-8f761849 wp-block-columns-is-layout-flex\">\n<div class=\"wp-block-column is-layout-flow wp-block-column-is-layout-flow\">\n<p class=\"wp-block-paragraph\">Matematyk\u0119 i statystyk\u0119 zaprz\u0119gli\u015bmy do odkrywania wiedzy z tekst\u00f3w. Z <strong>dr. Markiem Koz\u0142owskim<\/strong>, kierownikiem Laboratorium In\u017cynierii Lingwistycznej OPI PIB, rozmawia <strong>Micha\u0142 Rolecki<\/strong><\/p>\n<\/div>\n\n\n\n<div class=\"wp-block-column is-layout-flow wp-block-column-is-layout-flow\">\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"958\" src=\"https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-1024x958.png\" alt=\"\" class=\"wp-image-25009\" srcset=\"https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-1024x958.png 1024w, https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-300x281.png 300w, https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-768x718.png 768w, https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-1536x1436.png 1536w, https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla-1200x1122.png 1200w, https:\/\/opi.org.pl\/wp-content\/uploads\/2021\/11\/marek-kozlowsli-beztla.png 1617w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><figcaption><strong>dr Marek Koz\u0142owski <\/strong><br\/>kierownik <br\/>Laboratorium <br\/>In\u017cynierii <br\/>Lingwistycznej <\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n<\/div>\n<\/div>\n<\/div><\/div>\n\n<div class=\"wp-block-group alignfull opi-gray-background\"><div class=\"wp-block-group__inner-container is-layout-flow wp-block-group-is-layout-flow\">\n<div class=\"wp-block-columns is-layout-flex wp-container-core-columns-is-layout-8f761849 wp-block-columns-is-layout-flex\">\n<div class=\"wp-block-column is-layout-flow wp-block-column-is-layout-flow\">\n<p class=\"wp-block-paragraph\"><strong>Marek Koz\u0142owski<\/strong> jest doktorem informatyki, kierownikiem Laboratorium In\u017cynierii Lingwistycznej w O\u015brodku Przetwarzania Informacji \u2013 Pa\u0144stwowym Instytucie Badawczym w Warszawie, gdzie prowadzi ponad 30-osobowy zesp\u00f3\u0142 badaczy i programist\u00f3w zajmuj\u0105cy si\u0119 tworzeniem oprogramowania wzbogaconego inteligentnymi metodami przetwarzania danych<\/p>\n<\/div>\n\n\n\n<div class=\"wp-block-column is-layout-flow wp-block-column-is-layout-flow\">\n<p class=\"wp-block-paragraph\">(m.in. JSA, chatboty, semantyczne wyszukiwarki). Pasjonuje go przetwarzanie j\u0119zyka naturalnego, eksploracja danych i uczenie maszynowe. Napisa\u0142 ponad 40 publikacji naukowych z zakresu semantycznego przetwarzania tekst\u00f3w i uczenia maszynowego.<\/p>\n<\/div>\n<\/div>\n<\/div><\/div>\n\n<div class=\"wp-block-group alignwide interview\"><div class=\"wp-block-group__inner-container is-layout-flow wp-block-group-is-layout-flow\">\n<div class=\"wp-block-group\"><div class=\"wp-block-group__inner-container is-layout-flow wp-block-group-is-layout-flow\">\n<h2 class=\"wp-block-heading\">Micha\u0142 Rolecki: Laikowi in\u017cynieria kojarzy si\u0119 g\u0142\u00f3wnie z budow\u0105 dr\u00f3g i most\u00f3w. Co to jest in\u017cynieria lingwistyczna?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Marek Koz\u0142owski: In\u017cynieria lingwistyczna to dziedzina, kt\u00f3ra zajmuje si\u0119 badaniami nad automatyzacj\u0105 przetwarzania danych w j\u0119zyku naturalnym, czyli w skr\u00f3cie \u2013 danych tekstowych. Przyznam, ta nazwa mo\u017ce troch\u0119 dezorientowa\u0107 osoby nieznaj\u0105ce tej dziedziny. Jest w pewnym sensie pok\u0142osiem pr\u00f3by zwi\u0119z\u0142ego przet\u0142umaczenia nazw angielskich, bo to Anglosasi jako pierwsi stworzyli t\u0119 dziedzin\u0119 i zacz\u0119li j\u0105 rozwija\u0107. W j\u0119zyku angielskim u\u017cywaj\u0105 nazw natural language processing (przetwarzanie j\u0119zyka naturalnego) lub computational linguistics (lingwistyka obliczeniowa). Chcieli\u015bmy wybra\u0107 polsk\u0105 nazw\u0119, kt\u00f3ra b\u0119dzie kr\u00f3tka i mocno wyra\u017ca\u0142a podej\u015bcie programistyczne czy in\u017cynierskie, st\u0105d \u201ein\u017cynieria lingwistyczna\u201d. W ten spos\u00f3b odcinamy si\u0119 od pewnego mocno lingwistycznego nurtu w tej dziedzinie, jak formalna analiza j\u0119zyka (dog\u0142\u0119bne badanie morfologiczno-sk\u0142adniowe wypowiedzi), a skupiamy ca\u0142y wysi\u0142ek na wykorzystaniu matematyki \u2013 w skr\u00f3cie i upraszczaj\u0105c: statystyki \u2013 do odkrywania wiedzy z tekst\u00f3w.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Czym si\u0119 konkretnie zajmujecie?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Nasze g\u0142\u00f3wne zadania to wyszukiwanie w tekstowych repozytoriach, grupowanie tekst\u00f3w w celu zbudowania pewnej sp\u00f3jnej reprezentacji tematycznej, klasyfikacja tekst\u00f3w do zadanych kategorii (np. klasyfikacja maila jako spam) czy ekstrakcja informacji z tekst\u00f3w (np. wykrywanie i identyfikowanie nazw w\u0142asnych, wykrywanie okre\u015blonych fakt\u00f3w i argument\u00f3w), a tak\u017ce t\u0142umaczenie maszynowe i streszczanie tekst\u00f3w. Nale\u017cy pami\u0119ta\u0107, \u017ce w szeroko rozumianej lingwistyce komputerowej wyst\u0119puj\u0105 dwa g\u0142\u00f3wne nurty bada\u0144: formalny opis j\u0119zyka i praw nim rz\u0105dz\u0105cych oraz metody statystyczne pomijaj\u0105ce problem rozumienia tekstu na rzecz analizy cz\u0119sto\u015bci wyst\u0119powania wybranych zale\u017cno\u015bci. My poszli\u015bmy drug\u0105 drog\u0105, st\u0105d nacisk na in\u017cynieri\u0119 w nazwie. Reasumuj\u0105c, dzia\u0142amy w interdyscyplinarnej dziedzinie zajmuj\u0105cej si\u0119 statystycznym lub opartym na regu\u0142ach modelowaniem j\u0119zyka naturalnego z perspektywy obliczeniowej, a tak\u017ce badaniem odpowiednich podej\u015b\u0107 obliczeniowych do szerokiej klasy pozyskiwania wiedzy i informacji z tekst\u00f3w.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">A co robicie teraz?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Laboratorium sta\u0142o si\u0119 obecnie tworem mocno interdyscyplinarnym. Mamy pion badawczy, kt\u00f3ry zajmuje si\u0119 kwestiami \u015bci\u015ble naukowymi. To inteligentne metody detekcji plagiat\u00f3w w pracach dyplomowych, chatboty, predykcja sonda\u017cy wyborczych w oparciu o tekstowe wypowiedzi na forach publicznych, metody detekcji nadu\u017cy\u0107 w sieciach na podstawie log\u00f3w z ruchu czy automatyczne metody oceny (na przyk\u0142ad obuwia na podstawie samych zdj\u0119\u0107). Mamy te\u017c piony operacyjne, czyli zajmuj\u0105ce si\u0119 rozwojem i utrzymaniem. To zespo\u0142y programistyczne odpowiedzialne za rozw\u00f3j i utrzymanie dzia\u0142aj\u0105cych ju\u017c system\u00f3w, mi\u0119dzy innymi JSA (Jednolity System Antyplagiatowy), PBN (Polska Bibliografia Naukowa), SEDN (System Ewaluacji Dorobku Naukowego) i ELA (og\u00f3lnopolski system monitorowania Ekonomicznych Los\u00f3w Absolwent\u00f3w). Jest u nas zesp\u00f3\u0142 tester\u00f3w, zesp\u00f3\u0142 analityk\u00f3w, jest te\u017c zesp\u00f3\u0142 administrator\u00f3w wsparcia aplikacji i us\u0142ug laboratorium (devOps).<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Pracuj\u0105 u was sami programi\u015bci?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Programi\u015bci to oczywi\u015bcie znacz\u0105ca wi\u0119kszo\u015b\u0107 naszych pracownik\u00f3w, ale s\u0105 te\u017c u nas testerzy, analitycy czy admini. Najwa\u017cniejsze, \u017ce poza stricte operacyjnymi dzia\u0142aniami mamy czas na prace badawcze w takich dziedzinach, jak przetwarzanie tekstu czy, jak ostatnio, obrazu.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Co trzeba zrobi\u0107, \u017ceby u was pracowa\u0107?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Przej\u015b\u0107 rekrutacj\u0119. Mamy szereg otwartych pozycji, jak np. programista back-end (g\u0142\u00f3wnie Java-oriented Stack), programista front-end (g\u0142\u00f3wnie z u\u017cyciem Angular czy Vue), administrator w zespole devOps. Pracujemy z szerokim spektrum technologii, g\u0142\u00f3wnie z u\u017cyciem j\u0119zyk\u00f3w Java, JavaScript, Python. Wi\u0119kszo\u015b\u0107 aktualnie rozwijanych system\u00f3w ma osobne warstwy front i back-end, czyli tworzymy rozdzielne aplikacje front-end i aplikacje back-end, kt\u00f3re ze sob\u0105 si\u0119 komunikuj\u0105, np. g\u0142\u00f3wnie z u\u017cyciem REST API.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Co mo\u017cna zrobi\u0107, analizuj\u0105c j\u0119zyk?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Zaskakuj\u0105co du\u017co. Zacznijmy od tego, \u017ce mo\u017cna wykrywa\u0107 plagiaty. Opracowany przez naszych specjalist\u00f3w Jednolity System Antyplagiatowy dzia\u0142a od pocz\u0105tku ubieg\u0142ego roku i pozwala okre\u015bli\u0107, w jakim stopniu praca jest dzie\u0142em podpisuj\u0105cego si\u0119 pod ni\u0105 cz\u0142owieka. Nasz algorytm jest niewra\u017cliwy na zmiany szyku zdania, kolejno\u015bci wyraz\u00f3w, wielko\u015bci liter czy interpunkcji. Oczyszcza sobie analizowany tekst, buduje z niego jednoznaczne zbiory s\u0142\u00f3w, pojedynczych token\u00f3w, i na nich pracuje. O szczeg\u00f3\u0142ach jego dzia\u0142ania rozmawiali\u015bmy z portalem sztucznainteligencja.org.pl, kt\u00f3rego wydawc\u0105 jest OPI PIB. Za pomoc\u0105 maszynowych metod analizy j\u0119zyka mo\u017cna te\u017c profilowa\u0107 ludzi behawioralnie, czyli traktowa\u0107 j\u0119zyk jak swoisty odcisk palca (co z kolei t\u0142umaczy\u0142em w tek\u015bcie \u201eCo ci\u0119 zdradzi w sieci\u201d). Przez ca\u0142e swoje \u017cycie ka\u017cdy z nas wykszta\u0142ca charakterystyczny tylko dla siebie styl pisania. Ludziom to, czy dwa dane teksty napisa\u0142a ta sama osoba, podpowiada intuicja. Natomiast maszyna, kt\u00f3ra ma pewne dane wej\u015bciowe, mo\u017ce por\u00f3wna\u0107 pewne cechy tekstu w czasie. W przestrzeni takich cech tworzy sobie pewne wektory, czyli uporz\u0105dkowane zbiory cech. Opisuj\u0105 one profil danej osoby, a kolejne teksty s\u0105 z tym profilem por\u00f3wnywane. Nazywamy to stylometrycznym profilowaniem behawioralnym i na tej podstawie mo\u017cna stworzy\u0107 profil konkretnej osoby. A konkretnie tego, w jaki spos\u00f3b u\u017cywa ona j\u0119zyka pisanego. Oczywi\u015bcie, je\u015bli mamy wystarczaj\u0105co wiele tekst\u00f3w, kt\u00f3re kto\u015b napisa\u0142. Z kolei z Antonim Sobkowiczem w naszym laboratorium od kilku lat pracowali\u015bmy nad metodami predykcyjnymi, kt\u00f3re przek\u0142adaj\u0105 emocjonalny j\u0119zyk u\u017cywany w politycznej debacie internetowej na ostateczne preferencje polityczne. Nasze algorytmy by\u0142y bli\u017csze wynikowi wybor\u00f3w parlamentarnych ni\u017c ostatni przedwyborczy sonda\u017c opinii publicznej.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak to mo\u017cliwe?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">W du\u017cej mierze dzi\u0119ki bardzo du\u017cej ilo\u015bci danych, kt\u00f3re algorytmy maj\u0105 do dyspozycji. Sonda\u017ce przedwyborcze prowadzone s\u0105 na pr\u00f3bach rz\u0119du tysi\u0105ca ankietowanych, a w dniu wybor\u00f3w na dziesi\u0105tkach tysi\u0119cy. Metody, kt\u00f3re wykorzystali\u015bmy, analizuj\u0105 kilka milion\u00f3w komentarzy pod artyku\u0142ami politycznymi na portalach internetowych. Te z kolei wyra\u017caj\u0105 pogl\u0105dy kilkuset tysi\u0119cy do nawet miliona u\u017cytkownik\u00f3w. \u017badne badanie PAPI\/CAWI\/CATI, czyli prowadzone tradycyjnymi metodami, nie dociera do takiej liczby os\u00f3b. Dzi\u015b spora cz\u0119\u015b\u0107 komentarzy na tematy polityczne odbywa si\u0119 na publicznie dost\u0119pnych forach w internecie. Korzystali\u015bmy z komentarzy dost\u0119pnych w popularnych informacyjnych serwisach internetowych, takich z du\u017c\u0105 liczb\u0105 politycznych artyku\u0142\u00f3w. Na pocz\u0105tku potrzebny by\u0142 zbi\u00f3r wyra\u017ce\u0144 o silnym nacechowaniu emocjonalnym i popieraj\u0105cych jedn\u0105 z dw\u00f3ch opcji politycznych. By dok\u0142adnie przypisa\u0107 komentarze do konkretnych oboz\u00f3w politycznych, wykorzystali\u015bmy uczenie maszynowe. Na koniec pozosta\u0142o ju\u017c tylko obliczy\u0107, ile os\u00f3b z og\u00f3\u0142u komentuj\u0105cych prezentuje pogl\u0105dy popieraj\u0105ce dan\u0105 opcj\u0119 polityczn\u0105 \u2013 dok\u0142adnie tak, jak dzieje si\u0119 to w przypadku sonda\u017cy. Liczebno\u015b\u0107 pr\u00f3by idzie tu w miliony, co rekompensuje jej ewentualn\u0105 ni\u017csz\u0105 jako\u015b\u0107.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">D\u0142ugo nad tym pracowali\u015bcie?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Taki spos\u00f3b badania testowali\u015bmy od kilku lat. W przedwyborczych miesi\u0105cach (od lipca 2019) regularnie co dziesi\u0119\u0107 dni. Wyniki przewidywa\u0144 swoich algorytm\u00f3w por\u00f3wnywali\u015bmy z wynikami bada\u0144 opinii publicznych przeprowadzanych przez r\u00f3\u017cne pracownie tradycyjnymi metodami. Jedne i drugie niewiele od siebie odbiega\u0142y. Wynik ubieg\u0142orocznych wybor\u00f3w algorytm przewidzia\u0142 za\u015b bardzo trafnie, lepiej ni\u017c sonda\u017ce. Nie jest to temat zupe\u0142nie nowy. Analizy politycznych nastroj\u00f3w na podstawie wykrywania emocji w publicznie dost\u0119pnych postach przeprowadza si\u0119 na \u015bwiecie od wielu lat. Ale O\u015brodek Przetwarzania Informacji jest w moim przekonaniu jedyn\u0105 polsk\u0105 plac\u00f3wk\u0105 badawcz\u0105, kt\u00f3ra prowadzi regularne badania naukowe nad analiz\u0105 preferencji politycznych Polak\u00f3w na szeroko rozumianych portalach internetowych za pomoc\u0105 metod sztucznej inteligencji.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Czy maszyny b\u0119d\u0105 kiedy\u015b m\u00f3wi\u0107 i pisa\u0107 tak, \u017ce nie odr\u00f3\u017cnimy ich od ludzi?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ju\u017c tak jest. Podobno cz\u0119\u015b\u0107 chatbot\u00f3w jest blisko zdania testu Turinga (zaproponowanego do odr\u00f3\u017cnienia maszyny od cz\u0142owieka), a niekt\u00f3rzy twierdz\u0105, \u017ce go zda\u0142y, tyle \u017ce w pewnych ograniczonych warunkach. S\u0105dz\u0119, \u017ce za jakie\u015b pi\u0119\u0107 lat wi\u0119kszo\u015b\u0107 ludzi nie b\u0119dzie w stanie odr\u00f3\u017cni\u0107, czy rozmawia z cz\u0142owiekiem, czy chatbotem, je\u015bli b\u0119d\u0105 rozmawia\u0107 z nimi na okre\u015blone tematy, takie jak rezerwacja towar\u00f3w, sprawy podatkowe lub zakupy.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Dzia\u0142acie na spor\u0105 skal\u0119.<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Tak, prowadzimy prace badawcze w r\u00f3\u017cnych obszarach. Analiza j\u0119zyka pozwala tworzy\u0107 dziedzinowe wyszukiwarki kontekstowe (Word Sense Induction Based Search Engines), statystyczne t\u0142umaczenie maszynowe ograniczone do konkretnej dziedziny (Statistical Machine Translation), klasyfikowa\u0107 dokumenty w ramach konkretnej dziedziny czy odkrywa\u0107 argumenty w tek\u015bcie prawniczym. Pozwala te\u017c na analiz\u0119 sentymentu (Sentiment Analysis), czyli ukrytych w tek\u015bcie emocji. Wreszcie na podstawie narz\u0119dzi do statystycznej analizy maszynowej j\u0119zyka powstaj\u0105 systemy rekomendacji, od muzyki po kierunki studi\u00f3w i uczelnie, czy narz\u0119dzie do streszczania tekst\u00f3w. Te wszystkie obszary to dziedzina naszych bada\u0144.<\/p>\n<\/div><\/div>\n\n\n<p>[opi_content_social_icons]<\/p>\n<\/div><\/div>\n\n<p class=\"wp-block-paragraph\"><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Matematyk\u0119 i statystyk\u0119 zaprz\u0119gli\u015bmy do odkrywania wiedzy z tekst\u00f3w. Z dr. Markiem Koz\u0142owskim, kierownikiem Laboratorium In\u017cynierii Lingwistycznej OPI PIB, rozmawia Micha\u0142 Rolecki Marek Koz\u0142owski jest doktorem informatyki, kierownikiem Laboratorium In\u017cynierii Lingwistycznej w O\u015brodku Przetwarzania Informacji \u2013 Pa\u0144stwowym Instytucie Badawczym w Warszawie, gdzie prowadzi ponad 30-osobowy zesp\u00f3\u0142 badaczy i programist\u00f3w zajmuj\u0105cy si\u0119 tworzeniem oprogramowania wzbogaconego inteligentnymi&hellip;<\/p>\n","protected":false},"author":34,"featured_media":22766,"parent":22461,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"footnotes":"","_links_to":"","_links_to_target":""},"class_list":["post-22466","page","type-page","status-publish","has-post-thumbnail","hentry"],"_links":{"self":[{"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/pages\/22466","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/users\/34"}],"replies":[{"embeddable":true,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/comments?post=22466"}],"version-history":[{"count":10,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/pages\/22466\/revisions"}],"predecessor-version":[{"id":31120,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/pages\/22466\/revisions\/31120"}],"up":[{"embeddable":true,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/pages\/22461"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/media\/22766"}],"wp:attachment":[{"href":"https:\/\/opi.org.pl\/en\/wp-json\/wp\/v2\/media?parent=22466"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}