Akceptuję
W ramach naszej witryny stosujemy pliki cookies w celu świadczenia państwu usług na najwyższym poziomie, w tym w sposób dostosowany do indywidualnych potrzeb. Korzystanie z witryny bez zmiany ustawień dotyczących cookies oznacza, że będą one zamieszczone w Państwa urządzeniu końcowym. Możecie Państwo dokonać w każdym czasie zmiany ustawień dotyczących cookies. Więcej szczegółów w naszej Polityce Prywatności

Zamknij X
Ceramika

Naukowy styl życia

Nauka i biznes

Strona główna Informacje
Labro na dole

Powstała nowa rodzina polskich modeli językowych


Działający w ramach Ośrodka Przetwarzania Informacji (OPI) AI Lab opracował nową rodzinę modeli językowych PolDense przeznaczonych do wyszukiwania informacji. Jak informuje placówka, w publicznym rankingu PIRB model Poldense zajmuje pierwsze miejsce pod względem skuteczności działania.

Modele PolDense powstały w celu pracy na systemach pracujących z dużymi wolumenami danych nieustrukturyzowanych, w szczególności w wyszukiwarkach, chatbotach, asystentach AI oraz aplikacjach wykorzystujących popularną obecnie architekturę RAG (Retrieval Augmented Generation).

– Udostępnienie modeli PolDense to kolejny krok w budowaniu polskich kompetencji w obszarze sztucznej inteligencji. Tworzymy otwarte technologie, które mogą być wykorzystywane przez naukowców, administrację publiczną i przedsiębiorców do budowy nowoczesnych, efektywnych i bezpiecznych narzędzi AI. Warto podkreślić, że jeden z nowych modeli OPI jest na pierwszym miejscu wg Polish Information Retrieval Benchmark (PIRB), wyprzedzając wielojęzyczne modele typu llama czy bge – podkreśla dr hab. inż. Jarosław Protasiewicz, dyrektor Ośrodka Przetwarzania Informacji - Państwowego Instytutu Badawczego.

Rodzina PolDense obejmuje sześć modeli opartych na architekturze ModernBERT i technologii ettin-encoders. Modele posiadają od 17 milionów do 1 miliarda parametrów, co pozwala dobrać rozwiązanie zarówno do wdrożeń wymagających najwyższej jakości, jak i do środowisk o ograniczonych zasobach sprzętowych. Modele potrafią analizować teksty o długości nawet 8192 tokenów, dzięki czemu lepiej zachowują kontekst długich dokumentów oraz skuteczniej identyfikują najbardziej trafne informacje.

Największy model z rodziny – PolDense 1B – osiągnął wynik 64,11 punktu w benchmarku PIRB, wyprzedzając znacznie większe modele wielojęzyczne, takie jak Llama-Embed-Nemotron-8B (63,73) oraz BGE-Multilingual-Gemma2-9B (63,26).

Modele o wielkości 400 mln i 150 mln parametrów oferują bardzo konkurencyjne wyniki względem rozwiązań posiadających kilka miliardów parametrów, natomiast najmniejsze warianty – 68 mln, 32 mln i 17 mln parametrów – zostały zaprojektowane z myślą o wdrożeniach na procesorach CPU, urządzeniach mobilnych oraz środowiskach edge computing.

Modele PolDense zostały udostępnione przez Ośrodek Przetwarzania Informacji jako rozwiązania open source. Dzięki temu mogą być wykorzystywane do budowy własnych mechanizmów wyszukiwania, systemów RAG i narzędzi wspierających pracę z bazami dokumentów. Zastosowanie modeli PolDense pozwala nie tylko poprawić jakość wyszukiwania informacji, lecz także obniżyć koszty wdrożeń poprzez wykorzystanie mniejszych i bardziej efektywnych obliczeniowo modeli bez utraty wysokiej skuteczności działania.

Dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji, podkreśla znaczenie modeli opracowanych w OPI dla różnego rodzaju użytkowników.

– PolDense pokazuje, że można tworzyć modele wyspecjalizowane dla języka polskiego, które nie tylko konkurują z największymi rozwiązaniami światowymi, ale w wielu specyficznych zadaniach osiągają od nich lepsze wyniki. Naszym celem było opracowanie rodziny modeli odpowiadającej na potrzeby bardzo różnych zastosowań – od dużych systemów korporacyjnych, po lekkie wdrożenia działające lokalnie. Wszystkie modele udostępniamy za darmo na platformie Hugging Face, aby wspierać rozwój polskiego ekosystemu AI – podsumowuje Kozłowski.

W kolejnych miesiącach AI Lab OPI planuje udostępnienie modelu EuroDense, który wspiera wyszukiwanie informacji w dziewięciu językach europejskich.

Modele PolDense zostały opracowane w ramach projektu Large Language Models for the European Union (LLMs4EU) realizowanego przez konsorcjum Alliance for Language Technologies – ALT-EDIC. Celem projektu jest rozwój i udostępnianie modeli, narzędzi oraz usług opartych na sztucznej inteligencji dla pięciu kluczowych sektorów: nauki, usług publicznych, turystyki, telekomunikacji oraz energetyki. Projekt ma zachęcać do wykorzystywania europejskich technologii AI przez instytucje publiczne oraz małe i średnie przedsiębiorstwa. LLMs4EU jest współfinansowany ze środków UE w ramach programu Digital Europe Programme oraz Ministerstwa Cyfryzacji. Modele PolDense dostępne są za darmo na platformie Hugging Face.

Źródło: pap.pl

Recenzje



https://laboratoria.net/aktualnosci/32945.html
Informacje dnia: Wakacje to nie wyścig z czasem Podpis prezydenta pod ustawą chroniącą doktorantów W Polsce nie brakuje patentów Startuje 16. edycja konkursu Złoty Medal Chemii AI może mieć wpływ na preferencje polityczne Przyszłość Europy zależy od zapylaczy. Wakacje to nie wyścig z czasem Podpis prezydenta pod ustawą chroniącą doktorantów W Polsce nie brakuje patentów Startuje 16. edycja konkursu Złoty Medal Chemii AI może mieć wpływ na preferencje polityczne Przyszłość Europy zależy od zapylaczy. Wakacje to nie wyścig z czasem Podpis prezydenta pod ustawą chroniącą doktorantów W Polsce nie brakuje patentów Startuje 16. edycja konkursu Złoty Medal Chemii AI może mieć wpływ na preferencje polityczne Przyszłość Europy zależy od zapylaczy.

Partnerzy

GoldenLine Fundacja Kobiety Nauki Job24 Obywatele Nauki NeuroSkoki Portal MaterialyInzynierskie.pl Uni Gdansk MULTITRAIN I MULTITRAIN II Nauki przyrodnicze KOŁO INZYNIERÓW PB ICHF PAN FUNDACJA JWP NEURONAUKA Mlodym Okiem Polski Instytut Rozwoju Biznesu Analityka Nauka w Polsce CITTRU - Centrum Innowacji, Transferu Technologii i Rozwoju Uniwersytetu Akademia PAN Chemia i Biznes Farmacom Świat Chemii Forum Akademickie Biotechnologia     Bioszkolenia Geodezja Instytut Lotnictwa EuroLab

Szanowny Czytelniku!

 
25 maja 2018 roku zacznie obowiązywać Rozporządzenie Parlamentu Europejskiego i Rady (UE) 2016/679 z dnia 27 kwietnia 2016 r (RODO). Potrzebujemy Twojej zgody na przetwarzanie Twoich danych osobowych przechowywanych w plikach cookies. Poniżej znajdziesz pełny zakres informacji na ten temat.
 
Zgadzam się na przechowywanie na urządzeniu, z którego korzystam tzw. plików cookies oraz na przetwarzanie moich danych osobowych pozostawianych w czasie korzystania przeze mnie ze strony internetowej Laboratoria.net w celach marketingowych, w tym na profilowanie i w celach analitycznych.

Kto będzie administratorem Twoich danych?

Administratorami Twoich danych będziemy my: Portal Laboratoria.net z siedzibą w Krakowie (Grupa INTS ul. Czerwone Maki 55/25 30-392 Kraków).

O jakich danych mówimy?

Chodzi o dane osobowe, które są zbierane w ramach korzystania przez Ciebie z naszych usług w tym zapisywanych w plikach cookies.

Dlaczego chcemy przetwarzać Twoje dane?

Przetwarzamy te dane w celach opisanych w polityce prywatności, między innymi aby:

Komu możemy przekazać dane?

Zgodnie z obowiązującym prawem Twoje dane możemy przekazywać podmiotom przetwarzającym je na nasze zlecenie, np. agencjom marketingowym, podwykonawcom naszych usług oraz podmiotom uprawnionym do uzyskania danych na podstawie obowiązującego prawa np. sądom lub organom ścigania – oczywiście tylko gdy wystąpią z żądaniem w oparciu o stosowną podstawę prawną.

Jakie masz prawa w stosunku do Twoich danych?

Masz między innymi prawo do żądania dostępu do danych, sprostowania, usunięcia lub ograniczenia ich przetwarzania. Możesz także wycofać zgodę na przetwarzanie danych osobowych, zgłosić sprzeciw oraz skorzystać z innych praw.

Jakie są podstawy prawne przetwarzania Twoich danych?

Każde przetwarzanie Twoich danych musi być oparte na właściwej, zgodnej z obowiązującymi przepisami, podstawie prawnej. Podstawą prawną przetwarzania Twoich danych w celu świadczenia usług, w tym dopasowywania ich do Twoich zainteresowań, analizowania ich i udoskonalania oraz zapewniania ich bezpieczeństwa jest niezbędność do wykonania umów o ich świadczenie (tymi umowami są zazwyczaj regulaminy lub podobne dokumenty dostępne w usługach, z których korzystasz). Taką podstawą prawną dla pomiarów statystycznych i marketingu własnego administratorów jest tzw. uzasadniony interes administratora. Przetwarzanie Twoich danych w celach marketingowych podmiotów trzecich będzie odbywać się na podstawie Twojej dobrowolnej zgody.

Dlatego też proszę zaznacz przycisk "zgadzam się" jeżeli zgadzasz się na przetwarzanie Twoich danych osobowych zbieranych w ramach korzystania przez ze mnie z portalu *Laboratoria.net, udostępnianych zarówno w wersji "desktop", jak i "mobile", w tym także zbieranych w tzw. plikach cookies. Wyrażenie zgody jest dobrowolne i możesz ją w dowolnym momencie wycofać.
 
Więcej w naszej POLITYCE PRYWATNOŚCI
 

Newsletter

Zawsze aktualne informacje