PLLuM: A Family of Polish Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
| _version_ | 1866908632600281088 |
|---|---|
| author | Kocoń, Jan Piasecki, Maciej Janz, Arkadiusz Ferdinan, Teddy Radliński, Łukasz Koptyra, Bartłomiej Oleksy, Marcin Woźniak, Stanisław Walkowiak, Paweł Wojtasik, Konrad Moska, Julia Naskręt, Tomasz Walkowiak, Bartosz Gniewkowski, Mateusz Szyc, Kamil Motyka, Dawid Banach, Dawid Dalasiński, Jonatan Rudnicka, Ewa Alberski, Bartłomiej Walkowiak, Tomasz Szczęsny, Aleksander Markiewicz, Maciej Bernaś, Tomasz Mazur, Hubert Żyta, Kamil Tykierko, Mateusz Chodak, Grzegorz Kajdanowicz, Tomasz Kazienko, Przemysław Karlińska, Agnieszka Seweryn, Karolina Kołos, Anna Chrabąszcz, Maciej Lorenc, Katarzyna Krasnodębska, Aleksandra Wilczek, Artur Dziewulska, Katarzyna Betscher, Paula Cieślińska, Zofia Kowol, Katarzyna Mikoś, Daria Trzciński, Maciej Krutul, Dawid Kozłowski, Marek Dadas, Sławomir Poświata, Rafał Perełkiewicz, Michał Grębowiec, Małgorzata Kazuła, Maciej Białas, Marcin Roszko, Roman Roszko, Danuta Vaičenonienė, Jurgita Utka, Andrius Levchuk, Paweł Kowalski, Paweł Prawdzic-Jankowska, Irena Ogrodniczuk, Maciej Borys, Monika Bulińska, Anna Gumienna, Wiktoria Kieraś, Witold Komosińska, Dorota Krasnowska-Kieraś, Katarzyna Kobyliński, Łukasz Lewandowska, Martyna Łaziński, Marek Łątkowski, Mikołaj Mastalerz, Dawid Milewicz, Beata Mykowiecka, Agnieszka Anna Peljak-Łapińska, Angelika Penno, Sandra Przybysz, Zuzanna Rudolf, Michał Rybak, Piotr Saputa, Karolina Tomaszewska, Aleksandra Wawer, Aleksander Woliński, Marcin Wołoszyn, Joanna Wróblewska, Alina Żuk, Bartosz Żarnecki, Filip Kaczyński, Konrad Cichosz, Anna Deckert, Zuzanna Garnys, Monika Grabarczyk, Izabela Janowski, Wojciech Karasińska, Sylwia Kujawiak, Aleksandra Misztela, Piotr Szymańska, Maria Walkusz, Karolina Siek, Igor Kwiatkowski, Jakub Pęzik, Piotr |
| author_facet | Kocoń, Jan Piasecki, Maciej Janz, Arkadiusz Ferdinan, Teddy Radliński, Łukasz Koptyra, Bartłomiej Oleksy, Marcin Woźniak, Stanisław Walkowiak, Paweł Wojtasik, Konrad Moska, Julia Naskręt, Tomasz Walkowiak, Bartosz Gniewkowski, Mateusz Szyc, Kamil Motyka, Dawid Banach, Dawid Dalasiński, Jonatan Rudnicka, Ewa Alberski, Bartłomiej Walkowiak, Tomasz Szczęsny, Aleksander Markiewicz, Maciej Bernaś, Tomasz Mazur, Hubert Żyta, Kamil Tykierko, Mateusz Chodak, Grzegorz Kajdanowicz, Tomasz Kazienko, Przemysław Karlińska, Agnieszka Seweryn, Karolina Kołos, Anna Chrabąszcz, Maciej Lorenc, Katarzyna Krasnodębska, Aleksandra Wilczek, Artur Dziewulska, Katarzyna Betscher, Paula Cieślińska, Zofia Kowol, Katarzyna Mikoś, Daria Trzciński, Maciej Krutul, Dawid Kozłowski, Marek Dadas, Sławomir Poświata, Rafał Perełkiewicz, Michał Grębowiec, Małgorzata Kazuła, Maciej Białas, Marcin Roszko, Roman Roszko, Danuta Vaičenonienė, Jurgita Utka, Andrius Levchuk, Paweł Kowalski, Paweł Prawdzic-Jankowska, Irena Ogrodniczuk, Maciej Borys, Monika Bulińska, Anna Gumienna, Wiktoria Kieraś, Witold Komosińska, Dorota Krasnowska-Kieraś, Katarzyna Kobyliński, Łukasz Lewandowska, Martyna Łaziński, Marek Łątkowski, Mikołaj Mastalerz, Dawid Milewicz, Beata Mykowiecka, Agnieszka Anna Peljak-Łapińska, Angelika Penno, Sandra Przybysz, Zuzanna Rudolf, Michał Rybak, Piotr Saputa, Karolina Tomaszewska, Aleksandra Wawer, Aleksander Woliński, Marcin Wołoszyn, Joanna Wróblewska, Alina Żuk, Bartosz Żarnecki, Filip Kaczyński, Konrad Cichosz, Anna Deckert, Zuzanna Garnys, Monika Grabarczyk, Izabela Janowski, Wojciech Karasińska, Sylwia Kujawiak, Aleksandra Misztela, Piotr Szymańska, Maria Walkusz, Karolina Siek, Igor Kwiatkowski, Jakub Pęzik, Piotr |
| contents | Large Language Models (LLMs) play a central role in modern artificial intelligence, yet their development has been primarily focused on English, resulting in limited support for other languages. We present PLLuM (Polish Large Language Model), the largest open-source family of foundation models tailored specifically for the Polish language. Developed by a consortium of major Polish research institutions, PLLuM addresses the need for high-quality, transparent, and culturally relevant language models beyond the English-centric commercial landscape. We describe the development process, including the construction of a new 140-billion-token Polish text corpus for pre-training, a 77k custom instructions dataset, and a 100k preference optimization dataset. A key component is a Responsible AI framework that incorporates strict data governance and a hybrid module for output correction and safety filtering. We detail the models' architecture, training procedures, and alignment techniques for both base and instruction-tuned variants, and demonstrate their utility in a downstream task within public administration. By releasing these models publicly, PLLuM aims to foster open research and strengthen sovereign AI technologies in Poland. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2511_03823 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | PLLuM: A Family of Polish Large Language Models Kocoń, Jan Piasecki, Maciej Janz, Arkadiusz Ferdinan, Teddy Radliński, Łukasz Koptyra, Bartłomiej Oleksy, Marcin Woźniak, Stanisław Walkowiak, Paweł Wojtasik, Konrad Moska, Julia Naskręt, Tomasz Walkowiak, Bartosz Gniewkowski, Mateusz Szyc, Kamil Motyka, Dawid Banach, Dawid Dalasiński, Jonatan Rudnicka, Ewa Alberski, Bartłomiej Walkowiak, Tomasz Szczęsny, Aleksander Markiewicz, Maciej Bernaś, Tomasz Mazur, Hubert Żyta, Kamil Tykierko, Mateusz Chodak, Grzegorz Kajdanowicz, Tomasz Kazienko, Przemysław Karlińska, Agnieszka Seweryn, Karolina Kołos, Anna Chrabąszcz, Maciej Lorenc, Katarzyna Krasnodębska, Aleksandra Wilczek, Artur Dziewulska, Katarzyna Betscher, Paula Cieślińska, Zofia Kowol, Katarzyna Mikoś, Daria Trzciński, Maciej Krutul, Dawid Kozłowski, Marek Dadas, Sławomir Poświata, Rafał Perełkiewicz, Michał Grębowiec, Małgorzata Kazuła, Maciej Białas, Marcin Roszko, Roman Roszko, Danuta Vaičenonienė, Jurgita Utka, Andrius Levchuk, Paweł Kowalski, Paweł Prawdzic-Jankowska, Irena Ogrodniczuk, Maciej Borys, Monika Bulińska, Anna Gumienna, Wiktoria Kieraś, Witold Komosińska, Dorota Krasnowska-Kieraś, Katarzyna Kobyliński, Łukasz Lewandowska, Martyna Łaziński, Marek Łątkowski, Mikołaj Mastalerz, Dawid Milewicz, Beata Mykowiecka, Agnieszka Anna Peljak-Łapińska, Angelika Penno, Sandra Przybysz, Zuzanna Rudolf, Michał Rybak, Piotr Saputa, Karolina Tomaszewska, Aleksandra Wawer, Aleksander Woliński, Marcin Wołoszyn, Joanna Wróblewska, Alina Żuk, Bartosz Żarnecki, Filip Kaczyński, Konrad Cichosz, Anna Deckert, Zuzanna Garnys, Monika Grabarczyk, Izabela Janowski, Wojciech Karasińska, Sylwia Kujawiak, Aleksandra Misztela, Piotr Szymańska, Maria Walkusz, Karolina Siek, Igor Kwiatkowski, Jakub Pęzik, Piotr Computation and Language Artificial Intelligence Large Language Models (LLMs) play a central role in modern artificial intelligence, yet their development has been primarily focused on English, resulting in limited support for other languages. We present PLLuM (Polish Large Language Model), the largest open-source family of foundation models tailored specifically for the Polish language. Developed by a consortium of major Polish research institutions, PLLuM addresses the need for high-quality, transparent, and culturally relevant language models beyond the English-centric commercial landscape. We describe the development process, including the construction of a new 140-billion-token Polish text corpus for pre-training, a 77k custom instructions dataset, and a 100k preference optimization dataset. A key component is a Responsible AI framework that incorporates strict data governance and a hybrid module for output correction and safety filtering. We detail the models' architecture, training procedures, and alignment techniques for both base and instruction-tuned variants, and demonstrate their utility in a downstream task within public administration. By releasing these models publicly, PLLuM aims to foster open research and strengthen sovereign AI technologies in Poland. |
| title | PLLuM: A Family of Polish Large Language Models |
| topic | Computation and Language Artificial Intelligence |
| url | https://arxiv.org/abs/2511.03823 |