metadata

license: cc-by-nc-4.0
language:
  - pl
pipeline_tag: text-generation
library_name: transformers
extra_gated_prompt: >-
  Korzystanie z modelu językowego PLLuM-12B-nc-250715 jest dozwolone wyłącznie
  przed podmioty, w sposób i na zasadach określonych w art. 26[2] polskiej
  ustawy z dnia z dnia 4 lutego 1994 r. o prawie autorskim i prawach pokrewnych.
  Aktualna lista podmiotów, o których mowa w zdaniu poprzednim to:

  1. Instytucje dziedzictwa kulturowego,

  2. Uczelnie,

  3. Federacje podmiotów systemu szkolnictwa wyższego i nauki,

  4. Polska Akademia Nauk,

  5. Instytuty naukowe Polskiej Akademii Nauk,

  6. Instytuty badawcze, działające na podstawie ustawy z dnia 30 kwietnia 2010
  r. o instytutach badawczych,

  7. Międzynarodowe instytuty naukowe utworzone na podstawie odrębnych ustaw
  działające na terytorium Rzeczypospolitej Polskiej,

  8. Centrum Łukasiewicz,

  9. Instytuty działające w ramach Sieci Badawczej Łukasiewicz,

  10. Centrum Medycznego Kształcenia Podyplomowego,

  11. Polska Akademia Umiejętności,

  12. Inne podmioty prowadzące głównie działalność naukową w sposób samodzielny
  i ciągły.


  Zastrzegamy możliwość odmowy udzielenia dostępu do modelu językowego, jeżeli
  uznamy, że podmiot, w ramach którego występujesz o dostęp do modelu
  językowego, nie spełnia kryteriów, o których mowa w przywołanym wyżej
  przepisie.

  Aby pobrać wagi modelu, konieczne jest uzupełnienie poniższego formularza. W
  formularzu przekazujesz nam, w celu weryfikacji możliwości udzielenia dostępu
  do modelu językowego następujące dane: adres e-mail, afiliację (nazwę
  podmiotu, w ramach którego występujesz o dostęp do modelu językowego) oraz
  imię i nazwisko. Przekazując nam formularz wyrażasz zgodę na przetwarzanie
  Twoich danych osobowych. Twoje dane osobowe są przetwarzane na zasadach
  określonych w klauzuli informacyjnej RODO umieszczonej na tej stronie.


  **INFORMACJA O PRZETWARZANIU DANYCH OSOBOWYCH**


  Zgodnie z rozporządzeniem Parlamentu Europejskiego i Rady (UE) 2016/679 z dnia
  27 kwietnia 2016 r. w sprawie ochrony osób fizycznych w związku z
  przetwarzaniem danych osobowych i w sprawie swobodnego przepływu takich danych
  oraz uchylenia dyrektywy 95/46/WE (ogólne rozporządzenie o ochronie danych)
  (Dz. Urz. UE L 119 z 04.05.2016, str. 1), (dalej również: „RODO”)  informujmy,
  że:


  1. administratorem Pani/Pana danych osobowych jest Naukowa i Akademicka Sieć
  Komputerowa - Państwowy Instytut Badawczym z siedzibą w Warszawie, działający
  pod adresem 01-045 Warszawa, ul. Kolska 12, którego akta rejestrowe
  przechowuje Sąd Rejonowy dla m.st. Warszawy XIII Wydział Gospodarczy Krajowego
  Rejestru Sądowego pod numerem 0000012938, REGON: 010464542, NIP: 521-04-17-157
  (dalej również: „NASK - PIB”).


  2.   NASK - PIB wyznaczył inspektora ochrony danych osobowych, z którym można
  skontaktować się poprzez e-mail [email protected].


  3.  przetwarzanie Pani/Pana danych osobowych jest niezbędne do wypełnienia
  obowiązku prawnego wynikającego z przepisu prawa ciążącego na administratorze
  – art. 26[2] ust. 1 ustawy z dnia 4 lutego 1994 r. o prawie autorskim i
  prawach pokrewnych, tj. do celów weryfikacji wnioskodawcy o udzielenie dostępu
  do modeli językowych:  PLLuM-12B-nc-250715 (art. 6 ust. 1 lit. c) i f) RODO),
  tworzonych przez Konsorcjum Naukowe powołane w celu realizacji projektu pt.
  „HIVE AI: Rozwój i pilotażowe wdrożenie dużych modeli językowych w polskiej
  administracji publicznej” (dalej również: „Projekt”).


  4.   Pani/Pana dane osobowe mogą być udostępniane:

  a)  konsorcjantom realizującym projekt, o którym mowa w pkt. 3, jako
  oddzielnym administratorom danych osobowych,

  b)  Skarbowi Państwa – Ministrowi Cyfryzacji, którego urząd – Ministerstwo
  Cyfryzacji ma siedzibę w Warszawie przy ul. Królewskiej 27, 00-060 Warszawa,
  NIP 5252955037, REGON 525189465, jako podmiotowi finansującemu projekt pt.
  „HIVE AI: Rozwój i pilotażowe wdrożenie dużych modeli językowych w polskiej
  administracji publicznej”;

  c)   podmiotom przetwarzającym dane osobowe na zlecenie administratora w
  związku z realizacją Projektu, w tym dostawcom usług IT, kurierom oraz Poczcie
  Polskiej S.A. dla potrzeb obsługi korespondencji oraz podmiotom świadczącym
  pomoc prawną.


  1.   Pani/Pana dane osobowe nie będą przez NASK-PIB udostępniane do państw
  trzecich, ani organizacji międzynarodowej.


  2.   W odniesieniu do Pani/Pana danych osobowych decyzje nie będą podejmowane
  w sposób zautomatyzowany, stosowanie do art. 22 RODO.


  3.   Posiada Pani/Pan prawo dostępu do swoich danych osobowych, prawo do
  żądania ich sprostowania, prawo ograniczenia przetwarzania, prawo do usunięcia
  danych oraz prawo do wniesienia sprzeciwu; realizacja tych praw w zakresie
  danych, o których mowa w pkt. 3 lit. b) niniejszej klauzuli może być
  ograniczona lub wyłączona stosownie do art. 89 ust. 2 RODO.


  4.   Posiada Pani/Pan prawo do wniesienia skargi do Prezesa Urzędu Ochrony
  Danych Osobowych.
extra_gated_fields:
  Imię: text
  Nazwisko: text
  Afiliacja: text
  Adres e-mail w ramach jednostki naukowej: text
  Typ Podmiotu:
    type: select
    options:
      - Instytucja dziedzictwa kulturowego
      - Uczelnia
      - Federacja podmiotów systemu szkolnictwa wyższego i nauki
      - Polska Akademia Nauk
      - Instytut naukowy Polskiej Akademii Nauk
      - >-
        Instytut badawczy, działający na podstawie ustawy z dnia 30 kwietnia
        2010 r. o instytutach badawczych
      - >-
        Międzynarodowy instytut naukowy utworzony na podstawie odrębnych ustaw
        działający na terytorium Rzeczypospolitej Polskiej
      - Centrum Łukasiewicz
      - Instytut działający w ramach Sieci Badawczej Łukasiewicz
      - Centrum Medycznego Kształcenia Podyplomowego
      - Polska Akademia Umiejętności
      - >-
        Inny podmiot prowadzący głównie działalność naukową w sposób samodzielny
        i ciągły.
  Opis planowanego zastosowania wag modelu: text

PLLuM: A Family of Polish Large Language Models

Overview

PLLuM is a family of large language models (LLMs) specialized in Polish and other Slavic/Baltic languages, with additional English data incorporated for broader generalization. Developed through an extensive collaboration with various data providers, PLLuM models are built on high-quality text corpora and refined through instruction tuning, preference learning, and advanced alignment techniques. These models are intended to generate contextually coherent text, offer assistance in various tasks (e.g., question answering, summarization), and serve as a foundation for specialized applications such as domain-specific intelligent assistants. In 2024, PLLuM models were developed by the PLLuM consortium. Since 2025, their development has continued under HIVE AI, a broader alliance of research institutions and organizations delivering digital public services, focused on open language technologies for Polish public administration.

Key Highlights

Extensive Data Collection
We gathered large-scale, high-quality text data in Polish (around 150B tokens after cleaning and deduplication) and additional text in Slavic, Baltic, and English languages. Part of these tokens (28B) can be used in fully open-source models, including for commercial use (in compliance with relevant legal regulations).
Organic Instruction Dataset
We curated the largest Polish collection of manually created “organic instructions” (~40k prompt-response pairs, including ~3.5k multi-turn dialogs). This human-authored instruction set is based on an extensive typology of human-model interactions and it covers a range of subtle aspects of supervised fine-tuning (SFT) that might be overlooked with automated approaches (including large scale distillation of 'strong LLMs'). It was also designed to mitigate negative linguistic transfer from non-Polish textual data used in the pre-training phase.
Polish Preference Corpus
We created the first Polish-language preference corpus, featuring prompts and multiple model responses manually assessed by a demographically diverse team of annotators. This dataset teaches the model not only correctness (factual and linguistic) but also balance and safety—especially for potentially controversial or adversarial topics.
Evaluation Benchmarks
We developed custom benchmarks to evaluate our models on tasks relevant to Polish public administration, where PLLuM achieved top scores among all tested models. In broader Polish-language tasks, PLLuM models also attain state-of-the-art results.

Model Description

Below is a summary of the new PLLuM 12B-nc-250715 models. All model names link to their respective Hugging Face resources, while the base models and licenses link to the relevant source models or license references. The model with the -chat suffix has been aligned to human preferences and is generally safer and more efficient for use in dialogue and general-purpose scenarios.

Model Name	Params	License	Based On
PLLuM-12B-nc-base-250715	12B	CC-BY-NC-4.0	Mistral-Nemo-Base-2407
PLLuM-12B-nc-instruct-250715	12B	CC-BY-NC-4.0	Mistral-Nemo-Base-2407
PLLuM-12B-nc-chat-250715	12B	CC-BY-NC-4.0	Mistral-Nemo-Base-2407

Model Development

Pretraining: All models were pretrained or continued-pretrained on large-scale Polish corpora (up to 150B tokens) plus a range of English texts. The training data reflects sources available up to autumn 2024 and does not include more recent content.
Instruction Fine-Tuning: We fine-tuned the models using approximately 50k manually curated Polish "organic instructions," 30k programmatically derived instructions from high-quality Polish corpora, and 45k synthetic, context-aware instructions generated by high-performing, permissively licensed LLMs such as Mixtral8x22 and Deepseek V3.
Alignment and Preference Learning: Manually annotated preference data taught the models to produce safer, balanced, and contextually appropriate responses, even in adversarial or sensitive cases.

Intended Use Cases

General Language Tasks: Text generation, summarization, question answering, etc.
Domain-Specific Assistants: Especially effective for Polish public administration and legal or bureaucratic topics where domain-aware retrieval is required.
Research & Development: Building blocks for downstream AI applications in academic or industrial settings, where a strong command of the Polish language is essential.

How to Use

Each PLLuM model can be loaded via the Hugging Face Transformers library (or compatible frameworks). For RAG-based scenarios, pair the model with a relevant vector store or document retrieval system.

Below are some recommended steps and code snippets:

1. Installation

Make sure you have the latest versions of transformers and torch (or another compatible deep learning framework) installed:

pip install transformers accelerate torch

2. Loading the Model

Use the following example to load one of the PLLuM models:

from transformers import AutoTokenizer, AutoModelForCausalLM

model_name = "CYFRAGOVPL/PLLuM-12B-chat-250715"  # Replace with the PLLuM model name of your choice
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

3. Using bfloat16 (BF16)

If your hardware (e.g., newer GPUs) supports bfloat16, you can reduce memory usage and potentially speed up inference:

import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

model_name = "CYFRAGOVPL/PLLuM-12B-chat-250715"
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Load model in bfloat16 precision
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto"  # automatically places model layers on available devices
)

4. Generating an Example Text


prompt = "Napisz krótki wiersz o wiośnie." # EN:"Write a short poem about spring."
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)

outputs = model.generate(
    **inputs,
    max_new_tokens=50,
    do_sample=True,
    top_k=50,
    top_p=0.9,
    temperature=0.3
)

generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(generated_text)

5. Expected Output

Below is a sample (hypothetical) output for the prompt above:

Przykładowy wiersz o tematyce wiosennej:

Wiosna, wiosna, wiosna, ach to ty!
Kwiecień plecień wciąż przeplata,
trochę zimy, trochę lata.
A ja nie mogę się już doczekać,
kiedy w kalendarzu ujrzę maj.
Wtedy wszystko wkoło rozkwita,
a ptaki tak pięknie śpiewają.
Wiosno, wiosno, czekam z utęsknieniem,
zrób mi tę przyjemność i przyjdź wreszcie, proszę!

Your results may vary depending on model parameters (e.g., temperature, top_k, top_p), hardware, and other settings.

6. Retrieval Augmented Generation (RAG)

PLLuM-12B-nc-instruct-250715 and PLLuM-12B-nc-chat-250715 were additionally trained to perform well in Retrieval Augmented Generation (RAG) setting. The prompt is in .jinja format, where docs is a list of document texts and question is a query that should be answered based on the provided documents. If there is no answer in the provided documents model generates "Nie udało mi się odnaleźć odpowiedzi na pytanie".

Prompt:

Numerowana lista dokumentów jest poniżej:
---------------------
<results>{% for doc in docs %}
Dokument: {{ loop.index0 }}
{{ doc }}
{% endfor %}</results>
---------------------
Odpowiedz na pytanie użytkownika wykorzystując tylko informacje znajdujące się w dokumentach, a nie wcześniejszą wiedzę.
Udziel wysokiej jakości, poprawnej gramatycznie odpowiedzi w języku polskim. Odpowiedź powinna zawierać cytowania do dokumentów, z których pochodzą informacje. Zacytuj dokument za pomocą symbolu [nr_dokumentu] powołując się na fragment np. [0] dla fragmentu z dokumentu 0. Jeżeli w dokumentach nie ma informacji potrzebnych do odpowiedzi na pytanie, zamiast odpowiedzi zwróć tekst: "Nie udało mi się odnaleźć odpowiedzi na pytanie".

Pytanie: {{ question }}

Training Procedure

Datasets: ~150B tokens from Polish and multilingual sources, with ~28B tokens available for fully open-source commercial use.
Hyperparameters: Vary based on model size, typically including Adam or AdamW optimizers, a range of batch sizes, and carefully tuned learning rates.
Hardware & Duration: Training using Bem2 (up to 300xH100 GPUs) and Helios HPCs. The training time for each PLLuM model depends on its parameter size and hardware configuration, ranging from approximately 8 to 25 days on a multi-GPU cluster for models between 8B and 70B.

Evaluation and Benchmarks

Public Administration: PLLuM models demonstrated top-tier performance in specialized tasks relevant to government services.
Polish Language Tasks: Across a variety of internal benchmarks and standard corpora, PLLuM consistently outperforms other models in accuracy, coherence, and safety metrics.
Custom Tests: A unique preference corpus and alignment tests ensure robust, safe, and contextually accurate responses.

Limitations and Bias

Potential Hallucinations: Like other LLMs, PLLuM may occasionally produce factually incorrect or fabricated content.
Sensitivity & Bias: While extensive preference learning has been done, biases might still emerge, especially in controversial or subjective topics.
Context Length: Very long context tasks may challenge certain models, depending on memory constraints.

Ethical Considerations

PLLuM models are designed for constructive and responsible usage. Users should exercise caution when deploying them in production scenarios, especially for sensitive or regulated domains. Despite efforts to minimize harmful outputs, there is always a risk of generating offensive, biased, or inappropriate text. Human oversight and due diligence are advised.

Citation

If you use PLLuM models or any part of this repository in your research or deployment, please cite as follows (BibTeX):

@unpublished{pllum2025, 
    title={PLLuM: A Family of Polish Large Language Models}, 
    author={HIVE AI Consortium}, 
    year={2025} 
}

License

PLLuM 12B-nc-250715 models are published under CC-BY-NC-4.0.

Creators & Consortium

The PLLuM-12B-nc-250715 models are the first to be trained under the banner of HIVE AI – a new initiative uniting scientific institutions and digital service providers working together to develop and implement open language technologies for the Polish public sector. HIVE AI continues the mission of the original PLLuM project, expanding it into a coordinated effort to build, improve, and deploy Polish language models in real-world administrative applications.

NASK PIB – Project Leader	Politechnika Wrocławska	Instytut Podstaw Informatyki PAN	Instytut Slawistyki PAN
Ośrodek Przetwarzania Informacji PIB	Uniwersytet Łódzki	Cyfronet AGH

Contact and Support

For questions or contributions, please reach out via: [email protected]

We welcome feedback, collaboration, and further exploration of PLLuM models!

Acknowledgements

Project financed by the Minister of Digital Affairs under the targeted subsidy No. 1/WII/DBI/2025: “HIVE AI: Development and Pilot Implementation of LLMs in the Polish Public Administration”

Funding Amount: approx. 19 mln PLN
Contract Signing Date: 2025-03-25