LLM — co to jest duży model językowy i jak działa (wyjaśnienie od podstaw)
- Poziom: początkujący
- Początkujący
- Biznes
- Deweloperzy
To wyjaśnienie rozwija krótką definicję ze słownika. Jeśli chcesz najpierw ogólnego obrazu AI, zacznij od przewodnika Jak działa sztuczna inteligencja.
Co znaczy „duży model językowy”
Każde słowo nazwy coś mówi:
- Model — program, który nauczył się wzorców z danych, zamiast dostać je w postaci reguł (uczenie maszynowe).
- Językowy — jego „materiałem” jest tekst. Uczy się zależności między fragmentami tekstu, czyli tokenami. Google opisuje model językowy jako model, który szacuje prawdopodobieństwo wystąpienia tokenu lub ciągu tokenów w dłuższym ciągu.
- Duży — ma bardzo wiele parametrów i jest trenowany na bardzo dużym zbiorze danych. Przykład historyczny: opisany w 2020 roku GPT-3 miał 175 mld parametrów.
Technicznie dzisiejsze LLM to sieci neuronowe w architekturze transformer, zaproponowanej w 2017 roku. Jej mechanizm uwagi pozwala modelowi przy każdym kolejnym tokenie ważyć, które wcześniejsze fragmenty tekstu są istotne.
Jak powstaje LLM — trzy etapy
1. Dane
Twórcy zbierają ogromny zbiór tekstów (strony internetowe, książki, kod, artykuły) i go filtrują: usuwają duplikaty, spam, treści niskiej jakości. Skład danych w dużej mierze decyduje o tym, w czym model będzie dobry, w jakich językach i z jakimi uprzedzeniami. Więcej: dane treningowe.
2. Pretrening — nauka przewidywania
Model dostaje fragment tekstu i ma przewidzieć następny token. Porównuje swoją odpowiedź z tym, co faktycznie było w tekście, i lekko koryguje parametry. Powtórzone ogromną liczbę razy, to proste zadanie zmusza model do wychwycenia gramatyki, stylu, faktów i schematów rozumowania — bo bez tego nie da się dobrze przewidywać kolejnych słów.
Po pretreningu mamy model bazowy: świetnie dokańcza tekst, ale nie jest jeszcze asystentem. Zapytany „Jak napisać CV?”, równie dobrze może dopisać kolejne pytania z listy, jak na nie odpowiedzieć.
3. Dostrajanie — z maszyny do dokańczania w asystenta
Drugi etap uczy model zachowania: odpowiadania na polecenia, formatu rozmowy, odmawiania szkodliwych próśb. Najczęściej łączy się w nim:
- dostrajanie na przykładach (instrukcja → wzorcowa odpowiedź przygotowana przez ludzi),
- uczenie ze wzmocnieniem na podstawie ocen ludzi (RLHF) — ludzie porównują odpowiedzi modelu, a model uczy się preferować te lepiej oceniane.
To podejście szczegółowo opisał OpenAI w pracy o InstructGPT (2022): według autorów ludzie woleli odpowiedzi dostrojonego modelu z 1,3 mld parametrów od odpowiedzi 100 razy większego GPT-3 bez takiego dostrojenia. To dobra ilustracja, że o użyteczności modelu decyduje nie tylko rozmiar.
Pojęcie fine-tuningu spotkasz też w innym znaczeniu: jako douczanie gotowego modelu na własnych danych firmy. To już osobna decyzja projektowa, zwykle podejmowana dopiero wtedy, gdy nie wystarcza dobry prompt ani RAG — porównanie trzech podejść: fine-tuning vs RAG vs prompt. Najwięksi dostawcy ograniczają zresztą tę opcję: OpenAI wygasza swoją platformę fine-tuningu i nie udostępnia jej już nowym użytkownikom, a API Claude według dokumentacji Anthropic fine-tuningu nie oferuje (stan na 26.09.2026).
Co LLM robi, gdy odpowiada
Gotowy model działa w trybie inferencji: nie uczy się, tylko stosuje wzorce. Dostaje wszystko, co mieści się w oknie kontekstowym — instrukcję systemową aplikacji, historię rozmowy, Twoje pytanie, załączniki — i generuje odpowiedź token po tokenie. Przy każdym kroku wylicza prawdopodobieństwa możliwych kontynuacji i wybiera jedną, z losowością regulowaną m.in. temperaturą.
Wynikają z tego trzy praktyczne konsekwencje:
- Kontekst to wszystko. Model nie zna Twojej firmy, projektu ani preferencji, jeśli ich nie podasz. Dlatego tak dużo daje dobry prompt.
- Wiedza ma datę ważności. Dostawcy podają dla modeli datę odcięcia danych treningowych — przykładowo robi to Anthropic w przeglądzie modeli Claude. Świeższe informacje model dostaje tylko przez wyszukiwanie lub dokumenty.
- Płynność nie oznacza prawdy. Model optymalizuje wiarygodne brzmienie kontynuacji, a nie jej zgodność z faktami. Stąd halucynacje.
Rodzaje modeli, które spotkasz
| Podział | Warianty | Co to oznacza dla Ciebie |
|---|---|---|
| Rozmiar i cena | Flagowe (największe) vs szybkie i tanie | Flagowe lepiej radzą sobie ze złożonymi zadaniami, szybkie wystarczą do prostych i masowych |
| Tryb pracy | Zwykły vs z rozumowaniem („thinking”) | Tryb z rozumowaniem zużywa więcej czasu i tokenów na trudne problemy (matematyka, kod, analiza) |
| Dostęp do wag | Otwarte vs zamknięte | Otwarty uruchomisz u siebie; zamknięty tylko przez aplikację lub API dostawcy |
| Rodzaj danych | Tylko tekst vs multimodalne | Modele multimodalne przyjmują też obrazy, dźwięk lub pliki |
Rodziny modeli dużych dostawców zwykle mają kilka półek: w ofercie Anthropic są to np. Opus, Sonnet i Haiku, u Google wersje Pro i Flash, a u OpenAI Astra, Sol i Luna w obrębie generacji GPT-6. Nazwy i wersje zmieniają się co kilka miesięcy — aktualny stan dla trzech najpopularniejszych asystentów trzymamy w porównaniu ChatGPT vs Claude vs Gemini.
Liczba parametrów przestała być dobrą etykietą: w dokumentacji popularnych modeli zamkniętych (np. w przeglądzie modeli Anthropic) jej nie znajdziesz. Dostawcy podają za to okno kontekstowe, cenę za tokeny i datę odcięcia wiedzy — i to są parametry, które faktycznie porównujesz.
Czego LLM nie potrafi sam z siebie
- Sprawdzać faktów — nie ma wbudowanego dostępu do prawdy ani do internetu; wyszukiwanie to osobne narzędzie aplikacji.
- Pamiętać między rozmowami — poza tym, co aplikacja celowo zapisze i dołączy do kontekstu.
- Działać w świecie — wysłać maila czy zapisać plik może dopiero agent AI, czyli model połączony z narzędziami.
- Liczyć niezawodnie — działania na liczbach też są przewidywaniem tokenów, więc dobre aplikacje przekazują obliczenia do kodu.
Jak wybrać model do zadania
| Zadanie | Na co postawić |
|---|---|
| Szybkie szkice, maile, streszczenia | Szybki, tani model lub darmowy plan asystenta |
| Analiza długiego dokumentu | Model z dużym oknem kontekstowym; sprawdź limit w swoim planie |
| Kod, matematyka, wieloetapowe rozumowanie | Model flagowy lub tryb z rozumowaniem |
| Pytania o aktualne wydarzenia | Asystent z wyszukiwaniem w sieci, a odpowiedzi ze źródłami |
| Wiedza firmowa | Dowolny dobry model + Twoje dokumenty (RAG), nie „wiedza modelu” |
| Dane wrażliwe | Plan firmowy z wyłączonym trenowaniem albo model otwarty uruchomiony u siebie |
Najpewniejszy test to Twoje własne zadania: przygotuj 5–10 typowych przykładów i porównaj wyniki dwóch–trzech modeli, zanim zdecydujesz. Gotowe rankingi w benchmarkach mówią mniej, niż się wydaje — zob. benchmark.
Co dalej
Najczęstsze pytania
Czym różni się LLM od ChatGPT?
Co oznacza liczba parametrów modelu?
Czy LLM rozumie, co pisze?
Czym jest model otwarty (open-weight)?
Czy LLM uczy się na bieżąco z rozmów?
Źródła
- Introduction to Large Language Models — Google for Developers (dostęp: )
- Language Models are Few-Shot Learners (GPT-3) — arXiv (OpenAI, 2020) (dostęp: )
- Training language models to follow instructions with human feedback — arXiv (OpenAI, 2022) (dostęp: )
- Attention Is All You Need — arXiv (Vaswani i in., 2017) (dostęp: )
- Models overview — Anthropic (dostęp: )
- Model optimization (fine-tuning) — OpenAI (dostęp: )
- Glossary (fine-tuning w Claude API) — Anthropic (dostęp: )