Tokeny i okno kontekstowe — co to jest, ile kosztują i dlaczego więcej nie zawsze znaczy lepiej
- Poziom: początkujący
- Początkujący
- Biznes
- Deweloperzy
To rozwinięcie dwóch haseł ze słownika: token i okno kontekstowe. Szerszy obraz tego, jak działa model językowy, znajdziesz w wyjaśnieniu LLM — co to jest duży model językowy.
Czym jest token
Model językowy nie czyta liter ani słów. Zanim cokolwiek przetworzy, tokenizer dzieli tekst na tokeny — kawałki, które model zna ze swojego słownika. Częste słowa bywają jednym tokenem, rzadsze dzielą się na kilka fragmentów, a spacje, znaki interpunkcyjne i cyfry też zajmują tokeny.
Ile to w praktyce? Dostawcy podają przeliczniki dla angielskiego:
| Źródło | Przelicznik (tekst angielski) |
|---|---|
| OpenAI | 1 token ≈ 4 znaki ≈ ¾ słowa; 100 tokenów ≈ 75 słów |
| Anthropic (Claude) | 1 token ≈ 3,5 znaku |
Obaj dostawcy zastrzegają, że w innych językach proporcje są inne — dotyczy to także polskiego, który ma długie słowa i bogatą odmianę. Do tego tokenizery różnią się między modelami: Anthropic podaje, że tokenizer wprowadzony z Claude Opus 4.7 liczy ten sam tekst na ok. 30% więcej tokenów niż wcześniejsze modele. Wniosek praktyczny: nie przenoś przeliczników między modelami i językami — dla ważnych kalkulacji policz tokeny narzędziem dostawcy (Anthropic ma do tego osobny endpoint i sam zaznacza, że wynik jest szacunkiem).
Dlaczego tokeny mają znaczenie
- Koszt. W API płacisz za tokeny, osobno za wejście (to, co wysyłasz) i wyjście (to, co model generuje). Przykładowo, według cenników z 26.09.2026: Claude Opus 5.5 kosztuje 4 USD za milion tokenów wejścia i 20 USD za milion tokenów wyjścia, a GPT-6 Luna — 0,10 i 0,50 USD. Aktualne ceny zbieramy w newsach o modelach.
- Limity. Plany subskrypcyjne i API mają limity liczone w tokenach lub wiadomościach — długie dokumenty szybciej je wyczerpują.
- Szybkość. Im dłuższa odpowiedź, tym dłużej trwa, bo model generuje ją token po tokenie.
- Tryb rozumowania. Modele „myślące” zużywają dodatkowe tokeny na rozumowanie przed odpowiedzią — lepsza jakość w trudnych zadaniach, ale wyższy koszt i czas.
Czym jest okno kontekstowe
Anthropic definiuje okno kontekstowe jako cały tekst, do którego model może się odwołać, generując odpowiedź — łącznie z samą odpowiedzią — i porównuje je do „pamięci roboczej” modelu. W oknie mieszczą się:
- instrukcje systemowe aplikacji (których zwykle nie widzisz),
- historia rozmowy,
- dołączone pliki, wyniki wyszukiwania i narzędzi,
- Twoje bieżące pytanie,
- odpowiedź, którą model właśnie pisze (w modelach z rozumowaniem — także tokeny rozumowania).
Czego nie ma w oknie, tego dla modelu nie ma. Model nie „pamięta” poprzednich rozmów, chyba że aplikacja celowo dołączy ich fragmenty (tak działają funkcje pamięci w asystentach).
Jak duże są dziś okna
| Model / aplikacja | Okno kontekstowe | Źródło, stan na |
|---|---|---|
| Claude Opus 5.5, Sonnet 5, Fable 5.1 (API) | 1 mln tokenów | przegląd modeli Anthropic, 26.09.2026 |
| Claude Haiku 4.5 (API) | 200 tys. tokenów | jw. |
| GPT-6 Astra (API) | 1,05 mln tokenów | dokumentacja OpenAI, 26.09.2026 |
| Aplikacje ChatGPT, Claude, Gemini | zależnie od planu | porównanie asystentów |
Dla skali: Anthropic podaje, że milion tokenów to przy obecnym tokenizerze Claude ok. 555 tys. angielskich słów. Osobnym limitem jest maksymalna długość odpowiedzi — dla wymienionych modeli Claude i GPT-6 Astra to 128 tys. tokenów.
W aplikacjach czatowych okno bywa mniejsze niż w API i zależy od planu — w darmowych planach zwykle wyraźnie mniejsze. Szczegóły dla trzech najpopularniejszych asystentów trzymamy w porównaniu.
Więcej nie zawsze znaczy lepiej
Wielkie okno kusi, żeby wrzucić do modelu wszystko. To często błąd:
- Spada jakość. Anthropic opisuje zjawisko context rot: wraz ze wzrostem liczby tokenów spada dokładność i zdolność przypominania. Badanie „Lost in the Middle” (Liu i in., 2023) pokazało, że modele najlepiej wykorzystują informacje z początku i końca kontekstu, a wyraźnie gorzej — ze środka.
- Rośnie koszt. Płacisz za każdy token w oknie przy każdym zapytaniu. U części dostawców długi kontekst jest dodatkowo droższy — OpenAI podnosi stawki dla zapytań powyżej 272 tys. tokenów.
- Rośnie czas odpowiedzi. Więcej tekstu to więcej obliczeń przed pierwszym słowem odpowiedzi.
Z drugiej strony: gdy materiał jest niewielki, najprostszym rozwiązaniem jest właśnie wkleić go w całości. Anthropic w tekście o Contextual Retrieval radzi, że jeśli baza wiedzy ma mniej niż 200 tys. tokenów (ok. 500 stron), można po prostu umieścić ją w całości w prompcie — bez budowania RAG.
Jak pracować z długimi materiałami — praktyczne zasady
- Nowy temat = nowa rozmowa. Długi wątek o wszystkim naraz to prosta droga do „zapominania” ustaleń. Zacznij od nowa i wklej krótkie streszczenie tego, co ważne.
- Najważniejsze na początek i na koniec. Kluczowe instrukcje i pytanie umieść na początku lub na końcu promptu, a nie w środku długiego dokumentu.
- Dawaj fragmenty, nie archiwa. Zamiast 300 stron wklej rozdział, którego dotyczy pytanie. Przy dużych i zmiennych zbiorach dokumentów sięgnij po RAG — zob. RAG w praktyce.
- Proś o cytaty. Przy długich dokumentach wymagaj dosłownych cytatów — łatwiej sprawdzisz, czy model nie pomylił fragmentów (zob. halucynacje AI).
- Licz przed wysłaniem. W zastosowaniach firmowych i w API policz tokeny dużych plików przed wysłaniem — to najprostszy sposób, by uniknąć niespodzianek w rachunku.
Co dalej
Najczęstsze pytania
Ile tokenów ma polskie słowo?
Czy większe okno kontekstowe oznacza lepsze odpowiedzi?
Co się dzieje, gdy przekroczę okno kontekstowe?
Dlaczego płacę też za odpowiedź, a nie tylko za pytanie?
Źródła
- Understanding and counting tokens — OpenAI Help Center (dostęp: )
- Context windows — Anthropic (dostęp: )
- Token counting — Anthropic (dostęp: )
- Models overview (okna kontekstowe, limity odpowiedzi, przelicznik słów) — Anthropic (dostęp: )
- GPT-6 Astra — dokumentacja modelu — OpenAI (dostęp: )
- API pricing (dopłata za kontekst powyżej 272 tys. tokenów) — OpenAI (dostęp: )
- Lost in the Middle: How Language Models Use Long Contexts — arXiv (Liu i in., 2023) (dostęp: )
- Introducing Contextual Retrieval — Anthropic (19.09.2024) (dostęp: )