agentarium.pl

Tokeny i okno kontekstowe — co to jest, ile kosztują i dlaczego więcej nie zawsze znaczy lepiej

Redakcja agentarium.pl Publikacja: 4 min czytania
  • Poziom: początkujący
  • Początkujący
  • Biznes
  • Deweloperzy

To rozwinięcie dwóch haseł ze słownika: token i okno kontekstowe. Szerszy obraz tego, jak działa model językowy, znajdziesz w wyjaśnieniu LLM — co to jest duży model językowy.

Czym jest token

Model językowy nie czyta liter ani słów. Zanim cokolwiek przetworzy, tokenizer dzieli tekst na tokeny — kawałki, które model zna ze swojego słownika. Częste słowa bywają jednym tokenem, rzadsze dzielą się na kilka fragmentów, a spacje, znaki interpunkcyjne i cyfry też zajmują tokeny.

Ile to w praktyce? Dostawcy podają przeliczniki dla angielskiego:

ŹródłoPrzelicznik (tekst angielski)
OpenAI1 token ≈ 4 znaki ≈ ¾ słowa; 100 tokenów ≈ 75 słów
Anthropic (Claude)1 token ≈ 3,5 znaku

Obaj dostawcy zastrzegają, że w innych językach proporcje są inne — dotyczy to także polskiego, który ma długie słowa i bogatą odmianę. Do tego tokenizery różnią się między modelami: Anthropic podaje, że tokenizer wprowadzony z Claude Opus 4.7 liczy ten sam tekst na ok. 30% więcej tokenów niż wcześniejsze modele. Wniosek praktyczny: nie przenoś przeliczników między modelami i językami — dla ważnych kalkulacji policz tokeny narzędziem dostawcy (Anthropic ma do tego osobny endpoint i sam zaznacza, że wynik jest szacunkiem).

Dlaczego tokeny mają znaczenie

  • Koszt. W API płacisz za tokeny, osobno za wejście (to, co wysyłasz) i wyjście (to, co model generuje). Przykładowo, według cenników z 26.09.2026: Claude Opus 5.5 kosztuje 4 USD za milion tokenów wejścia i 20 USD za milion tokenów wyjścia, a GPT-6 Luna — 0,10 i 0,50 USD. Aktualne ceny zbieramy w newsach o modelach.
  • Limity. Plany subskrypcyjne i API mają limity liczone w tokenach lub wiadomościach — długie dokumenty szybciej je wyczerpują.
  • Szybkość. Im dłuższa odpowiedź, tym dłużej trwa, bo model generuje ją token po tokenie.
  • Tryb rozumowania. Modele „myślące” zużywają dodatkowe tokeny na rozumowanie przed odpowiedzią — lepsza jakość w trudnych zadaniach, ale wyższy koszt i czas.

Czym jest okno kontekstowe

Anthropic definiuje okno kontekstowe jako cały tekst, do którego model może się odwołać, generując odpowiedź — łącznie z samą odpowiedzią — i porównuje je do „pamięci roboczej” modelu. W oknie mieszczą się:

  1. instrukcje systemowe aplikacji (których zwykle nie widzisz),
  2. historia rozmowy,
  3. dołączone pliki, wyniki wyszukiwania i narzędzi,
  4. Twoje bieżące pytanie,
  5. odpowiedź, którą model właśnie pisze (w modelach z rozumowaniem — także tokeny rozumowania).

Czego nie ma w oknie, tego dla modelu nie ma. Model nie „pamięta” poprzednich rozmów, chyba że aplikacja celowo dołączy ich fragmenty (tak działają funkcje pamięci w asystentach).

Jak duże są dziś okna

Model / aplikacjaOkno kontekstoweŹródło, stan na
Claude Opus 5.5, Sonnet 5, Fable 5.1 (API)1 mln tokenówprzegląd modeli Anthropic, 26.09.2026
Claude Haiku 4.5 (API)200 tys. tokenówjw.
GPT-6 Astra (API)1,05 mln tokenówdokumentacja OpenAI, 26.09.2026
Aplikacje ChatGPT, Claude, Geminizależnie od planuporównanie asystentów

Dla skali: Anthropic podaje, że milion tokenów to przy obecnym tokenizerze Claude ok. 555 tys. angielskich słów. Osobnym limitem jest maksymalna długość odpowiedzi — dla wymienionych modeli Claude i GPT-6 Astra to 128 tys. tokenów.

W aplikacjach czatowych okno bywa mniejsze niż w API i zależy od planu — w darmowych planach zwykle wyraźnie mniejsze. Szczegóły dla trzech najpopularniejszych asystentów trzymamy w porównaniu.

Więcej nie zawsze znaczy lepiej

Wielkie okno kusi, żeby wrzucić do modelu wszystko. To często błąd:

  • Spada jakość. Anthropic opisuje zjawisko context rot: wraz ze wzrostem liczby tokenów spada dokładność i zdolność przypominania. Badanie „Lost in the Middle” (Liu i in., 2023) pokazało, że modele najlepiej wykorzystują informacje z początku i końca kontekstu, a wyraźnie gorzej — ze środka.
  • Rośnie koszt. Płacisz za każdy token w oknie przy każdym zapytaniu. U części dostawców długi kontekst jest dodatkowo droższy — OpenAI podnosi stawki dla zapytań powyżej 272 tys. tokenów.
  • Rośnie czas odpowiedzi. Więcej tekstu to więcej obliczeń przed pierwszym słowem odpowiedzi.

Z drugiej strony: gdy materiał jest niewielki, najprostszym rozwiązaniem jest właśnie wkleić go w całości. Anthropic w tekście o Contextual Retrieval radzi, że jeśli baza wiedzy ma mniej niż 200 tys. tokenów (ok. 500 stron), można po prostu umieścić ją w całości w prompcie — bez budowania RAG.

Jak pracować z długimi materiałami — praktyczne zasady

  1. Nowy temat = nowa rozmowa. Długi wątek o wszystkim naraz to prosta droga do „zapominania” ustaleń. Zacznij od nowa i wklej krótkie streszczenie tego, co ważne.
  2. Najważniejsze na początek i na koniec. Kluczowe instrukcje i pytanie umieść na początku lub na końcu promptu, a nie w środku długiego dokumentu.
  3. Dawaj fragmenty, nie archiwa. Zamiast 300 stron wklej rozdział, którego dotyczy pytanie. Przy dużych i zmiennych zbiorach dokumentów sięgnij po RAG — zob. RAG w praktyce.
  4. Proś o cytaty. Przy długich dokumentach wymagaj dosłownych cytatów — łatwiej sprawdzisz, czy model nie pomylił fragmentów (zob. halucynacje AI).
  5. Licz przed wysłaniem. W zastosowaniach firmowych i w API policz tokeny dużych plików przed wysłaniem — to najprostszy sposób, by uniknąć niespodzianek w rachunku.

Co dalej

Najczęstsze pytania

Ile tokenów ma polskie słowo?
Nie ma jednej liczby. Przeliczniki dostawców dotyczą angielskiego (OpenAI: ok. 4 znaki na token; Anthropic: ok. 3,5 znaku), a obaj zastrzegają, że w innych językach proporcje są inne. Zależy to też od modelu — Anthropic podaje, że nowszy tokenizer Claude liczy ten sam tekst na ok. 30% więcej tokenów niż wcześniejsze modele. Dla swojego tekstu użyj licznika tokenów dostawcy.
Czy większe okno kontekstowe oznacza lepsze odpowiedzi?
Nie automatycznie. Duże okno pozwala zmieścić więcej materiału, ale Anthropic opisuje spadek dokładności wraz ze wzrostem liczby tokenów (context rot), a badania pokazały, że modele gorzej korzystają z informacji ze środka długiego kontekstu. Najlepsze wyniki daje zwykle podanie tylko tych fragmentów, które są potrzebne.
Co się dzieje, gdy przekroczę okno kontekstowe?
W API zapytanie przekraczające limit zwykle kończy się błędem i trzeba je skrócić. Aplikacje czatowe radzą sobie różnie: część streszcza lub pomija starsze fragmenty rozmowy. W praktyce objawia się to tym, że model „zapomina” ustalenia z początku długiej rozmowy — wtedy warto zacząć nowy czat ze streszczeniem najważniejszych ustaleń.
Dlaczego płacę też za odpowiedź, a nie tylko za pytanie?
Bo model generuje odpowiedź token po tokenie i każdy wygenerowany token to praca obliczeniowa. Dostawcy wyceniają osobno tokeny wejścia i wyjścia, a wyjście jest zwykle kilka razy droższe. Modele z trybem rozumowania zużywają dodatkowe tokeny na „myślenie”, co podnosi koszt i czas odpowiedzi.

Źródła

  1. Understanding and counting tokens — OpenAI Help Center (dostęp: )
  2. Context windows — Anthropic (dostęp: )
  3. Token counting — Anthropic (dostęp: )
  4. Models overview (okna kontekstowe, limity odpowiedzi, przelicznik słów) — Anthropic (dostęp: )
  5. GPT-6 Astra — dokumentacja modelu — OpenAI (dostęp: )
  6. API pricing (dopłata za kontekst powyżej 272 tys. tokenów) — OpenAI (dostęp: )
  7. Lost in the Middle: How Language Models Use Long Contexts — arXiv (Liu i in., 2023) (dostęp: )
  8. Introducing Contextual Retrieval — Anthropic (19.09.2024) (dostęp: )