Token
Aktualizacja: · zob. też: tokeny, tokenizacja
Zanim LLM przetworzy tekst, dzieli go na tokeny (tokenizacja). Token bywa całym słowem („kot”), jego fragmentem („nie-praw-do-po-dob-ny”) albo znakiem.
Dlaczego to ważne:
- Koszt — dostawcy zwykle naliczają opłaty za tokeny wejścia i wyjścia.
- Limity — ile tekstu model „pomieści” naraz, określa okno kontekstowe.
Ile to tokenów? Dostawcy podają przeliczniki dla angielskiego: według OpenAI 1 token to ok. 4 znaki, czyli ok. ¾ słowa; według Anthropic token Claude to ok. 3,5 angielskiego znaku. Obaj zastrzegają, że w innych językach — także w polskim — proporcje są inne. Dokładną liczbę dla swojego tekstu sprawdzisz narzędziem do liczenia tokenów u dostawcy.
Źródła
- Understanding and counting tokens — OpenAI Help Center (dostęp: )
- Glossary (token) — Anthropic (dostęp: )