agentarium.pl

Jak działa sztuczna inteligencja — bez magii. Przewodnik dla początkujących

Redakcja agentarium.pl Publikacja: 7 min czytania
  • Poziom: początkujący
  • Początkujący
  • Marketing
  • Biznes

W tym przewodniku znajdziesz:

  • czym jest AI w sensie, w jakim używa się tego słowa dziś (i w prawie UE),
  • mapę pojęć: AI, uczenie maszynowe, deep learning, generatywna AI i LLM,
  • jak maszyna się uczy i czym trening różni się od codziennego używania modelu,
  • co się dzieje, gdy piszesz do czatu, krok po kroku,
  • gdzie są granice i skąd biorą się błędy,
  • co z tego wynika w praktyce dla początkujących, biznesu i deweloperów.

Czym jest sztuczna inteligencja

Sztuczna inteligencja to dziedzina informatyki, która buduje systemy wykonujące zadania kojarzone z ludzką inteligencją: rozumienie języka, rozpoznawanie obrazów, przewidywanie, podejmowanie decyzji. Unijny AI Act (art. 3 pkt 1) definiuje system AI jako system maszynowy działający z różnym poziomem autonomii, który „wnioskuje, jak generować na podstawie otrzymanych danych wejściowych wyniki, takie jak predykcje, treści, zalecenia lub decyzje”. Niemal identyczną definicję przyjęła OECD — to dziś wspólny język prawa i polityki.

Kluczowe jest słowo „wnioskuje”. Klasyczny program robi dokładnie to, co zapisał programista. System AI dostaje przykłady i sam wyciąga z nich wzorce, które potem stosuje do nowych danych.

Gdy dziś ktoś mówi „AI”, zwykle ma na myśli generatywną AI — modele, które tworzą nowy tekst, obraz, dźwięk czy kod. To jednak tylko najbardziej widoczna część dziedziny. Filtr antyspamowy, rekomendacje w sklepie czy wykrywanie oszustw na karcie to też AI, tylko mniej efektowna.

Mapa pojęć: co w czym się mieści

PojęcieCo to jestPrzykład
Sztuczna inteligencjaCała dziedzina: systemy wykonujące zadania „inteligentne”Asystent głosowy, system rekomendacji
Uczenie maszynoweCzęść AI: system uczy się z przykładów, a nie z regułFiltr spamu wytrenowany na oznaczonych mailach
Deep learningUczenie maszynowe na wielowarstwowych sieciach neuronowychRozpoznawanie twarzy na zdjęciach
Generatywna AIModele tworzące nowe treściGenerator obrazów, czat piszący maila
LLMDuży model językowy — generatywna AI dla tekstuModele w ChatGPT, Claude, Gemini

Każdy wiersz mieści się w poprzednim: LLM to rodzaj generatywnej AI, ta opiera się na deep learningu, deep learning jest odmianą uczenia maszynowego, a uczenie maszynowe częścią AI.

Jak maszyna się uczy

Google w swoim kursie uczenia maszynowego opisuje je jako proces trenowania oprogramowania — modelu — tak, by na podstawie danych robił użyteczne przewidywania albo generował treści. W praktyce wygląda to tak. Weźmy filtr spamu. Zamiast wypisywać reguły („jeśli temat zawiera słowo PROMOCJA…”), pokazujesz systemowi tysiące maili oznaczonych jako „spam” i „nie spam”. System szuka cech, które odróżniają jedne od drugich, i zapisuje je jako liczby — tak zwane parametry. Każdy błąd na przykładach treningowych lekko koryguje te liczby, aż model zacznie trafiać.

Z tego wynikają trzy rzeczy, które warto zapamiętać:

  1. Model jest tak dobry jak jego dane treningowe. Jeśli w danych czegoś brakuje albo są w nich błędy i uprzedzenia, model je powieli.
  2. Wiedza siedzi w parametrach, a nie w bazie faktów. Nie da się w modelu „wyszukać” zdania, które przeczytał. Można tylko zapytać i zobaczyć, co wygeneruje.
  3. Trening i używanie to dwa różne etapy. Trening jest drogi i odbywa się raz na jakiś czas. Codzienne używanie gotowego modelu to inferencja: model niczego się wtedy nie uczy, tylko stosuje to, czego nauczył się wcześniej.

Co się dzieje, gdy piszesz do czatu

Pod spodem ChatGPT, Claude czy Gemini działa duży model językowy. Oto uproszczony przebieg jednej odpowiedzi:

  1. Tekst zamienia się w tokeny. Twoje pytanie, historia rozmowy i dołączone pliki są dzielone na tokeny — fragmenty słów, całe słowa lub znaki.
  2. Model patrzy na cały kontekst naraz. Wszystko, co mieści się w oknie kontekstowym, trafia do modelu jednocześnie. Architektura transformer, opisana w 2017 roku w pracy „Attention Is All You Need”, pozwala mu ocenić, które fragmenty są ważne dla kolejnego słowa (mechanizm uwagi).
  3. Model przewiduje jeden kolejny token. Wylicza prawdopodobieństwa dla możliwych kontynuacji i wybiera jedną. Jak bardzo „ryzykownie” wybiera, zależy od ustawień takich jak temperatura (w części najnowszych modeli dostawca ustala ją sam). Google opisuje LLM wprost jako mechanizm autouzupełniania, który potrafi przewidzieć tysiące tokenów.
  4. Powtórka aż do końca odpowiedzi. Wybrany token dopisuje się do tekstu, a model przewiduje następny. Odpowiedź powstaje token po tokenie, stąd efekt „pisania na żywo”.

Skąd więc model umie prowadzić rozmowę, a nie tylko dokańczać zdania? Trening ma zwykle dwa etapy. Najpierw pretrening na ogromnym zbiorze tekstów uczy przewidywać kolejne tokeny. Potem dostrajanie na przykładach dobrych odpowiedzi i ocenach ludzi uczy model wykonywać polecenia i być pomocnym. Ten drugi etap (m.in. uczenie ze wzmocnieniem na podstawie opinii ludzi, RLHF) szczegółowo opisał OpenAI w pracy o modelach InstructGPT z 2022 roku.

Szczegóły — parametry, dostrajanie, rodzaje modeli i to, jak wybrać model do zadania — omawiamy w osobnym tekście: LLM — co to jest model językowy.

Czego AI nie robi (i dlaczego to ważne)

Mechanizm przewidywania kolejnego tokenu wyjaśnia większość zaskakujących zachowań modeli:

  • Nie sprawdza prawdy. Model generuje tekst, który pasuje do wzorców, a nie tekst, który zweryfikował. Stąd halucynacje: zmyślone fakty, źródła czy liczby podane pewnym tonem. OpenAI definiuje je jako „wiarygodnie brzmiące, ale fałszywe stwierdzenia” i w analizie z 5 września 2025 roku wskazuje, że standardowy trening i ocena modeli nagradzają zgadywanie bardziej niż przyznanie się do niepewności. Jak się przed tym bronić, piszemy w tekście Halucynacje AI — czym są i jak ich unikać.
  • Nie zna wydarzeń po dacie odcięcia danych. Wiedza modelu kończy się w dniu, w którym zebrano dane treningowe — Anthropic podaje ją dla każdego modelu Claude jako „reliable knowledge cutoff”. Aktualne informacje dostaje tylko wtedy, gdy aplikacja dołoży mu wyszukiwanie w sieci albo Twoje dokumenty.
  • Widzi tylko to, co jest w kontekście. Czego nie ma w oknie kontekstowym, tego dla modelu nie ma. W bardzo długiej rozmowie wcześniejsze ustalenia mogą wypaść poza okno albo zostać potraktowane jako mniej ważne.
  • Nie liczy jak kalkulator. Działania na liczbach też są przewidywaniem tokenów. Dobre aplikacje przekazują takie zadania do narzędzi (np. wykonania kodu), ale sam model może się pomylić w prostym rachunku.
  • Nie jest deterministyczny. To samo pytanie może dać różne odpowiedzi. Przy faktach traktuj więc pojedynczą odpowiedź jako wstępną, nie jako wyrok.

Od modelu do asystenta i agenta

Sam model to „silnik”. To, czego używasz na co dzień, jest zbudowane wokół niego:

  • Asystent AI (np. aplikacja ChatGPT, Claude, Gemini) = model + interfejs rozmowy + dodatki: wyszukiwanie w sieci, czytanie plików, pamięć ustawień. Porównanie trzech najpopularniejszych znajdziesz w zestawieniu ChatGPT vs Claude vs Gemini.
  • RAG = model, który przed odpowiedzią dostaje wyszukane fragmenty Twoich dokumentów i odpowiada na ich podstawie. To główny sposób na aktualną, firmową wiedzę — zobacz RAG w praktyce.
  • Agent AI = model, który nie tylko odpowiada, ale planuje kroki i używa narzędzi: wyszukuje, klika, wysyła, zapisuje. Wprowadzenie: czym jest agent AI. Do łączenia agentów z systemami służy m.in. standard MCP.

Co z tego wynika w praktyce

Jeśli dopiero zaczynasz:

  • Traktuj AI jak bardzo oczytanego, ale omylnego współpracownika. Deleguj mu szkice, streszczenia i burzę mózgów, a nie ostateczne decyzje.
  • Im więcej kontekstu dasz (cel, odbiorca, przykład, format), tym lepszy wynik — zobacz 10 zasad dobrego promptu.
  • Fakty, liczby, cytaty i źródła sprawdzaj zawsze. To nie wada konkretnego narzędzia, tylko cecha całej technologii.

Jeśli decydujesz w firmie:

  • Wybieraj zastosowania, w których pomyłkę łatwo wychwycić (szkice, klasyfikacja, wyszukiwanie w dokumentach), zanim oddasz AI procesy, w których błąd kosztuje.
  • Wiedzę firmową podawaj przez dokumenty i RAG, a nie licz, że model „zna” Twoje procedury.
  • Pilnuj ustawień prywatności: w części planów rozmowy mogą trafiać do treningu kolejnych modeli.

Jeśli budujesz rozwiązania:

  • Model to komponent probabilistyczny. Projektuj walidację wyników, limity i ścieżkę „nie wiem”.
  • Zanim sięgniesz po dostrajanie modelu, sprawdź, czy nie wystarczy lepszy prompt albo RAG — zob. fine-tuning vs RAG vs prompt.

Co czytać dalej

Materiały w kolejności, w jakiej najlepiej je czytać:

  1. LLM — co to jest model językowy — jak powstaje model, czym są parametry i jak wybrać model do zadania.
  2. Tokeny i okno kontekstowe — ile tekstu model „widzi”, ile to kosztuje i dlaczego więcej nie zawsze znaczy lepiej.
  3. Halucynacje AI — czym są i jak ich unikać — skąd biorą się błędy i jak je ograniczać w praktyce.
  4. Fine-tuning vs RAG vs prompt — jak sprawić, żeby model robił to, czego chcesz, i znał Twoją wiedzę.
  5. Ścieżka nauki AI od zera — plan na 30 dni.
  6. Najczęstsze błędy w korzystaniu z AI.
  7. Słownik AI — krótkie definicje wszystkich pojęć z tego tekstu.

Najczęstsze pytania

Czy sztuczna inteligencja naprawdę myśli?
Nie w ludzkim sensie. Model językowy przetwarza tekst jako ciąg tokenów i wylicza, jaki fragment powinien pojawić się dalej, na podstawie wzorców z treningu. Efekt bywa zaskakująco trafny, bo w danych treningowych jest mnóstwo ludzkiego rozumowania, ale model nie ma intencji, przekonań ani dostępu do prawdy. Dlatego jego pewny ton nic nie mówi o tym, czy ma rację.
Czym różni się AI od uczenia maszynowego i deep learningu?
To pojęcia zagnieżdżone. Sztuczna inteligencja to cała dziedzina. Uczenie maszynowe to jej najważniejsza dziś część: system uczy się z przykładów zamiast z ręcznie wpisanych reguł. Deep learning to uczenie maszynowe na wielowarstwowych sieciach neuronowych, a duże modele językowe to jedno z jego zastosowań.
Skąd model językowy „wie” różne rzeczy?
Z danych treningowych: podczas treningu model przetwarza ogromny zbiór tekstów i utrwala w swoich parametrach wzorce, które pozwalają przewidywać kolejne tokeny. Nie ma w środku bazy faktów, którą można przeszukać. Wiedza kończy się w dniu odcięcia danych treningowych, chyba że aplikacja dołoży wyszukiwanie w sieci albo Twoje dokumenty.
Dlaczego na to samo pytanie dostaję różne odpowiedzi?
Bo model nie zawsze wybiera najbardziej prawdopodobny token, tylko losuje spośród prawdopodobnych, a stopień tej losowości reguluje m.in. temperatura. Anthropic zaznacza w dokumentacji, że nawet przy temperaturze 0 wyniki nie są w pełni deterministyczne. Do tego dochodzą różnice w kontekście (historia rozmowy, ustawienia, pamięć aplikacji). W zadaniach twórczych to zaleta, w faktach i liczbach powód, żeby weryfikować wynik.
Czy AI uczy się z moich rozmów?
Sam model podczas rozmowy się nie zmienia: nie douczy się na bieżąco z tego, co napiszesz. Dostawca może jednak używać rozmów do trenowania kolejnych wersji modeli, zależnie od planu i ustawień prywatności. Szczegóły dla ChatGPT, Claude i Gemini zestawiamy w porównaniu tych asystentów.
Od czego zacząć naukę AI?
Od praktyki: przez tydzień używaj jednego asystenta do własnych zadań, a równolegle poznaj kilka pojęć z tego przewodnika (LLM, token, okno kontekstowe, halucynacje). Rozpisany plan na 30 dni znajdziesz w naszej ścieżce nauki AI od zera.

Źródła

  1. Rozporządzenie (UE) 2024/1689 (AI Act), art. 3 pkt 1 — definicja systemu AI — EUR-Lex (dostęp: )
  2. Recommendation of the Council on Artificial Intelligence (definicja systemu AI, zm. 2023–2024) — OECD (dostęp: )
  3. What is Machine Learning? — Google for Developers (dostęp: )
  4. LLMs: What's a large language model? — Google for Developers (dostęp: )
  5. Attention Is All You Need — arXiv (Vaswani i in., 2017) (dostęp: )
  6. Training language models to follow instructions with human feedback — arXiv (OpenAI, 2022) (dostęp: )
  7. Why language models hallucinate — OpenAI (dostęp: )
  8. Models overview (data odcięcia wiedzy modeli) — Anthropic (dostęp: )
  9. Messages API — parametr temperature — Anthropic (dostęp: )