Jak działa sztuczna inteligencja — bez magii. Przewodnik dla początkujących
- Poziom: początkujący
- Początkujący
- Marketing
- Biznes
W tym przewodniku znajdziesz:
- czym jest AI w sensie, w jakim używa się tego słowa dziś (i w prawie UE),
- mapę pojęć: AI, uczenie maszynowe, deep learning, generatywna AI i LLM,
- jak maszyna się uczy i czym trening różni się od codziennego używania modelu,
- co się dzieje, gdy piszesz do czatu, krok po kroku,
- gdzie są granice i skąd biorą się błędy,
- co z tego wynika w praktyce dla początkujących, biznesu i deweloperów.
Czym jest sztuczna inteligencja
Sztuczna inteligencja to dziedzina informatyki, która buduje systemy wykonujące zadania kojarzone z ludzką inteligencją: rozumienie języka, rozpoznawanie obrazów, przewidywanie, podejmowanie decyzji. Unijny AI Act (art. 3 pkt 1) definiuje system AI jako system maszynowy działający z różnym poziomem autonomii, który „wnioskuje, jak generować na podstawie otrzymanych danych wejściowych wyniki, takie jak predykcje, treści, zalecenia lub decyzje”. Niemal identyczną definicję przyjęła OECD — to dziś wspólny język prawa i polityki.
Kluczowe jest słowo „wnioskuje”. Klasyczny program robi dokładnie to, co zapisał programista. System AI dostaje przykłady i sam wyciąga z nich wzorce, które potem stosuje do nowych danych.
Gdy dziś ktoś mówi „AI”, zwykle ma na myśli generatywną AI — modele, które tworzą nowy tekst, obraz, dźwięk czy kod. To jednak tylko najbardziej widoczna część dziedziny. Filtr antyspamowy, rekomendacje w sklepie czy wykrywanie oszustw na karcie to też AI, tylko mniej efektowna.
Mapa pojęć: co w czym się mieści
| Pojęcie | Co to jest | Przykład |
|---|---|---|
| Sztuczna inteligencja | Cała dziedzina: systemy wykonujące zadania „inteligentne” | Asystent głosowy, system rekomendacji |
| Uczenie maszynowe | Część AI: system uczy się z przykładów, a nie z reguł | Filtr spamu wytrenowany na oznaczonych mailach |
| Deep learning | Uczenie maszynowe na wielowarstwowych sieciach neuronowych | Rozpoznawanie twarzy na zdjęciach |
| Generatywna AI | Modele tworzące nowe treści | Generator obrazów, czat piszący maila |
| LLM | Duży model językowy — generatywna AI dla tekstu | Modele w ChatGPT, Claude, Gemini |
Każdy wiersz mieści się w poprzednim: LLM to rodzaj generatywnej AI, ta opiera się na deep learningu, deep learning jest odmianą uczenia maszynowego, a uczenie maszynowe częścią AI.
Jak maszyna się uczy
Google w swoim kursie uczenia maszynowego opisuje je jako proces trenowania oprogramowania — modelu — tak, by na podstawie danych robił użyteczne przewidywania albo generował treści. W praktyce wygląda to tak. Weźmy filtr spamu. Zamiast wypisywać reguły („jeśli temat zawiera słowo PROMOCJA…”), pokazujesz systemowi tysiące maili oznaczonych jako „spam” i „nie spam”. System szuka cech, które odróżniają jedne od drugich, i zapisuje je jako liczby — tak zwane parametry. Każdy błąd na przykładach treningowych lekko koryguje te liczby, aż model zacznie trafiać.
Z tego wynikają trzy rzeczy, które warto zapamiętać:
- Model jest tak dobry jak jego dane treningowe. Jeśli w danych czegoś brakuje albo są w nich błędy i uprzedzenia, model je powieli.
- Wiedza siedzi w parametrach, a nie w bazie faktów. Nie da się w modelu „wyszukać” zdania, które przeczytał. Można tylko zapytać i zobaczyć, co wygeneruje.
- Trening i używanie to dwa różne etapy. Trening jest drogi i odbywa się raz na jakiś czas. Codzienne używanie gotowego modelu to inferencja: model niczego się wtedy nie uczy, tylko stosuje to, czego nauczył się wcześniej.
Co się dzieje, gdy piszesz do czatu
Pod spodem ChatGPT, Claude czy Gemini działa duży model językowy. Oto uproszczony przebieg jednej odpowiedzi:
- Tekst zamienia się w tokeny. Twoje pytanie, historia rozmowy i dołączone pliki są dzielone na tokeny — fragmenty słów, całe słowa lub znaki.
- Model patrzy na cały kontekst naraz. Wszystko, co mieści się w oknie kontekstowym, trafia do modelu jednocześnie. Architektura transformer, opisana w 2017 roku w pracy „Attention Is All You Need”, pozwala mu ocenić, które fragmenty są ważne dla kolejnego słowa (mechanizm uwagi).
- Model przewiduje jeden kolejny token. Wylicza prawdopodobieństwa dla możliwych kontynuacji i wybiera jedną. Jak bardzo „ryzykownie” wybiera, zależy od ustawień takich jak temperatura (w części najnowszych modeli dostawca ustala ją sam). Google opisuje LLM wprost jako mechanizm autouzupełniania, który potrafi przewidzieć tysiące tokenów.
- Powtórka aż do końca odpowiedzi. Wybrany token dopisuje się do tekstu, a model przewiduje następny. Odpowiedź powstaje token po tokenie, stąd efekt „pisania na żywo”.
Skąd więc model umie prowadzić rozmowę, a nie tylko dokańczać zdania? Trening ma zwykle dwa etapy. Najpierw pretrening na ogromnym zbiorze tekstów uczy przewidywać kolejne tokeny. Potem dostrajanie na przykładach dobrych odpowiedzi i ocenach ludzi uczy model wykonywać polecenia i być pomocnym. Ten drugi etap (m.in. uczenie ze wzmocnieniem na podstawie opinii ludzi, RLHF) szczegółowo opisał OpenAI w pracy o modelach InstructGPT z 2022 roku.
Szczegóły — parametry, dostrajanie, rodzaje modeli i to, jak wybrać model do zadania — omawiamy w osobnym tekście: LLM — co to jest model językowy.
Czego AI nie robi (i dlaczego to ważne)
Mechanizm przewidywania kolejnego tokenu wyjaśnia większość zaskakujących zachowań modeli:
- Nie sprawdza prawdy. Model generuje tekst, który pasuje do wzorców, a nie tekst, który zweryfikował. Stąd halucynacje: zmyślone fakty, źródła czy liczby podane pewnym tonem. OpenAI definiuje je jako „wiarygodnie brzmiące, ale fałszywe stwierdzenia” i w analizie z 5 września 2025 roku wskazuje, że standardowy trening i ocena modeli nagradzają zgadywanie bardziej niż przyznanie się do niepewności. Jak się przed tym bronić, piszemy w tekście Halucynacje AI — czym są i jak ich unikać.
- Nie zna wydarzeń po dacie odcięcia danych. Wiedza modelu kończy się w dniu, w którym zebrano dane treningowe — Anthropic podaje ją dla każdego modelu Claude jako „reliable knowledge cutoff”. Aktualne informacje dostaje tylko wtedy, gdy aplikacja dołoży mu wyszukiwanie w sieci albo Twoje dokumenty.
- Widzi tylko to, co jest w kontekście. Czego nie ma w oknie kontekstowym, tego dla modelu nie ma. W bardzo długiej rozmowie wcześniejsze ustalenia mogą wypaść poza okno albo zostać potraktowane jako mniej ważne.
- Nie liczy jak kalkulator. Działania na liczbach też są przewidywaniem tokenów. Dobre aplikacje przekazują takie zadania do narzędzi (np. wykonania kodu), ale sam model może się pomylić w prostym rachunku.
- Nie jest deterministyczny. To samo pytanie może dać różne odpowiedzi. Przy faktach traktuj więc pojedynczą odpowiedź jako wstępną, nie jako wyrok.
Od modelu do asystenta i agenta
Sam model to „silnik”. To, czego używasz na co dzień, jest zbudowane wokół niego:
- Asystent AI (np. aplikacja ChatGPT, Claude, Gemini) = model + interfejs rozmowy + dodatki: wyszukiwanie w sieci, czytanie plików, pamięć ustawień. Porównanie trzech najpopularniejszych znajdziesz w zestawieniu ChatGPT vs Claude vs Gemini.
- RAG = model, który przed odpowiedzią dostaje wyszukane fragmenty Twoich dokumentów i odpowiada na ich podstawie. To główny sposób na aktualną, firmową wiedzę — zobacz RAG w praktyce.
- Agent AI = model, który nie tylko odpowiada, ale planuje kroki i używa narzędzi: wyszukuje, klika, wysyła, zapisuje. Wprowadzenie: czym jest agent AI. Do łączenia agentów z systemami służy m.in. standard MCP.
Co z tego wynika w praktyce
Jeśli dopiero zaczynasz:
- Traktuj AI jak bardzo oczytanego, ale omylnego współpracownika. Deleguj mu szkice, streszczenia i burzę mózgów, a nie ostateczne decyzje.
- Im więcej kontekstu dasz (cel, odbiorca, przykład, format), tym lepszy wynik — zobacz 10 zasad dobrego promptu.
- Fakty, liczby, cytaty i źródła sprawdzaj zawsze. To nie wada konkretnego narzędzia, tylko cecha całej technologii.
Jeśli decydujesz w firmie:
- Wybieraj zastosowania, w których pomyłkę łatwo wychwycić (szkice, klasyfikacja, wyszukiwanie w dokumentach), zanim oddasz AI procesy, w których błąd kosztuje.
- Wiedzę firmową podawaj przez dokumenty i RAG, a nie licz, że model „zna” Twoje procedury.
- Pilnuj ustawień prywatności: w części planów rozmowy mogą trafiać do treningu kolejnych modeli.
Jeśli budujesz rozwiązania:
- Model to komponent probabilistyczny. Projektuj walidację wyników, limity i ścieżkę „nie wiem”.
- Zanim sięgniesz po dostrajanie modelu, sprawdź, czy nie wystarczy lepszy prompt albo RAG — zob. fine-tuning vs RAG vs prompt.
Co czytać dalej
Materiały w kolejności, w jakiej najlepiej je czytać:
- LLM — co to jest model językowy — jak powstaje model, czym są parametry i jak wybrać model do zadania.
- Tokeny i okno kontekstowe — ile tekstu model „widzi”, ile to kosztuje i dlaczego więcej nie zawsze znaczy lepiej.
- Halucynacje AI — czym są i jak ich unikać — skąd biorą się błędy i jak je ograniczać w praktyce.
- Fine-tuning vs RAG vs prompt — jak sprawić, żeby model robił to, czego chcesz, i znał Twoją wiedzę.
- Ścieżka nauki AI od zera — plan na 30 dni.
- Najczęstsze błędy w korzystaniu z AI.
- Słownik AI — krótkie definicje wszystkich pojęć z tego tekstu.
Najczęstsze pytania
Czy sztuczna inteligencja naprawdę myśli?
Czym różni się AI od uczenia maszynowego i deep learningu?
Skąd model językowy „wie” różne rzeczy?
Dlaczego na to samo pytanie dostaję różne odpowiedzi?
Czy AI uczy się z moich rozmów?
Od czego zacząć naukę AI?
Źródła
- Rozporządzenie (UE) 2024/1689 (AI Act), art. 3 pkt 1 — definicja systemu AI — EUR-Lex (dostęp: )
- Recommendation of the Council on Artificial Intelligence (definicja systemu AI, zm. 2023–2024) — OECD (dostęp: )
- What is Machine Learning? — Google for Developers (dostęp: )
- LLMs: What's a large language model? — Google for Developers (dostęp: )
- Attention Is All You Need — arXiv (Vaswani i in., 2017) (dostęp: )
- Training language models to follow instructions with human feedback — arXiv (OpenAI, 2022) (dostęp: )
- Why language models hallucinate — OpenAI (dostęp: )
- Models overview (data odcięcia wiedzy modeli) — Anthropic (dostęp: )
- Messages API — parametr temperature — Anthropic (dostęp: )