agentarium.pl

Halucynacje AI — czym są, skąd się biorą i jak ich unikać (praktyczny przewodnik)

Redakcja agentarium.pl Publikacja: 6 min czytania
  • Poziom: początkujący
  • Początkujący
  • Marketing
  • Biznes
  • Deweloperzy

To rozwinięcie hasła halucynacje AI ze słownika. Jeśli chcesz najpierw zrozumieć, jak w ogóle działa model językowy, zajrzyj do przewodnika Jak działa sztuczna inteligencja.

Czym jest halucynacja

OpenAI definiuje halucynacje jako „wiarygodnie brzmiące, ale fałszywe stwierdzenia generowane przez modele językowe”. Kluczowe jest słowo „wiarygodnie”: halucynacja nie wygląda jak błąd. Ma ten sam pewny ton, poprawną polszczyznę i konkretne szczegóły co prawdziwa odpowiedź.

Najczęstsze postaci, które spotkasz w praktyce:

RodzajPrzykładDlaczego groźne
Zmyślony faktNieistniejąca funkcja programu, błędna data premieryTrudno wychwycić bez sprawdzenia u źródła
Zmyślone źródło lub cytatTytuł raportu, artykułu czy wyroku, który nie istniejeWygląda na dowód, więc usypia czujność
Błędna liczbaCena, statystyka, wynik obliczeniaLiczby „brzmią” precyzyjnie, więc rzadko je kwestionujemy
Przeinaczony dokumentStreszczenie, które twierdzi coś odwrotnego niż tekstMyślisz, że pracujesz na swoich danych
DopowiedzenieSzczegół, którego w dokumencie nie ma i nie da się go sprawdzićMiesza się z prawdziwą treścią

Badacze rozróżniają dwa typy: halucynacje wewnętrzne — sprzeczne z materiałem źródłowym, który model dostał — oraz zewnętrzne, których nie da się zweryfikować na podstawie tego materiału (tak dzieli je przegląd Ji i in. w ACM Computing Surveys). W praktyce oznacza to, że nawet gdy dasz modelowi dokument, musisz sprawdzać i przeinaczenia, i dopowiedzenia.

Dlaczego modele halucynują

1. Model przewiduje tekst, a nie sprawdza prawdę. Duży model językowy generuje odpowiedź token po tokenie, wybierając prawdopodobne kontynuacje. Jeśli w danych treningowych brakowało informacji albo była niejednoznaczna, model i tak wygeneruje coś, co pasuje do wzorca — bo tak został zbudowany.

2. Trening nagradza zgadywanie. OpenAI w analizie z 5 września 2025 roku pokazuje, że standardowe procedury treningu i oceny modeli nagradzają zgadywanie bardziej niż przyznanie się do niepewności. Porównuje to do testu wielokrotnego wyboru: kto zostawi puste pole, dostaje zero punktów, a kto zgaduje — czasem trafi. Model „uczony pod test” też woli strzelać, niż odpowiedzieć „nie wiem”.

3. Luki i data odcięcia wiedzy. Model nie zna wydarzeń po dacie zebrania danych i słabo zna tematy rzadkie: lokalne przepisy, małe firmy, niszowe produkty, polskie realia. W takich tematach ryzyko zmyśleń jest szczególnie wysokie.

4. Długi kontekst. Im więcej tekstu w oknie kontekstowym, tym trudniej modelowi wiernie z niego korzystać. Anthropic w dokumentacji nazywa to context rot: wraz ze wzrostem liczby tokenów spada dokładność i przypominanie. Badanie „Lost in the Middle” (2023) wykazało, że modele najlepiej wykorzystują informacje z początku i końca kontekstu, a gorzej — ze środka.

Kiedy ryzyko jest największe

Weryfikuj zawsze, gdy odpowiedź zawiera:

  • konkretne liczby — ceny, statystyki, daty, wyniki obliczeń;
  • źródła i cytaty — tytuły publikacji, linki, cytaty „słowo w słowo”;
  • prawo, podatki, zdrowie, finanse — przepisy, orzeczenia, dawki, stawki;
  • tematy świeże lub niszowe — nowe produkty, lokalne firmy, wydarzenia po dacie odcięcia wiedzy;
  • informacje o konkretnych osobach — życiorysy, wypowiedzi, powiązania.

Dwa głośne przypadki — i czego uczą

Mata v. Avianca (USA, 2023). Prawnicy złożyli w sądzie federalnym pismo z orzeczeniami, które nie istniały — wygenerował je ChatGPT, razem z fałszywymi cytatami. W postanowieniu z 22 czerwca 2023 roku sąd podkreślił, że samo korzystanie z rzetelnego narzędzia AI nie jest niczym niewłaściwym, ale prawnicy porzucili swoje obowiązki, przedkładając nieistniejące orzeczenia, i nałożył na nich karę 5 tys. USD. Lekcja: narzędzie nie przejmuje odpowiedzialności — każde źródło trzeba otworzyć i przeczytać.

Moffatt v. Air Canada (Kanada, 2024). Chatbot linii lotniczej błędnie opisał klientowi zasady zniżki. Przewoźnik bronił się, że chatbot jest odrębnym bytem odpowiedzialnym za swoje działania — trybunał nazwał to „niezwykłym twierdzeniem” i orzekł 14 lutego 2024 roku, że Air Canada nie dołożyła należytej staranności, by jej chatbot był dokładny. Lekcja: firma odpowiada za to, co mówi jej bot, więc bot musi odpowiadać na podstawie zweryfikowanej wiedzy.

Jak ograniczać halucynacje — checklista użytkownika

  1. Dawaj źródło zamiast liczyć na pamięć modelu. Wklej dokument, załącz plik, włącz wyszukiwanie w sieci. Odpowiedź „z pamięci” to najgorszy wariant przy faktach.
  2. Pozwól na „nie wiem”. Dopisz: „Jeśli nie masz pewności albo informacji nie ma w materiale, napisz to wprost”. Anthropic wymienia to jako pierwszą technikę ograniczania halucynacji.
  3. Proś o dosłowne cytaty. „Do każdego twierdzenia dodaj dosłowny cytat z dokumentu”. Cytat łatwo sprawdzić, a model, który musi go podać, rzadziej dopowiada.
  4. Sprawdzaj źródła, a nie tylko to, czy są. Otwórz link i przeczytaj, czy mówi to, co przypisał mu model.
  5. Dziel pytania. Jedno konkretne pytanie daje mniej miejsca na zmyślenie niż pięć naraz.
  6. Liczby licz osobno. Obliczenia zlecaj w arkuszu albo poproś o wykonanie kodu, zamiast ufać wynikowi w tekście.
  7. Przy wysokiej stawce — druga para oczu. Prawo, finanse, zdrowie, publikacje: weryfikuje człowiek, najlepiej ze źródłem pierwotnym.

Gotowy szablon do skopiowania:

Odpowiedz wyłącznie na podstawie dokumentu poniżej.
Do każdego twierdzenia dodaj dosłowny cytat z dokumentu w cudzysłowie.
Jeśli odpowiedzi nie ma w dokumencie, napisz: „Nie znalazłem tego w dokumencie”.
Nie uzupełniaj braków własną wiedzą.

<dokument>
[wklej treść]
</dokument>

Pytanie: [Twoje pytanie]

Więcej zasad dobrego polecenia: jak pisać dobre prompty i najczęstsze błędy w korzystaniu z AI.

Jak ograniczać halucynacje — gdy budujesz rozwiązanie

Anthropic w przewodniku „Reduce hallucinations” zaleca techniki podstawowe — pozwolenie modelowi na „nie wiem”, ugruntowanie odpowiedzi w dosłownych cytatach, weryfikację przez cytowania — oraz zaawansowane: weryfikację rozumowania krok po kroku, porównanie kilku odpowiedzi (best-of-N), iteracyjne poprawki i ograniczenie modelu do dostarczonej wiedzy. W praktyce projektowej przekłada się to na:

  • RAG zamiast wiedzy modelu. Model dostaje wyszukane fragmenty Twoich dokumentów i odpowiada na ich podstawie. Autorzy pierwszej pracy o RAG (Lewis i in., 2020) pokazali, że takie modele generują bardziej konkretny i zgodny z faktami tekst niż model bez dostępu do zewnętrznej wiedzy. Wdrożenie krok po kroku: RAG w praktyce.
  • Ścieżka „nie wiem” w produkcie. Brak odpowiedzi to poprawny wynik, a nie porażka — i powinien prowadzić do człowieka albo do źródła.
  • Cytowania w interfejsie. Pokazuj użytkownikowi, z którego fragmentu pochodzi odpowiedź.
  • Ewaluacja na własnych danych. Zestaw 30–50 realnych pytań z wzorcowymi odpowiedziami, w tym pytań bez odpowiedzi w bazie. Mierz odsetek poprawnych „nie wiem”, a nie tylko trafność.
  • Walidacja wyników. Liczby, identyfikatory i formaty sprawdzaj kodem, zanim trafią dalej.
  • Człowiek w pętli przy wysokiej stawce. Zwłaszcza w agentach AI, które nie tylko mówią, ale też działają — zob. bezpieczeństwo agentów AI.

Anthropic zaznacza, że te techniki mocno ograniczają halucynacje, ale ich nie eliminują. Dlatego ostatnim zabezpieczeniem zawsze jest proces: kto sprawdza, co i kiedy.

Co dalej

Najczęstsze pytania

Czy da się całkowicie wyeliminować halucynacje?
Nie. Nawet dostawcy modeli piszą, że techniki ograniczania halucynacji nie usuwają ich całkowicie. Możesz za to mocno obniżyć ich liczbę (źródła w kontekście, pozwolenie na „nie wiem”, cytaty) i ustawić proces tak, żeby błąd został wychwycony, zanim zaszkodzi — przez weryfikację człowieka tam, gdzie stawka jest wysoka.
Czy wyszukiwanie w sieci w ChatGPT, Claude czy Gemini rozwiązuje problem?
Pomaga, bo model odpowiada na podstawie świeżych stron i podaje linki. Ale nadal może źle streścić źródło, pomieszać fakty z kilku stron albo oprzeć się na słabej stronie. Klikaj w podane źródła i sprawdzaj, czy naprawdę mówią to, co przypisał im model.
Skąd mam wiedzieć, że model halucynuje?
Z samej odpowiedzi zwykle się nie dowiesz — halucynacje brzmią tak samo pewnie jak prawda. Sygnały ostrzegawcze to bardzo konkretne liczby, daty, nazwiska i tytuły bez źródła, cytaty „z pamięci”, odwołania do przepisów lub wyroków oraz tematy niszowe, lokalne albo świeże. W takich miejscach weryfikuj zawsze.
Czy nowsze modele halucynują mniej?
Dostawcy regularnie deklarują poprawę, ale żaden model nie jest od halucynacji wolny, a wyniki w testach producentów nie przekładają się wprost na Twoje zadania. Najpewniejszy sprawdzian to własny zestaw pytań z wzorcowymi odpowiedziami, w tym pytań, na które poprawna odpowiedź brzmi „nie wiem”.
Kto odpowiada za błąd chatbota w firmie?
Firma, która go wdrożyła. W sprawie Moffatt v. Air Canada (2024) kanadyjski trybunał uznał, że przewoźnik odpowiada za błędną informację swojego chatbota i odrzucił argument, że chatbot jest „odrębnym bytem”. To mocny argument za tym, by chatbot odpowiadał tylko na podstawie zweryfikowanej wiedzy i wiedział, kiedy przekazać sprawę człowiekowi.

Źródła

  1. Why language models hallucinate — OpenAI (5.09.2025) (dostęp: )
  2. Why Language Models Hallucinate (Kalai i in., 2025) — arXiv (dostęp: )
  3. Reduce hallucinations — Anthropic (dostęp: )
  4. Survey of Hallucination in Natural Language Generation (Ji i in.) — arXiv / ACM Computing Surveys (dostęp: )
  5. Context windows (context rot) — Anthropic (dostęp: )
  6. Lost in the Middle: How Language Models Use Long Contexts — arXiv (Liu i in., 2023) (dostęp: )
  7. Mata v. Avianca, Inc. — Opinion and Order on Sanctions (S.D.N.Y., 22.06.2023) — CourtListener (dostęp: )
  8. Moffatt v. Air Canada, 2024 BCCRT 149 (14.02.2024) — Civil Resolution Tribunal (Kolumbia Brytyjska) (dostęp: )
  9. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — arXiv (Lewis i in., 2020) (dostęp: )