agentarium.pl

RLHF (uczenie ze wzmocnieniem na podstawie opinii ludzi)

Aktualizacja: · zob. też: reinforcement learning from human feedback, uczenie ze wzmocnieniem z ludzką informacją zwrotną

Po pretreningu model językowy umie przewidywać kolejne tokeny, ale nie wie, jaka odpowiedź jest dla człowieka pomocna. RLHF uczy go tego w kilku krokach: najpierw model jest dostrajany na wzorcowych odpowiedziach, potem ludzie układają jego odpowiedzi w rankingi, a na koniec model jest trenowany tak, by częściej dawał odpowiedzi podobne do wysoko ocenionych.

Dlaczego to ważne: w pracy o InstructGPT (OpenAI, 2022) ludzie woleli odpowiedzi modelu z 1,3 mld parametrów dostrojonego w ten sposób od odpowiedzi 175-miliardowego GPT-3 bez takiego dostrojenia. Rozmiar to nie wszystko.

Ograniczenie: model uczy się tego, co ludzie oceniają wysoko — a przekonująco brzmiąca odpowiedź nie zawsze jest prawdziwa. To jeden z powodów, dla których modele potrafią się mylić z pewnym siebie tonem (halucynacje).

Źródła

  1. Training language models to follow instructions with human feedback — arXiv (OpenAI, 2022) (dostęp: )