RLHF (uczenie ze wzmocnieniem na podstawie opinii ludzi)
Aktualizacja: · zob. też: reinforcement learning from human feedback, uczenie ze wzmocnieniem z ludzką informacją zwrotną
Po pretreningu model językowy umie przewidywać kolejne tokeny, ale nie wie, jaka odpowiedź jest dla człowieka pomocna. RLHF uczy go tego w kilku krokach: najpierw model jest dostrajany na wzorcowych odpowiedziach, potem ludzie układają jego odpowiedzi w rankingi, a na koniec model jest trenowany tak, by częściej dawał odpowiedzi podobne do wysoko ocenionych.
Dlaczego to ważne: w pracy o InstructGPT (OpenAI, 2022) ludzie woleli odpowiedzi modelu z 1,3 mld parametrów dostrojonego w ten sposób od odpowiedzi 175-miliardowego GPT-3 bez takiego dostrojenia. Rozmiar to nie wszystko.
Ograniczenie: model uczy się tego, co ludzie oceniają wysoko — a przekonująco brzmiąca odpowiedź nie zawsze jest prawdziwa. To jeden z powodów, dla których modele potrafią się mylić z pewnym siebie tonem (halucynacje).
Źródła
- Training language models to follow instructions with human feedback — arXiv (OpenAI, 2022) (dostęp: )