언어 모델 중심의 RLHF 및 사후 학습 입문서
책을 따라가는 전체 강좌와 추가 자료, 저자가 진행한 다른 강의를 모았습니다.
이 자료가 연구에 유용했다면 인용해 주세요!
@book{rlhf2026lambert,
author = {Nathan Lambert},
title = {Reinforcement Learning from Human Feedback},
year = {2026},
publisher = {Online},
url = {https://rlhfbook.com}
}