언어 모델 중심의 RLHF 및 사후 학습 입문서
지시 미세조정된 모델과 그 이후 RLHF로 학습된 대응 모델의 완성을 비교합니다.
여기서 사용하는 모델은 Allen Institute for AI의 오픈소스 사후 학습 파이프라인에서 공개된 OLMo와 Tülu 모델입니다. 중간 단계 모델이 공개되는 일은 전반적으로 드뭅니다. 18개 모델(9개의 SFT/RLHF 쌍)에 대해 고정된 16개 프롬프트 각각에 세 개의 완성을 생성했습니다.
발표나 교육 목적에 이 예시를 자유롭게 사용해도 됩니다. 책과 모델 저자를 인용해 주세요. 데이터는 여기에서 확인할 수 있으며 ODC-BY 라이선스를 따릅니다.
이 자료가 연구에 유용했다면 인용해 주세요!
@book{rlhf2026lambert,
author = {Nathan Lambert},
title = {Reinforcement Learning from Human Feedback},
year = {2026},
publisher = {Online},
url = {https://rlhfbook.com}
}