Reinforcement Learning from Human Feedback

언어 모델 중심의 RLHF 및 사후 학습 입문서

Nathan Lambert

강좌

책을 따라가는 전체 강좌와 추가 자료, 저자가 진행한 다른 강의를 모았습니다.

슬라이드 덱은 대체로 Claude Opus로 초안을 만들고, 사람이 상당한 수정을 더해 완성합니다. 예외는 각 덱에 별도로 표시됩니다.

강좌 소개

무엇을 배우게 되는지에 대한 소개와 개요

선수 지식

이 강좌는 대략 AI 분야의 초기 박사과정 또는 석사과정 학생을 염두에 두고 있지만, 충분히 시간을 들여 학습할 의지가 있는 사람이라면 따라올 수 있도록 설계되어 있습니다.

시작하기 위해 강화학습이나 언어 모델링 배경지식이 반드시 필요한 것은 아닙니다. 열심히 공부하는 학습자라면 오늘날의 상위 LLM을 튜터로 활용해 낯선 수학, 코드, 용어를 풀어가며 전체 강좌를 따라갈 수 있습니다. 흥미가 가는 주제를 깊이 파고들고, 영상을 건너뛰거나 순서를 바꾸어 봐도 좋습니다.

전통적인 교과과정 경로를 선호한다면, 보통 언어 모델링/NLP의 기초와 기본 머신러닝(예: AI 입문, ML 입문 수업) 정도가 배경지식입니다.

LLM 사후 학습을 위한 ML 기초

언어 모델링, KL, 교차 엔트로피 등 사후 학습에 필요한 ML 선수 지식을 복습해 강좌에 적응하기 위한 자료

추가 학습 자료

주요 자료

강의 1: 개요

1–3장 · RLHF와 사후 학습의 기초

강의 2: IFT, 보상 모델, 거부 샘플링

4, 5, 9장 · 핵심 최적화 방법 섹션의 시작

강의 3: RL 동기와 수학

6장 1부 · 정책 그래디언트 수학, 직관, 이론

강의 4: RL 구현과 실무

6장 2부 · 코드, 손실 집계, 비동기 학습, 실용적 엔지니어링

Q&A 1: 독자 질문, 1–4강

강의 5: 추론 모델의 부상

7장 · RLVR, 추론 시간 스케일링, 2025년 추론 모델 흐름

강의 6: 직접 선호 최적화

8장 · DPO 단계별 도출, 변형 방법, 실무

대화 1: 2026년 최전선 사후 학습 레시피 (Finbarr Timbers와 함께)

강의 7: 합성 데이터와 현대 사후 학습 방법

12장 · 온-정책 증류, AI 피드백, 헌법적 AI, 루브릭

Q&A 2: 독자 질문, 5–7강

강의 8: "선호도"와 선호도 데이터

10, 11장 · 선호도의 역사, 선호도 데이터 엔진, 답하기 어려운 질문들

추가 자료

강화학습과 언어 모델을 더 깊이 공부할 때 저자가 직접 활용한 외부 자료입니다. 특히 아래 도서들은 좋은 보완 자료입니다.

도서와 강좌

Nathan의 추가 발표

지난 몇 년간 사후 학습을 다루며 진행한 여러 발표를 관련 챕터별로 묶었습니다.

기타 초청 강의와 발표

2026

An Introduction to Reinforcement Learning from Human Feedback and Post-training

SALA 2026 · Quito, Ecuador · March 2026

인용

이 자료가 연구에 유용했다면 인용해 주세요!

@book{rlhf2026lambert,
  author = {Nathan Lambert},
  title = {Reinforcement Learning from Human Feedback},
  year = {2026},
  publisher = {Online},
  url = {https://rlhfbook.com}
}