콘텐츠로 이동

사후학습과 정렬 심화

지시 순응·선호 최적화·안전 정렬을 설계하는 모델 개발자와 연구자 대상의 핵심 개념부터 평가·운영·통제까지 백과 문서를 순서대로 연결한 전문 학습 코스다.

대상: 지시 순응·선호 최적화·안전 정렬을 설계하는 모델 개발자와 연구자

  1. 미세조정
  2. 지도 미세조정
  3. 지시 튜닝
  4. 선호 데이터
  5. 쌍대 선호 순위화
  6. 보상 모델
  7. 결과 보상 모델
  8. 과정 보상 모델
  9. 인간 피드백 기반 강화학습
  10. AI 피드백 기반 강화학습
  11. 직접 선호 최적화
  12. 오프라인 선호 학습
  13. 온라인 선호 학습
  14. 선호 손실
  15. LLM용 근접 정책 최적화
  16. 기각 표본추출
  17. 헌법적 AI
  18. 보상 해킹
  19. AI 정렬
  20. 선호 데이터 거버넌스
  21. 보상 모델 교정
  22. 사후학습 제거 실험
  23. 정렬 역량 보존
  24. 선호 변화 관측