학습 데이터·후속학습AI2
Tülu 3
Tülu 3 — SFT에서 DPO, RLVR로 이어지는 전체 레시피 공개
왜 중요한가
선호 학습에서 검증 가능 보상으로의 전환점
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2411.151242026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각11.21Tülu 3 전면 오픈 및 RLVR 정식화공식 발표
Tülu 3 — SFT에서 DPO, RLVR로 이어지는 전체 레시피 공개
선호 학습에서 검증 가능 보상으로의 전환점