한국어EN
학습 데이터·후속학습Radixark(Miles 팀)

프런티어급 post-training 을 위한 풀스택 RL 학습 시스템 Miles v0.1 을 공개함

프런티어급 post-training 을 위한 풀스택 RL 학습 시스템 Miles v0.1 을 공개함. SGLang 기반 롤아웃 엔진, Megatron-LM 과 PyTorch FSDP 두 트레이너 백엔드, 배포 토폴로지별 3종 가중치 동기화 전송 경로를 제공하며 전체 파라미터 RL 외에 LoRA RL, on-policy distillation, SFT, true-on-policy 롤아웃-학습 정렬과 디퓨전 모델까지 같은 아키텍처로 확장함. 저자 주장으로 GLM-5.2 744B-A40B 를 NVIDIA GB300 64장에서 터미널 코딩 과제 대상 완전 비동기 에이전틱 RL 로 학습해 초기 30스텝 기준 중앙값 스텝 시간 263초를 기록했다고 밝힘.

왜 중요한가

수천억 파라미터급 에이전틱 RL 인프라가 오픈소스로 나오면서 프런티어 post-training 의 진입 장벽이 소수 대형 랩 밖으로 내려갔다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.083682026년 9월 14일에 더한 조각 · 그 주 보기