학습 데이터·후속학습Radixark(Miles 팀)
프런티어급 post-training 을 위한 풀스택 RL 학습 시스템 Miles v0.1 을 공개함
프런티어급 post-training 을 위한 풀스택 RL 학습 시스템 Miles v0.1 을 공개함. SGLang 기반 롤아웃 엔진, Megatron-LM 과 PyTorch FSDP 두 트레이너 백엔드, 배포 토폴로지별 3종 가중치 동기화 전송 경로를 제공하며 전체 파라미터 RL 외에 LoRA RL, on-policy distillation, SFT, true-on-policy 롤아웃-학습 정렬과 디퓨전 모델까지 같은 아키텍처로 확장함. 저자 주장으로 GLM-5.2 744B-A40B 를 NVIDIA GB300 64장에서 터미널 코딩 과제 대상 완전 비동기 에이전틱 RL 로 학습해 초기 30스텝 기준 중앙값 스텝 시간 263초를 기록했다고 밝힘.
왜 중요한가
수천억 파라미터급 에이전틱 RL 인프라가 오픈소스로 나오면서 프런티어 post-training 의 진입 장벽이 소수 대형 랩 밖으로 내려갔다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.083682026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문