툴·에이전트Junyao Yang 외
클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…
클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B 총파라미터 MoE 모델 T1 을 강화학습으로 학습함. 통과한 검증기 개수를 절대값으로 채점하는 조밀한 프로세스 보상으로 액터-크리틱 학습을 웜스타트하고, 샘플링된 토큰 식별자 그대로 학습하며 턴 경계에서 드리프트를 보정하는 TITO 구성과 샘플러의 MoE 레이어별 전문가 선택을 기록해 재생하는 rollout routing replay(R3)로 최적화를 안정화함. 저자 주장으로 학습-추론 로그확률 차이를 0.021에서 0.013으로 줄이고 손실 영역 토큰 드리프트를 0으로 맞췄으며, Terminal-Bench 2.1 과 분리된 시드·합성 과제만으로 학습했음에도 Terminal-Bench 2.1 해결률이 기본 모델 43.8%에서 64.0%로 올랐고 Long-Horizon Terminal Bench 에서 27.9%로 GPT-5.4·GLM-5.1 을 앞섰다고 밝힘.
왜 중요한가
장기 지평 에이전트 RL 의 고질적 병목인 학습-추론 불일치를 토큰·라우팅 수준에서 제거한 레시피로, 실제 터미널 환경 에이전트 학습의 실무 기준을 끌어올렸다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.110422026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10GPT-Live-1 API 공개공식 발표