학습 데이터·후속학습NeoHorse Team
재귀적 자기개선(RSI)을 에이전틱 post-training 으로 구현하려는 에이전트 네이티브 모델군 Neo…
재귀적 자기개선(RSI)을 에이전틱 post-training 으로 구현하려는 에이전트 네이티브 모델군 NeoHorse-1 을 제시함. 이종 모델 풀과 지능형 라우팅을 결합해 사용자 턴마다 예측된 능력 수요·선택된 서비스 티어·후속 상호작용을 기록하고, 이를 추론·도구 호출·하네스 맥락이 보존된 학습 예제로 바꾼 뒤 구조 검증과 6차원 의미 평가, 서브신 단위 라벨링을 거쳐 채택함. 라우팅 신호로 SFT 를 3단계 커리큘럼으로 조직하고 라우팅 유도 on-policy distillation 으로 확장해 평가-선택-갱신 루프를 닫음. 저자 주장으로 하네스 기반 에이전트·도구 사용·코딩·지시 따르기를 포함한 11개 벤치마크 매크로 평균이 4B 는 58.94→64.87, 9B 는 65.60→69.04 로 올랐다고 밝힘.
왜 중요한가
서빙 중 발생하는 라우팅 로그를 다음 학습 데이터로 되먹이는 구조로, 배포와 학습의 경계가 사라지는 자기개선 루프의 초기 프로토타입이다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.081832026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문