한국어EN
학습 데이터·후속학습NeoHorse Team

재귀적 자기개선(RSI)을 에이전틱 post-training 으로 구현하려는 에이전트 네이티브 모델군 Neo…

재귀적 자기개선(RSI)을 에이전틱 post-training 으로 구현하려는 에이전트 네이티브 모델군 NeoHorse-1 을 제시함. 이종 모델 풀과 지능형 라우팅을 결합해 사용자 턴마다 예측된 능력 수요·선택된 서비스 티어·후속 상호작용을 기록하고, 이를 추론·도구 호출·하네스 맥락이 보존된 학습 예제로 바꾼 뒤 구조 검증과 6차원 의미 평가, 서브신 단위 라벨링을 거쳐 채택함. 라우팅 신호로 SFT 를 3단계 커리큘럼으로 조직하고 라우팅 유도 on-policy distillation 으로 확장해 평가-선택-갱신 루프를 닫음. 저자 주장으로 하네스 기반 에이전트·도구 사용·코딩·지시 따르기를 포함한 11개 벤치마크 매크로 평균이 4B 는 58.94→64.87, 9B 는 65.60→69.04 로 올랐다고 밝힘.

왜 중요한가

서빙 중 발생하는 라우팅 로그를 다음 학습 데이터로 되먹이는 구조로, 배포와 학습의 경계가 사라지는 자기개선 루프의 초기 프로토타입이다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.081832026년 9월 14일에 더한 조각 · 그 주 보기