한국어EN
추론 모델·AGI 논쟁NVIDIA (Nemotron)

올림피아드 수학의 자연어 증명 생성에 대해 post-training 과 test-time 추론 설계의 영향을…

올림피아드 수학의 자연어 증명 생성에 대해 post-training 과 test-time 추론 설계의 영향을 분석하고, Nemotron 3 Ultra 에서 SFT 와 RL 로 두 전문화 체크포인트를 학습한 공개 파이프라인을 제시함. 형식 증명기나 외부 도구, 인터넷 접근 없이 전적으로 자연어로만 동작하며, 일반 공개 모델과 두 전문 체크포인트가 후보 증명을 생성·검증·정제하는 반복 탐색을 돌리고 별도의 고연산 단계가 최종 제출을 고름. 저자 주장으로 이 시스템이 IMO 2026 에서 42점 만점에 30점을 얻어 금메달 기준선에 도달했다고 밝히며 두 체크포인트와 학습 데이터·코드·제출 답안, 올림피아드급 200문항 벤치마크 Nemotron-IMO-Bench 를 공개함.

왜 중요한가

형식 검증기 없이 순수 자연어 추론만으로 IMO 금메달권에 이른 결과를 가중치와 데이터까지 공개한 사례로, 최상위 수학 추론의 재현 가능성을 크게 넓혔다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.107122026년 9월 14일에 더한 조각 · 그 주 보기