한국어EN
모델 아키텍처·학습 기법Intern-NCP Team

다음 토큰 예측(NTP)에 더해 여러 토큰에 걸친 이산 '개념'을 예측하는 Next Concept Predi…

다음 토큰 예측(NTP)에 더해 여러 토큰에 걸친 이산 '개념'을 예측하는 Next Concept Prediction(NCP) 목적함수를 도입한 잠재공간 언어모델 NCP-ArchPreview 를 제시함. 은닉 상태에서 곱 양자화 개념 어휘를 만들어 잠재공간을 구성하고 전용 Concept Module 이 미래 개념을 예측한 뒤 이를 토큰 수준으로 되먹여 생성을 유도하며 NTP 와 NCP 를 end-to-end 공동 학습함. 8.9B 파라미터·Dolma-3 5.73T 토큰 규모로 잠재공간 언어모델 중 최대이며, 저자 주장으로 전체 학습 토큰의 51.3% 만 쓴 시점에 OLMo-3-7B 의 최종 사전학습 손실에 도달하고 최종 다운스트림 매크로 평균에서 2.45점(GSM8K 5.99점) 앞섰다고 밝힘. 17M 파라미터 VQ 모듈만 갱신하는 경량 도메인 적응과 DFlash2 드래프터에 개념 표현을 주입해 평균 수용 길이를 4.17% 개선하는 활용도 보고함.

왜 중요한가

토큰 단위 자기회귀라는 LLM 의 기본 학습 목표를 개념 단위 잠재 예측으로 확장한 사례로, 아키텍처 층위의 사전학습 효율 개선 경로를 제시한다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.107152026년 9월 14일에 더한 조각 · 그 주 보기