한국어EN
모델 아키텍처·학습 기법Albert Ge 외 (Microsoft Research·UW–Madison)

마스크드 확산 언어모델에 고정 크기 '레지스터 토큰'을 두어 청크 사이로 추론 상태를 넘기는 방법을 제안함

마스크드 확산 언어모델에 고정 크기 '레지스터 토큰'을 두어 청크 사이로 추론 상태를 넘기는 방법을 제안함. 이산 텍스트로 상태를 넘기는 방식 대비 수학 최대 +8.5점, 코드 최대 +19.5점이며 LLaDA·Dream 양쪽 모든 벤치마크에서 우위. 앞 내용을 버린 뒤에도 생성을 이어갈 수 있어 여러 청크에 걸치는 코드 생성에 특히 유효하고, 장기 추론 과제 강화학습으로 더 다듬을 수 있음.

왜 중요한가

확산 언어모델의 고질적 한계였던 '청크 경계에서 상태가 끊긴다'를 아키텍처로 푼 사례. 관찰 주제 「확산 언어모델」이 누적 10건을 넘긴 시점에 나온 실질 진전이다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.163722026년 9월 21일에 더한 조각 · 그 주 보기