모델 아키텍처·학습 기법Albert Ge 외 (Microsoft Research·UW–Madison)
마스크드 확산 언어모델에 고정 크기 '레지스터 토큰'을 두어 청크 사이로 추론 상태를 넘기는 방법을 제안함
마스크드 확산 언어모델에 고정 크기 '레지스터 토큰'을 두어 청크 사이로 추론 상태를 넘기는 방법을 제안함. 이산 텍스트로 상태를 넘기는 방식 대비 수학 최대 +8.5점, 코드 최대 +19.5점이며 LLaDA·Dream 양쪽 모든 벤치마크에서 우위. 앞 내용을 버린 뒤에도 생성을 이어갈 수 있어 여러 청크에 걸치는 코드 생성에 특히 유효하고, 장기 추론 과제 강화학습으로 더 다듬을 수 있음.
왜 중요한가
확산 언어모델의 고질적 한계였던 '청크 경계에서 상태가 끊긴다'를 아키텍처로 푼 사례. 관찰 주제 「확산 언어모델」이 누적 10건을 넘긴 시점에 나온 실질 진전이다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.163722026년 9월 21일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.18업데이트를 원자적(atomic)으로 바꿈공식 발표09.18Grok Voice Transcribe 2.0 공개공식 발표09.18임베디드 평가 파트너십 발표공식 발표09.18호주 청소년 안전 청사진(Australian Youth Safety Blueprint) 공개공식 발표