한국어EN
모델 아키텍처·학습 기법Yifan Zhang 외 (Mengdi Wang·Quanquan Gu·Andrew Chi-Chih Yao 등 공저)

Fast Weight Attention for Continual Learning 공개

Fast Weight Attention for Continual Learning 공개 — 순환 fast-weight 메모리와 선택적 상태공간 모델이 상태 전이를 온라인 학습 규칙으로 만든다는 관점에서, read-after-write 자기회귀 의미론 아래 접두사 예측 목적함수에서 t 시점에 드러나는 지역 fast-memory 예시는 접두사 정렬 쌍 (φ(k_{t-1}), v_t)이며 통상 쓰이는 동일 시점 연관 (φ(k_t), v_t)은 인과적이긴 하나 다른 내부 목적을 최적화한다고 주장. 제곱오차 회귀와 음의 내적 목적에 대한 정규화 1차 갱신식을 유도해 Falcon-1(스칼라 NLMS)·Falcon-2(열별 확장)·Falcon-3(슬라이딩 윈도 미니배치)와 내적 변형 Falcon-1A/2A/3A를 정의하고, 순환·마스크 병렬·청크 병렬 형태와 수치 안정적인 양의 감쇠 재정규화를 함께 제시

왜 중요한가

DeltaNet·Mamba 계열의 상태 갱신 규칙을 '무엇을 언제 연관시키는가'라는 시간 정렬 문제로 재정식화해, 시간 정렬·가소성·망각·유계 리허설을 분리 가능한 설계 축으로 만든 프레임워크. 저자 자체 보고로 대표 변형이 언어모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에서 길이 외삽을 개선.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2608.277632026년 8월 31일에 더한 조각 · 그 주 보기