모델 아키텍처·학습 기법Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
Sliding-window beats linear attention 공개
Sliding-window beats linear attention 공개 — 기존 LLM을 선형 어텐션으로 개조(retrofit)하는 연구 갈래가 더 단순한 기준선과 제대로 비교된 적이 없다고 지적하고, 싱크를 둔 슬라이딩 윈도 어텐션(SWA)이 여러 LLM과 다양한 다운스트림 과제에서 후속학습된 선형 어텐션 모델과 같거나 더 낫다고 보고. Needle-in-a-Haystack·BABILong 등 장문맥 추론 과제에서는 SWA가 선형 어텐션 대비 2~10배 높은 성능을 냈고, SWA는 후속학습이 필요 없으며 매우 빠르고 메모리도 적게 쓴다고 주장
왜 중요한가
이차 스케일링 해법으로 각광받던 선형 어텐션 개조 갈래에 대해 '후속학습이 필요 없는 슬라이딩 윈도로 충분하다'는 기준선을 세운 반증 논문 — 선형 어텐션 모델은 처음부터 학습하거나 광범위한 후속학습을 거쳐야 겨우 SWA를 따라잡을 것이라고 저자들이 결론. 수치는 저자 자체 보고.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2608.284442026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각08.30Agent Zero Memory 공개논문08.28'Automated researchers can reliably mitigate alignment failu…공식 발표08.27Model Hardware Standard(MHS) 리서치 프리뷰 공개공식 발표08.27Gemini Omni 1.1 Flash 제공공식 발표