추론 인프라·서빙DeepSeek-AI
DeepSeek-V4.1-Flash 공개
DeepSeek-V4.1-Flash 공개 — 552B 백본·100만 토큰 컨텍스트의 멀티모달 MoE 로, 디코드 시 토큰당 16B·프리필 시 8B 만 활성화한다. Compressed Sparse Attention 2(CSA2)·FP4 KV 캐시·SWA Bounded Replay 로 전역 KV 캐시를 토큰당 890바이트(DeepSeek-V4-Flash 의 약 1/4)까지, 영구 저장 KV 풋프린트는 약 1/8 까지 줄였다. 멀티모달 코퍼스 45T 토큰으로 사전학습했고 자사 주장으로 캐시를 줄이고도 기준선보다 성능이 크게 낫다고 함.
왜 중요한가
에이전트 워크로드의 병목이 연산이 아니라 KV 캐시의 저장·대역폭으로 옮겨갔다는 진단을 모델 설계 전체로 밀어붙인 사례. 프리필과 디코드에 서로 다른 활성 파라미터를 쓰는 구성이 특히 새롭다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.199692026년 9월 21일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.18업데이트를 원자적(atomic)으로 바꿈공식 발표09.18Grok Voice Transcribe 2.0 공개공식 발표09.18임베디드 평가 파트너십 발표공식 발표09.18호주 청소년 안전 청사진(Australian Youth Safety Blueprint) 공개공식 발표