한국어EN
추론 인프라·서빙vLLM

계층형 KV 캐시 오프로딩(Tiered KV Cache Offloading) 프레임워크를 공개함

계층형 KV 캐시 오프로딩(Tiered KV Cache Offloading) 프레임워크를 공개함. 모든 KV 가 호스트 DRAM 을 경유하는 호스트 중심 설계로, 축출된 KV 를 재계산하는 대신 파일시스템(콘텐츠 주소 기반 명명으로 자동 공유)·S3 호환 오브젝트 스토리지·ZMQ 조율과 RDMA 전송을 쓰는 피어-투-피어 등 세 종류 보조 계층에 보존함. 자사 주장으로 Qwen3.6-35B-A3B 를 H100 2장에서 측정했을 때 동시 대화 128개를 넘는 구간에서 대안 대비 처리량이 2배 이상이었으며, vLLM v0.22 부터 제공됨.

왜 중요한가

장기 멀티턴·에이전트 워크로드가 표준이 되면서 KV 캐시가 GPU 메모리를 넘어 스토리지 계층으로 확장되는 추론 아키텍처 전환이다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표vllm.aihttps://vllm.ai/blog/2026-09-10-tiered-kv-offloading2026년 9월 14일에 더한 조각 · 그 주 보기