추론 인프라·서빙vLLM
계층형 KV 캐시 오프로딩(Tiered KV Cache Offloading) 프레임워크를 공개함
계층형 KV 캐시 오프로딩(Tiered KV Cache Offloading) 프레임워크를 공개함. 모든 KV 가 호스트 DRAM 을 경유하는 호스트 중심 설계로, 축출된 KV 를 재계산하는 대신 파일시스템(콘텐츠 주소 기반 명명으로 자동 공유)·S3 호환 오브젝트 스토리지·ZMQ 조율과 RDMA 전송을 쓰는 피어-투-피어 등 세 종류 보조 계층에 보존함. 자사 주장으로 Qwen3.6-35B-A3B 를 H100 2장에서 측정했을 때 동시 대화 128개를 넘는 구간에서 대안 대비 처리량이 2배 이상이었으며, vLLM v0.22 부터 제공됨.
왜 중요한가
장기 멀티턴·에이전트 워크로드가 표준이 되면서 KV 캐시가 GPU 메모리를 넘어 스토리지 계층으로 확장되는 추론 아키텍처 전환이다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표vllm.aihttps://vllm.ai/blog/2026-09-10-tiered-kv-offloading2026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문