GLM 5.3 최적화 1편으로 Hybrid HiSparse 오프로딩을 공개함
GLM 5.3 최적화 1편으로 Hybrid HiSparse 오프로딩을 공개함. HiSparse 는 자주 접근되는 토큰은 GPU 에 두고 콜드 데이터는 CPU 로 내리는 압력 구동형 메모리 계층으로, GPU 메모리가 실제로 부족해질 때만 오프로딩이 발동해 요청을 선점하지 않고 디코딩을 이어 감. H200 8장 노드에서 100만 토큰 컨텍스트 서빙을 목표로 하며, 자사 주장으로 초기 턴 평균 74,160토큰·후속 턴 753토큰의 13턴 OpenHands 에이전트 워크로드에서 384GiB HiSparse 풀 + 128GiB 오프로딩 풀 구성이 기존 512GiB 오프로딩보다 높은 동시 처리량을 보였다고 밝힘. 게시 시점 미출시이며 vLLM v0.30 일반 제공 예정이라고 명시함.
왜 중요한가
100만 토큰급 컨텍스트를 단일 노드에서 감당하려는 시도로, 장문맥 에이전트의 메모리 병목 해법이 희소 어텐션과 계층 메모리의 결합으로 수렴하고 있다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표vllm.aihttps://vllm.ai/blog/2026-09-08-glm53-part1-hybrid-sparse-offloading2026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문