한국어EN
평가·벤치마크vLLM발언·성명

SemiAnalysis 의 실제 에이전트 코딩 트레이스를 기반으로 한 공개 벤치마크 AgentX 에 맞춘 최…

SemiAnalysis 의 실제 에이전트 코딩 트레이스를 기반으로 한 공개 벤치마크 AgentX 에 맞춘 최적화 결과를 발표함. AgentX 워크로드는 중앙값 43턴, 입력 중앙값 142K 토큰·출력 444 토큰, 프리픽스 캐시 적중률 96% 이상이 특징임. KV 캐시 관리·병렬화 전략·prefill/decode 분리 세 층을 최적화해 자사 주장으로 DeepSeek V4 Pro 는 GB300 12장·동시 세션 256에서 GPU-초당 83K 토큰(P90 상호작용성 58.3 tok/s), MiniMax M3 는 B300 2장에서 70K TPGS(74.2 tok/s), Kimi K3 는 GB300 16장에서 11.8K TPGS(62.7 tok/s)를 기록함. Opus 5 API 대비 서빙 비용이 각각 106배·85배·14.6배 저렴하다고 주장하나 이는 96% 이상 캐시 적중률을 가정하고 Opus 의 캐시 쓰기 요금을 제외한 비교임.

왜 중요한가

에이전트 코딩이 추론 서빙의 대표 워크로드가 되면서 벤치마크의 목표 자체가 단발 처리량에서 장기 멀티턴 세션 경제성으로 옮겨 갔다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표vllm.aihttps://vllm.ai/blog/2026-09-08-vllm-agentx2026년 9월 14일에 더한 조각 · 그 주 보기