AI 인프라 소프트웨어Guowei Wang 외
AInfer-PD 공개
AInfer-PD 공개 — 에이전틱 RL에서 각 궤적이 생성과 환경 상호작용을 여러 턴 오가며 비동기로 진행되므로 프리필(P)과 디코드(D)의 공존이 일회성 프롬프트 처리 사건이 아니라 롤아웃의 지속적 속성이 된다고 지적하고, 분산 MoE 롤아웃까지 in-place P/D 멀티플렉싱을 확장. 랭크 간 P/D 집합 통신 순서를 조율하고 DeepEP의 P·D 경로에 독립적인 통신 상태를 부여해 교차하는 ADP/ATP·DeepEP 경로의 동시 실행을 안전하게 만들면서 모델 가중치와 KV 저장은 공유. 단일 노드 프리필 집약 워크로드에서 P/D 멀티플렉싱을 끈 동일 엔진 대비 7.1~22.5%, SGLang 대비 24.8~32.9% 롤아웃 완료 시간을 줄였고 2노드에서는 각각 18.0~35.3%·18.3~31.8%라고 보고
왜 중요한가
별도 디바이스 풀과 KV 캐시 전송을 요구하는 P/D 분리(disaggregation) 대신, 가중치와 KV를 공유한 채 집합 통신 순서와 상태만 격리해 같은 디바이스에서 P/D를 겹치는 갈래. 서빙 인프라의 병목이 추론 서비스에서 RL 롤아웃으로 옮겨간 사례이기도 하다. 수치는 저자 자체 보고.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
논문arxiv.orghttps://arxiv.org/abs/2609.009932026년 8월 31일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.04'Formalizing Fermat's Last Theorem' 공개공식 발표09.03Grok Bot 기업용 제공 시작공식 발표09.03GPT-6 Astra 공개공식 발표09.03Random Attention 공개논문