AMD Instinct MI355X 에서 MiniMax M3 를 최적화한 성능 엔지니어링 결과를 공개함
AMD Instinct MI355X 에서 MiniMax M3 를 최적화한 성능 엔지니어링 결과를 공개함. 자사 주장으로 MXFP8 동시성 32에서 3.14배(GPU당 342.4 tok/s), 동시성 128에서 2.09배(623.7 tok/s), MXFP4(TP2/EP1)에서 4.45배(943.5 tok/s) 가속을 달성했고 Prefill/Decode 분리 구성에서 총 6,370.5 tok/s/GPU 를 기록함. 공유 전문가를 라우팅 전문가 경로에 융합해 저동시성 구간 커널 런치를 30.2% 줄이고, 128토큰 블록 희소 어텐션을 16토큰 페이지에 맞추는 compact page table 로 KV 캐시 복사를 없앴으며, AITER 희소 어텐션을 다중 토큰 검증으로 확장해 투기적 디코딩 처리량을 7.9~8.3% 개선함.
왜 중요한가
주요 오픈 추론 엔진에서 AMD GPU 가 NVIDIA 외 실질적 대안으로 최적화되는 과정을 구체적 수치로 남긴 기록이다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표vllm.aihttps://vllm.ai/blog/2026-09-10-minimax-m3-mi355x2026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문