추론 인프라·서빙Cohere
자사 코드 모델 North Mini Code(총 30B·활성 3.3B)용 디코드 메가커널 서빙 엔진을 공개함
자사 코드 모델 North Mini Code(총 30B·활성 3.3B)용 디코드 메가커널 서빙 엔진을 공개함. 디코드 경로 전체를 dense GEMM·어텐션·MoE 라우팅 등 16개 opcode 를 담은 단일 persistent CUDA 커널로 합치고 continuous batching·paged attention·ragged sequence length·OpenAI 호환 엔드포인트·tool calling 까지 얹어 '메가커널 기반 최초의 완전한 서빙 시스템'이라고 자사 주장함. 자사 주장 수치로 H100 1장·배치 1에서 292 tok/s(SoL 의 62%)로 vLLM 185 tok/s 대비 1.58배, 종단간 평균 디코드 처리량 1.25~1.41배이며 256K 컨텍스트까지 정확도 손실이 없다고 밝힘(SciCode 38.9% 대 38.2%).
왜 중요한가
추론 최적화 경쟁이 스케줄러·배치에서 GPU 커널 재설계 층위로 내려갔음을 보여주는 사례다.
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표cohere.comhttps://cohere.com/blog/megakernels2026년 9월 14일에 더한 조각 · 그 주 보기
같은 주에 나온 조각09.11'Scaling Storage for 1 Billion ChatGPT Users (Part I)' 공개공식 발표09.10Agents API 퍼블릭 베타 공개공식 발표09.10ChatGPT Work 에 Data agent 를 공개함공식 발표09.10클라우드 샌드박스에서 실제 셸을 과제당 300턴 이상 조작하며 각 과제 자체의 검증기로 보상을 받는 122B…논문