한국어EN
추론 인프라·서빙Tenstorrent

vLLM TT 플러그인을 공개함

vLLM TT 플러그인을 공개함. vLLM 의 아웃오브트리 플랫폼 플러그인 메커니즘을 써서 ttnn 라이브러리가 있으면 Tenstorrent 가속기를 자동 등록하며 OpenAI 호환 API 를 그대로 유지함. Llama 3.1~3.3, Qwen 2.5~3.6, Mistral, Gemma 3~4, DeepSeek V3 및 멀티모달 변형을 지원하되 모델 구현체는 플러그인이 아니라 TT-Metal 에 둠. 프리필 전용·디코드 전용으로 나눈 단계 기반 스케줄링, Galaxy 시스템용 단일 프로세스 레인 데이터 병렬, 온디바이스 샘플링, 비동기 리드백이 GPU 서빙과의 주요 차이이며 투기적 디코딩·LoRA·prompt logprobs·멀티호스트 서빙은 미지원임. 성능 수치는 제시하지 않음.

왜 중요한가

vLLM 코어를 건드리지 않는 플러그인 방식으로 비주류 가속기가 주류 추론 스택에 편입되는 경로를 보여, 하드웨어 다변화의 진입 장벽이 낮아지고 있다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표vllm.aihttps://vllm.ai/blog/2026-09-07-vllm-tt-plugin2026년 9월 14일에 더한 조각 · 그 주 보기