한국어EN
AI 인프라 소프트웨어Tri Dao (프린스턴)

FlashAttention-2 발표

FlashAttention-2 발표 — FlashAttention 대비 2배, A100 이론 FLOPs/s의 50~73%, 학습에서 A100당 최대 225 TFLOPs/s

왜 중요한가

긴 컨텍스트 학습의 실질적 비용을 반감. 32K~128K 컨텍스트 모델이 경제적으로 가능해진 전제

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2307.086912026년 8월 24일에 더한 조각 · 그 주 보기