한국어EN
학습 데이터·후속학습Nous Research

Hermes 4.3 36B 공개

Hermes 4.3 36B 공개 — 동일 모델을 중앙집중식(FSDP+AdamW)과 Psyche(TP+DisTrO) 양쪽으로 학습해 비교. Psyche 런은 24노드 평균 144k tok/s로 완주했고 다운스트림 성능에서 중앙집중식을 상회

왜 중요한가

분산학습이 가능하다를 넘어 동등 이상이라는 통제 비교를 처음 제시

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 공식 발표nousresearch.comhttps://nousresearch.com/introducing-hermes-4-3/2026년 8월 24일에 더한 조각 · 그 주 보기