학습 데이터·후속학습Nous Research
Hermes 4.3 36B 공개
Hermes 4.3 36B 공개 — 동일 모델을 중앙집중식(FSDP+AdamW)과 Psyche(TP+DisTrO) 양쪽으로 학습해 비교. Psyche 런은 24노드 평균 144k tok/s로 완주했고 다운스트림 성능에서 중앙집중식을 상회
왜 중요한가
분산학습이 가능하다를 넘어 동등 이상이라는 통제 비교를 처음 제시
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표nousresearch.comhttps://nousresearch.com/introducing-hermes-4-3/2026년 8월 24일에 더한 조각 · 그 주 보기
같은 주에 나온 조각12.05ARC Prize 2025 결과공식 발표12.04Titans와 이를 일반화한 이론틀 MIRAS 소개공식 발표12.02Mistral 3 패밀리 공개공식 발표