한국어EN
멀티모달SenseTime

인코더 없이·VAE 없이 시각 이해·추론·생성을 하나의 구조에서 처리하는 8B-MoT 네이티브 통합 멀티모달…

인코더 없이·VAE 없이 시각 이해·추론·생성을 하나의 구조에서 처리하는 8B-MoT 네이티브 통합 멀티모달 모델 SenseNova-U1.5 를 공개함. 공간적으로 일관된 패치 재구성으로 시각 인터페이스를 강화하고, 선별된 생성·편집 데이터와 개선된 태스크 정식화, 구조적 프롬프트 강화, 최대 4K 네이티브 해상도로 학습을 확장함. Post-training 에서는 시각적 심미성·이중언어 텍스트 렌더링·인포그래픽 생성·이미지 편집용 전문가를 각각 최적화한 뒤 multi-expert on-policy distillation 으로 통합함. 자사 주장으로 이미지 충실도·텍스트 렌더링·복합 구성·다중 참조 편집·인터리브드 생성에서 크게 향상됐다고 밝히며 SFT·RL·on-policy distillation 학습 코드를 오픈소스화할 예정이라고 함.

왜 중요한가

별도 비전 인코더와 VAE 를 모두 없앤 완전 end-to-end 통합 구조가 실용 성능에 도달했음을 보여, 멀티모달 통합 모델의 표준 설계가 바뀔 가능성을 시사한다.

출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요 논문arxiv.orghttps://arxiv.org/abs/2609.119292026년 9월 14일에 더한 조각 · 그 주 보기